- Siz şunu söylediniz
- Sözleşme bizim için bağlayıcı değil
- Makine şunu yazdı
- Sözleşme bizim için bağlayıcı
değil
Düşen tek bir kelime, hukuk ekibi için bambaşka bir öğleden sonra.
1 silme ÷ 5 kelime = %20 WER — ve anlamın %100'ü
Her transkripsiyon doğruluğu iddiasının arkasındaki sayı — nasıl hesaplandığı, neyi gizlediği ve kendi ses kayıtlarınızda nasıl ölçüleceği.
Kelime hata oranı — WER — bir otomatik konuşma tanıma (ASR) sisteminin performansını ölçmenin standart yoludur. Makinenin ürettiği transkripti, özenle hazırlanmış insan referans transkriptiyle karşılaştırır ve üç tür hatayı sayar: değiştirmeler, silmeler ve eklemeler. Bunu ölçmek kulağa geldiğinden daha zordur, çünkü ASR sonucu, söylenen girdiden farklı bir uzunlukta olabilir.
İşte WER'in nasıl hesaplandığını anlamanın basit bir yolu:

%5'lik bir WER, kabaca her yirmi kelimede bir hata anlamına gelir — tersinden ifade edildiğinde ise %95 doğruluk. Yine de sayılar soyuttur. İşte her hata türü gerçek zararını verirken:
Düşen tek bir kelime, hukuk ekibi için bambaşka bir öğleden sonra.
1 silme ÷ 5 kelime = %20 WER — ve anlamın %100'ü
Aynı küçük kelime, davetsiz geldi. Yatırımcılar kısa süreliğine yıkıldı.
1 ekleme ÷ 4 kelime = %25 WER
Bir sesli harf, bir odun parçasıyla oldukça tuhaf bir davet arasındaki fark.
1 değiştirme ÷ 5 kelime = %20 WER
Neyin hata sayıldığını öğrendiğinize göre, hesabı yapın. Referans transkriptinizin uzunluğunu ayarlayın, bulduğunuz hataları sürükleyip bırakın ve kelime hata oranının nasıl değiştiğini izleyin — okuyacağınız her doğruluk iddiasının arkasındaki aritmetik tam olarak budur.
≈ her 50 kelimede bir hata
Temiz ses bölgesi — hızlı bir göz gezdirmeyle yayına hazır.
Matematik, canlı olarak: (6 + 3 + 1) ÷ 500 = 2.0%
Konuşma tanıma, 1950'lerden bu yana çok yol katetti — kısa konuşma tanıma tarihimiz buraya kadar gelen yolu anlatıyor. 2017'ye gelindiğinde en büyük teknoloji şirketleri, kaydedilmiş telefon görüşmelerinden oluşan standart bir kıyaslama ölçütüne karşı WER üzerinde herkesin gözü önünde yarışıyordu:
Mart 2017: IBM 5,5% kelime hata oranı iddia ediyor
Mayıs 2017: Google 4,9% kelime hata oranı iddia ediyor
Ağustos 2017: Microsoft 5,1% kelime hata oranı iddia ediyor
Bu duyurular önemliydi, çünkü aynı kıyaslama ölçütünde profesyonel insan deşifre uzmanlarının hata oranına yaklaşıyorlardı — sektörün "insan denkliği" dediği an. Ancak temiz kıyaslama ölçütlerindeki yarış, fiilen birbirine benzeyen sayıların oluşturduğu bir kalabalıkta sona erdi. Özenle kaydedilmiş, tek alanlı test setlerinde her ciddi modern motor iyi puan alıyor — işte tam da bu yüzden kıyaslama WER'i artık ilginç bir soru olmaktan çıktı.
Transkripsiyon sistemleri arasındaki gerçek farklar artık başka yerde ortaya çıkıyor: uzak alan toplantı sesinde, üst üste binen konuşmacılarda, ağır aksanlarda, özel terminolojide ve gürültülü gerçek dünya kayıtlarında. Kıyaslama puanları neredeyse aynı olan iki motor, Salı günkü konferans görüşmenizde çok farklı davranabilir — işte bu yüzden önemli olan tek karşılaştırma, kendi ses kayıtlarınızda yaptığınız karşılaştırmadır.
WER yalnızca kelime hatalarını sayar, başka hiçbir şeyi değil — ve bir transkripti kullanışlı kılan şeylerin çoğu onun için görünmezdir. Noktalama ve büyük harf kullanımı puanlanmaz: kusursuzca tanınmış ama noktalanmamış bir kelime yığını mükemmel bir WER puanı alabilirken okuması bir işkence olabilir. Konuşmacı ataması da puanlanmaz — WER açısından bakıldığında, doğru kelimeleri yanlış kişinin ağzına koymak bedavadır. Sayılar, tarihler ve isimler diğer herhangi bir kelime gibi puanlanır, oysa "MRSA" ya da "3. çeyrek geliri" ifadesini yanlış yazmak, genellikle düşürülmüş bir "ve"den çok daha pahalıya patlar.
İşte bu yüzden, hata oranı biraz daha yüksek ama noktalaması, paragrafları ve konuşmacı etiketleri temiz bir transkript, çoğu zaman yapıdan yoksun ama teknik olarak "daha doğru" olan bir transkriptten daha kullanışlıdır. Transkripsiyon kalitesini değerlendirirken, çıktıyı yalnızca bir kelime sayımı olarak değil, bir belge olarak okuyun — ve hataları sayılarına göre değil, size neye mal olacaklarına göre tartın.
Her satıcının pazarlama sayısını görmezden gelin, bizimki de dahil — asıl önemli olan test yaklaşık bir saatinizi alır. İşinizi gerçekten temsil eden on dakikalık bir ses seçin: toplantı odalarınız, görüştüğünüz kişiler, jargonunuz. Bunun özenli bir referans transkriptini hazırlayın (yavaş kısım budur — referansın doğru olması gerekir). Ardından aynı klibi değerlendirdiğiniz her hizmetten geçirin ve referansınıza karşı değiştirmeleri, silmeleri ve eklemeleri sayın.
İki pratik uyarı. Birincisi, saymadan önce normalleştirin: "OK" ile "okay", rakamlar ile yazıyla yazılmış sayılar ya da dolgu kelimelerinin hata sayılıp sayılmayacağına baştan karar verin ve aynı kuralları her motora uygulayın — kendi yaptığınız karşılaştırmaların çoğu, sayımda değil burada yanlışa gider. İkincisi, hata oranıyla yetinmeyin: her motorun ne tür kelimeleri kaçırdığını ve çıktının gerçekte ne kadar temizlik gerektirdiğini not edin. Neredeyse aynı derecede işe yarayan bir kısayol: klibi her yerde deşifre edin, her transkripti yayın kalitesine getirin ve temizliği süreleyin. Kendi ses kayıtlarınızda size en az düzeltmeye mal olan motor, kıyaslamalar ne derse desin, doğru olanıdır.
Sonix "%99'a varan doğruluk" dediğinde, bu sayı net, iyi kaydedilmiş sesi tanımlar — yakın mikrofonlar, asgari arka plan gürültüsü, aynı anda tek konuşmacı. Bu koşullar altında dürüst bir sayıdır ve her satıcının manşet sayısı, belirtsin ya da belirtmesin aynı ince yazıyı taşır. Doğruluk; gürültü, mesafe, üst üste konuşma ve ağır sıkıştırmayla düşer; hiçbir motor bundan muaf değildir, çünkü tavanı sesin fiziği belirler.
O halde herhangi bir doğruluk iddiasını ideal koşullara dair bir iddia olarak görün ve önemli olan kıyaslama ölçütü olarak kendi kayıtlarınızı alın. Sesi iyileştirmek — daha yakın bir mikrofon, daha sessiz bir oda, aynı anda tek ses — kelime hata oranınız için, herhangi iki modern motor arasında geçiş yapmaktan daha fazlasını yapacaktır. Ve bundan sonra geriye ne kalırsa, şüpheli bir kelimeye tıklayıp arkasındaki sesi dinlemenizi sağlayan senkronize bir düzenleyici, ölçülen doğruluk ile yayımlayabileceğiniz bir transkript arasındaki boşluğu kapatan şeydir.
Sonix, medya dosyalarınızı arayabilmeniz, düzenleyebilmeniz ve paylaşabilmeniz için ses ve video dosyalarınızı deşifre eder, zaman damgalarını ekler ve organize eder.
30 minutes dakikalık ücretsiz deşifre içerir
54+ dilde yapay zeka transkripsiyonu ve çevirisi.