Kelime hata oranı nedir
kelime hata oranı?

Her transkripsiyon doğruluğu iddiasının arkasındaki sayı — nasıl hesaplandığı, neyi gizlediği ve kendi ses kayıtlarınızda nasıl ölçüleceği.

Kelime hata oranı formülü

Kelime hata oranı — WER — bir otomatik konuşma tanıma (ASR) sisteminin performansını ölçmenin standart yoludur. Makinenin ürettiği transkripti, özenle hazırlanmış insan referans transkriptiyle karşılaştırır ve üç tür hatayı sayar: değiştirmeler, silmeler ve eklemeler. Bunu ölçmek kulağa geldiğinden daha zordur, çünkü ASR sonucu, söylenen girdiden farklı bir uzunlukta olabilir.

İşte WER'in nasıl hesaplandığını anlamanın basit bir yolu:

Sonix - Kelime Hata Oranı Formülü

%5'lik bir WER, kabaca her yirmi kelimede bir hata anlamına gelir — tersinden ifade edildiğinde ise %95 doğruluk. Yine de sayılar soyuttur. İşte her hata türü gerçek zararını verirken:

Silme1 kelime kayboldu
Siz şunu söylediniz
Sözleşme bizim için bağlayıcı değil
Makine şunu yazdı
Sözleşme bizim için bağlayıcı değil

Düşen tek bir kelime, hukuk ekibi için bambaşka bir öğleden sonra.

1 silme ÷ 5 kelime = %20 WER — ve anlamın %100'ü

Ekleme1 kelime eklendi
Siz şunu söylediniz
İlk sonuçlar umut verici
Makine şunu yazdı
İlk sonuçlar umut verici değil

Aynı küçük kelime, davetsiz geldi. Yatırımcılar kısa süreliğine yıkıldı.

1 ekleme ÷ 4 kelime = %25 WER

Değiştirme1 kelime değişti
Siz şunu söylediniz
Kamp alanına bir dal getir
Makine şunu yazdı
Kamp alanına bir dal dul getir

Bir sesli harf, bir odun parçasıyla oldukça tuhaf bir davet arasındaki fark.

1 değiştirme ÷ 5 kelime = %20 WER

WER hesaplayıcı: formülü kendiniz deneyin

Neyin hata sayıldığını öğrendiğinize göre, hesabı yapın. Referans transkriptinizin uzunluğunu ayarlayın, bulduğunuz hataları sürükleyip bırakın ve kelime hata oranının nasıl değiştiğini izleyin — okuyacağınız her doğruluk iddiasının arkasındaki aritmetik tam olarak budur.

2.0%kelime hata oranı
98.0%doğruluk

≈ her 50 kelimede bir hata

Temiz ses bölgesi — hızlı bir göz gezdirmeyle yayına hazır.

Matematik, canlı olarak: (6 + 3 + 1) ÷ 500 = 2.0%

Doğruluk yarışı ve nerede son bulduğu

Konuşma tanıma, 1950'lerden bu yana çok yol katetti — kısa konuşma tanıma tarihimiz buraya kadar gelen yolu anlatıyor. 2017'ye gelindiğinde en büyük teknoloji şirketleri, kaydedilmiş telefon görüşmelerinden oluşan standart bir kıyaslama ölçütüne karşı WER üzerinde herkesin gözü önünde yarışıyordu:

Mart 2017: IBM 5,5% kelime hata oranı iddia ediyor
Mayıs 2017: Google 4,9% kelime hata oranı iddia ediyor
Ağustos 2017: Microsoft 5,1% kelime hata oranı iddia ediyor

Bu duyurular önemliydi, çünkü aynı kıyaslama ölçütünde profesyonel insan deşifre uzmanlarının hata oranına yaklaşıyorlardı — sektörün "insan denkliği" dediği an. Ancak temiz kıyaslama ölçütlerindeki yarış, fiilen birbirine benzeyen sayıların oluşturduğu bir kalabalıkta sona erdi. Özenle kaydedilmiş, tek alanlı test setlerinde her ciddi modern motor iyi puan alıyor — işte tam da bu yüzden kıyaslama WER'i artık ilginç bir soru olmaktan çıktı.

Transkripsiyon sistemleri arasındaki gerçek farklar artık başka yerde ortaya çıkıyor: uzak alan toplantı sesinde, üst üste binen konuşmacılarda, ağır aksanlarda, özel terminolojide ve gürültülü gerçek dünya kayıtlarında. Kıyaslama puanları neredeyse aynı olan iki motor, Salı günkü konferans görüşmenizde çok farklı davranabilir — işte bu yüzden önemli olan tek karşılaştırma, kendi ses kayıtlarınızda yaptığınız karşılaştırmadır.

WER'in ölçmediği şeyler

WER yalnızca kelime hatalarını sayar, başka hiçbir şeyi değil — ve bir transkripti kullanışlı kılan şeylerin çoğu onun için görünmezdir. Noktalama ve büyük harf kullanımı puanlanmaz: kusursuzca tanınmış ama noktalanmamış bir kelime yığını mükemmel bir WER puanı alabilirken okuması bir işkence olabilir. Konuşmacı ataması da puanlanmaz — WER açısından bakıldığında, doğru kelimeleri yanlış kişinin ağzına koymak bedavadır. Sayılar, tarihler ve isimler diğer herhangi bir kelime gibi puanlanır, oysa "MRSA" ya da "3. çeyrek geliri" ifadesini yanlış yazmak, genellikle düşürülmüş bir "ve"den çok daha pahalıya patlar.

İşte bu yüzden, hata oranı biraz daha yüksek ama noktalaması, paragrafları ve konuşmacı etiketleri temiz bir transkript, çoğu zaman yapıdan yoksun ama teknik olarak "daha doğru" olan bir transkriptten daha kullanışlıdır. Transkripsiyon kalitesini değerlendirirken, çıktıyı yalnızca bir kelime sayımı olarak değil, bir belge olarak okuyun — ve hataları sayılarına göre değil, size neye mal olacaklarına göre tartın.

Kendi WER testinizi nasıl yaparsınız

Her satıcının pazarlama sayısını görmezden gelin, bizimki de dahil — asıl önemli olan test yaklaşık bir saatinizi alır. İşinizi gerçekten temsil eden on dakikalık bir ses seçin: toplantı odalarınız, görüştüğünüz kişiler, jargonunuz. Bunun özenli bir referans transkriptini hazırlayın (yavaş kısım budur — referansın doğru olması gerekir). Ardından aynı klibi değerlendirdiğiniz her hizmetten geçirin ve referansınıza karşı değiştirmeleri, silmeleri ve eklemeleri sayın.

İki pratik uyarı. Birincisi, saymadan önce normalleştirin: "OK" ile "okay", rakamlar ile yazıyla yazılmış sayılar ya da dolgu kelimelerinin hata sayılıp sayılmayacağına baştan karar verin ve aynı kuralları her motora uygulayın — kendi yaptığınız karşılaştırmaların çoğu, sayımda değil burada yanlışa gider. İkincisi, hata oranıyla yetinmeyin: her motorun ne tür kelimeleri kaçırdığını ve çıktının gerçekte ne kadar temizlik gerektirdiğini not edin. Neredeyse aynı derecede işe yarayan bir kısayol: klibi her yerde deşifre edin, her transkripti yayın kalitesine getirin ve temizliği süreleyin. Kendi ses kayıtlarınızda size en az düzeltmeye mal olan motor, kıyaslamalar ne derse desin, doğru olanıdır.

Satıcıların doğruluk iddialarını okumak (bizimkiler dahil)

Sonix "%99'a varan doğruluk" dediğinde, bu sayı net, iyi kaydedilmiş sesi tanımlar — yakın mikrofonlar, asgari arka plan gürültüsü, aynı anda tek konuşmacı. Bu koşullar altında dürüst bir sayıdır ve her satıcının manşet sayısı, belirtsin ya da belirtmesin aynı ince yazıyı taşır. Doğruluk; gürültü, mesafe, üst üste konuşma ve ağır sıkıştırmayla düşer; hiçbir motor bundan muaf değildir, çünkü tavanı sesin fiziği belirler.

O halde herhangi bir doğruluk iddiasını ideal koşullara dair bir iddia olarak görün ve önemli olan kıyaslama ölçütü olarak kendi kayıtlarınızı alın. Sesi iyileştirmek — daha yakın bir mikrofon, daha sessiz bir oda, aynı anda tek ses — kelime hata oranınız için, herhangi iki modern motor arasında geçiş yapmaktan daha fazlasını yapacaktır. Ve bundan sonra geriye ne kalırsa, şüpheli bir kelimeye tıklayıp arkasındaki sesi dinlemenizi sağlayan senkronize bir düzenleyici, ölçülen doğruluk ile yayımlayabileceğiniz bir transkript arasındaki boşluğu kapatan şeydir.

Başlayın

Sonix'i ücretsiz deneyin

Sonix, medya dosyalarınızı arayabilmeniz, düzenleyebilmeniz ve paylaşabilmeniz için ses ve video dosyalarınızı deşifre eder, zaman damgalarını ekler ve organize eder.

30 minutes dakikalık ücretsiz deşifre içerir

Okumaya devam et

%99 doğruluk. Her kelime önemlidir.

54+ dilde yapay zeka transkripsiyonu ve çevirisi.

30 minutes ücretsiz
Kredi kartı gerekmez
İstediğiniz zaman iptal edin