- U zei
- Teken het contract niet
- De machine schreef
- Teken het contract
niet
Eén weggevallen woord, een heel andere middag voor het juridische team.
1 weglating ÷ 4 woorden = 25% WER — en 100% van de betekenis
Het cijfer achter elke claim over transcriptienauwkeurigheid — hoe het wordt berekend, wat het verbergt en hoe u het op uw eigen audio meet.
Word error rate — WER — is de standaardmanier om de prestaties van een automatisch spraakherkenningssysteem (ASR) te meten. Het vergelijkt het transcript van de machine met een zorgvuldig opgesteld menselijk referentietranscript en telt drie soorten fouten: substituties, weglatingen en invoegingen. Het meten is lastiger dan het klinkt, want het ASR-resultaat kan een andere lengte hebben dan de gesproken invoer.
Hier is een eenvoudige manier om te begrijpen hoe WER wordt berekend:

Een WER van 5% betekent ongeveer één fout op elke twintig woorden — omgekeerd uitgedrukt: 95% nauwkeurigheid. Cijfers zijn abstract, dat wel. Hier richt elk fouttype echte schade aan:
Eén weggevallen woord, een heel andere middag voor het juridische team.
1 weglating ÷ 4 woorden = 25% WER — en 100% van de betekenis
Hetzelfde kleine woordje, ongevraagd binnengeglipt. Investeerders even kapot.
1 invoeging ÷ 4 woorden = 25% WER
Eén klinker tussen een gezellig feestje en een confrontatie met een wild dier.
1 substitutie ÷ 7 woorden = 14% WER
Nu u weet wat als fout telt, doet u de rekensom. Stel de lengte van uw referentietranscript in, sleep de gevonden fouten erin en zie de word error rate bewegen — dit is precies de rekenkunde achter elke nauwkeurigheidsclaim die u ooit zult lezen.
≈ één fout per 50 woorden
Schone-audioterrein — even doorlezen en het is klaar voor publicatie.
De rekensom, live: (6 + 3 + 1) ÷ 500 = 2.0%
Spraakherkenning heeft sinds de jaren vijftig een lange weg afgelegd — onze korte geschiedenis van spraakherkenning beschrijft die route. In 2017 waren de grootste technologiebedrijven openlijk met elkaar aan het wedijveren op WER, gemeten tegen een standaardbenchmark van opgenomen telefoongesprekken:
Mar 2017: IBM claimt 5.5% Word Error Rate
Mei 2017: Google claimt 4.9% Word Error Rate
Aug 2017: Microsoft claimt 5.1% Word Error Rate
Die aankondigingen deden ertoe omdat ze de foutmarge van professionele menselijke typisten op dezelfde benchmark benaderden — het moment dat de branche 'human parity' ging noemen. Maar de race op schone benchmarks eindigde feitelijk in een kluwen van vergelijkbare cijfers. Op zorgvuldig opgenomen testsets binnen één domein scoort elke serieuze moderne engine goed — precies daarom is benchmark-WER opgehouden de interessante vraag te zijn.
De echte verschillen tussen transcriptiesystemen laten zich nu elders zien: bij vergaderaudio op afstand, overlappende sprekers, zware accenten, gespecialiseerd jargon en rommelige opnamen uit de praktijk. Twee engines met vrijwel identieke benchmarkscores kunnen zich heel verschillend gedragen tijdens uw conference call op dinsdag — en daarom is de enige vergelijking die telt de vergelijking die u op uw eigen audio uitvoert.
WER telt woordfouten en verder niets — en veel van wat een transcript bruikbaar maakt, is er onzichtbaar voor. Interpunctie en hoofdletters worden niet meegeteld: een muur van perfect herkende woorden zonder interpunctie kan een uitstekende WER halen en tegelijk beroerd leesbaar zijn. Sprekertoewijzing telt evenmin mee — de juiste woorden in de mond van de verkeerde persoon leggen is gratis, wat WER betreft. Cijfers, datums en namen worden net zo geteld als elk ander woord, ook al kost het verkeerd horen van "MRSA" of "Q3-omzet" meestal veel meer dan een weggevallen "de".
Daarom is een transcript met een iets hogere foutmarge maar nette interpunctie, alinea's en sprekerlabels vaak bruikbaarder dan een technisch "nauwkeuriger" transcript zonder structuur. Beoordeel transcriptiekwaliteit door de uitvoer als document te lezen, niet enkel als een woordentelling — en weeg de fouten naar wat ze u zouden kosten, niet naar hoeveel het er zijn.
Negeer de marketingcijfers van elke leverancier, de onze incluis — de test die telt kost ongeveer een uur. Kies tien minuten audio die uw werk echt representeren: uw vergaderruimtes, uw geïnterviewden, uw jargon. Maak er een zorgvuldig referentietranscript van (dit is het trage deel — de referentie moet kloppen). Draai dezelfde clip vervolgens door elke dienst die u overweegt en tel de substituties, weglatingen en invoegingen ten opzichte van uw referentie.
Twee praktische waarschuwingen. Ten eerste: normaliseer vóór u telt. Bepaal vooraf of "OK" en "oké", cijfers en voluit geschreven getallen, of stopwoorden als fouten meetellen, en pas dezelfde regels toe op elke engine — hier gaat het bij de meeste doe-het-zelfvergelijkingen mis, niet bij het tellen zelf. Ten tweede: stop niet bij de foutmarge. Noteer wat voor soort woorden elke engine miste en hoeveel opschoonwerk de uitvoer werkelijk vergde. Een kortere weg die bijna net zo goed werkt: transcribeer de clip overal, werk elk transcript bij tot publicatiekwaliteit en klok het opschonen. De engine die u op uw audio de minste correcties kost, is de nauwkeurige — wat de benchmarks ook zeggen.
Wanneer Sonix zegt "tot 99% nauwkeurigheid", beschrijft dat cijfer heldere, goed opgenomen audio — microfoons dichtbij, minimaal achtergrondgeluid, één spreker tegelijk. Onder die omstandigheden is het een eerlijk cijfer, en het kopcijfer van elke leverancier draagt dezelfde kleine lettertjes, of ze het nu vermelden of niet. Nauwkeurigheid neemt af bij ruis, afstand, door elkaar praten en zware compressie; geen enkele engine ontkomt eraan, want de fysica van de audio bepaalt het plafond.
Behandel elke nauwkeurigheidsclaim dus als een claim over ideale omstandigheden, en beschouw uw eigen opnamen als de benchmark die telt. De audio verbeteren — een microfoon dichterbij, een stillere ruimte, één stem tegelijk — doet meer voor uw word error rate dan wisselen tussen willekeurig welke twee moderne engines. En wat daarna overblijft: een gesynchroniseerde editor waarin u op een verdacht woord klikt en de audio erachter hoort, is wat de kloof dicht tussen gemeten nauwkeurigheid en een transcript dat u kunt publiceren.
Sonix transcribeert, tijdstempelt en organiseert je audio- en videobestanden, zodat je je media kunt doorzoeken, bewerken en delen.
Inclusief 30 minutes minuten gratis transcriptie
AI transcriptie en vertaling in 54+ talen.