Hvad er Word Error Rate?

Tallet bag ethvert udsagn om transskriptionsnøjagtighed — hvordan det beregnes, hvad det skjuler, og hvordan du måler det på din egen lyd.

Formel for Word Error Rate

Ordfejlrate — WER (word error rate) — er standardmåden at måle ydeevnen af et automatisk talegenkendelsessystem (ASR). Den sammenligner maskinens transskription med en omhyggeligt udarbejdet menneskelig referencetransskription og tæller tre typer fejl: substitutioner, udeladelser og indsættelser. At måle den er sværere, end det lyder, fordi ASR-resultatet kan have en anden længde end det talte input.

Her er en enkel måde at forstå, hvordan WER beregnes:

Sonix - Formel for Word Error Rate

En WER på 5% betyder groft sagt én fejl for hver tyve ord — sagt omvendt, 95% nøjagtighed. Tal er dog abstrakte. Her ser du hver fejltype gøre reel skade:

Udeladelse1 ord tabt
Du sagde
Du må ikke underskrive kontrakten
Maskinen skrev
Du må ikke underskrive kontrakten

Ét droppet ord, én meget anderledes eftermiddag for juridisk afdeling.

1 udeladelse ÷ 5 ord = 20% WER — og 100% af meningen

Indsættelse1 ord tilføjet
Du sagde
Resultaterne var ret lovende
Maskinen skrev
Resultaterne var ikke ret lovende

Det samme lille ord, der dukker uindbudt op. Investorerne kortvarigt knuste.

1 indsættelse ÷ 4 ord = 25% WER

Substitution1 ord byttet
Du sagde
Tag børnene med ud til lejren
Maskinen skrev
Tag børnene bjørnene med ud til lejren

Ét bogstav mellem en familietur og en episode med vilde dyr.

1 substitution ÷ 6 ord = 17% WER

WER-beregner: prøv formlen selv

Nu hvor du ved, hvad der tæller som en fejl, kan du regne på det. Indstil længden af din referencetransskription, træk de fundne fejl ind, og se ordfejlraten bevæge sig — det er præcis den regnemetode, der ligger bag ethvert nøjagtighedsudsagn, du nogensinde vil læse.

2.0%ordfejlrate
98.0%nøjagtighed

≈ én fejl for hver 50 ord

Ren lyd — et hurtigt gennemsyn, og den er klar til udgivelse.

Regnestykket, live: (6 + 3 + 1) ÷ 500 = 2.0%

Nøjagtighedskapløbet, og hvor det endte

Talegenkendelse er nået langt siden 1950'erne — vores korte historie om talegenkendelse dækker vejen hertil. I 2017 kappedes de største teknologivirksomheder offentligt om WER, målt mod en standardbenchmark af optagede telefonsamtaler:

Mar 2017: IBM hævder 5,5% Word Error Rate
Maj 2017: Google hævder 4,9% Word Error Rate
Aug 2017: Microsoft hævder 5,1% Word Error Rate

De meddelelser betød noget, fordi de nærmede sig fejlraten hos professionelle menneskelige transskribenter på samme benchmark — det øjeblik branchen kaldte "human parity" (menneskelig ligeværdighed). Men kapløbet på rene benchmarks endte reelt i en klynge af ens tal. På omhyggeligt optagede testsæt inden for ét enkelt domæne scorer enhver seriøs moderne motor godt — hvilket er præcis grunden til, at benchmark-WER holdt op med at være det interessante spørgsmål.

De reelle forskelle mellem transskriptionssystemer viser sig nu andetsteds: på mødelyd optaget på afstand, overlappende talere, kraftige accenter, specialiseret ordforråd og støjende optagelser fra den virkelige verden. To motorer med næsten identiske benchmark-scorer kan opføre sig meget forskelligt på din helt almindelige telefonkonference om tirsdagen — og derfor er den eneste sammenligning, der betyder noget, den du selv kører på din egen lyd.

Hvad WER ikke måler

WER tæller ordfejl og intet andet — og meget af det, der gør en transskription brugbar, er usynligt for den. Tegnsætning og store bogstaver bliver ikke scoret: en mur af perfekt genkendte ord uden tegnsætning kan opnå en fremragende WER, samtidig med at den er elendig at læse. Talerhenføring bliver heller ikke scoret — at lægge de rigtige ord i den forkerte persons mund er gratis, hvad WER angår. Tal, datoer og navne scores på samme måde som ethvert andet ord, selvom det at få "MRSA" eller "omsætning i 3. kvartal" forkert som regel koster langt mere end et droppet "den".

Derfor er en transskription med en lidt højere fejlrate, men ren tegnsætning, afsnit og talermærker, ofte mere brugbar end en teknisk set "mere nøjagtig" en uden struktur. Når du vurderer transskriptionskvalitet, så læs resultatet som et dokument, ikke bare som et ordtal — og vægt fejlene efter, hvad de ville koste dig, ikke efter hvor mange der er.

Sådan kører du din egen WER-test

Ignorér ethvert firmas marketingtal, inklusive vores — den test, der betyder noget, tager cirka en time. Vælg ti minutters lyd, der reelt repræsenterer dit arbejde: dine mødelokaler, dine interviewpersoner, dit fagsprog. Udarbejd en omhyggelig referencetransskription af den (det er den langsomme del — referencen skal være korrekt). Kør derefter det samme klip gennem hver tjeneste, du vurderer, og tæl substitutioner, udeladelser og indsættelser i forhold til din reference.

To praktiske advarsler. For det første: normalisér, før du tæller — beslut på forhånd, om "OK" og "okay", cifre og udskrevne tal eller fyldord skal tælle som fejl, og anvend de samme regler på hver motor — de fleste gør-det-selv-sammenligninger går galt her, ikke i optællingen. For det andet: stop ikke ved fejlraten — notér, hvilke typer ord hver motor overså, og hvor meget oprydning resultatet faktisk krævede. En genvej, der virker næsten lige så godt: transskribér klippet alle steder, ret hver transskription til udgivelsesklar kvalitet, og tag tid på oprydningen. Den motor, der koster dig færrest rettelser på din lyd, er den nøjagtige — uanset hvad benchmarks siger.

Sådan læser du firmaers nøjagtighedsudsagn (inklusive vores)

Når Sonix siger "op til 99% nøjagtighed", beskriver det tal klar, veloptaget lyd — mikrofoner tæt på, minimal baggrundsstøj, én taler ad gangen. Det er et ærligt tal under de forhold, og ethvert firmas overskriftstal bærer den samme finskrift, uanset om de nævner det eller ej. Nøjagtigheden forringes af støj, afstand, krydstale og kraftig komprimering; ingen motor er undtaget, fordi lydens fysik sætter loftet.

Så behandl ethvert nøjagtighedsudsagn som et udsagn om ideelle forhold, og behandl dine egne optagelser som den benchmark, der tæller. At forbedre lyden — en mikrofon tættere på, et roligere rum, én stemme ad gangen — vil gøre mere for din ordfejlrate end at skifte mellem to vilkårlige moderne motorer. Og uanset hvad der bliver tilbage derefter, er det en synkroniseret editor — en der lader dig klikke på et mistænkeligt ord og høre lyden bag det — der lukker afstanden mellem målt nøjagtighed og en transskription, du kan udgive.

Kom i gang

Prøv Sonix gratis

Sonix transskriberer, tidsstempler og organiserer dine lyd- og videofiler, så du kan søge i, redigere og dele dine medier.

Inkluderer 30 minutes minutters gratis transskription

Læs videre

99% nøjagtighed. Hvert ord tæller.

AI-transskription og oversættelse på 54+ sprog.

30 minutes gratis
Intet kreditkort
Afmeld når som helst