O que é Word Error Rate?

O número por trás de toda alegação de precisão em transcrição — como é calculado, o que esconde e como medi-lo no seu próprio áudio.

Fórmula do Word Error Rate

A taxa de erro por palavra — WER, na sigla em inglês — é a forma padrão de medir o desempenho de um sistema de reconhecimento automático de fala (ASR). Ela compara a transcrição da máquina com uma transcrição de referência cuidadosamente preparada por humanos e conta três tipos de erro: substituições, exclusões e inserções. Medi-la é mais complicado do que parece, porque o resultado do ASR pode ter comprimento diferente do que foi realmente falado.

Aqui está uma maneira simples de entender como o WER é calculado:

Sonix - Fórmula do Word Error Rate

Um WER de 5% significa mais ou menos um erro a cada vinte palavras — dito de outra forma, 95% de precisão. Números são abstratos, no entanto. Veja cada tipo de erro causando estrago de verdade:

Exclusão1 palavra perdida
Você disse
Não assine o contrato
A máquina escreveu
Não assine o contrato

Uma palavra a menos, uma tarde muito diferente para o departamento jurídico.

1 exclusão ÷ 4 palavras = 25% WER — e 100% do significado

Inserção1 palavra a mais
Você disse
Os resultados foram promissores
A máquina escreveu
Os resultados não foram promissores

A mesma palavrinha, chegando sem ser convidada. Investidores momentaneamente arrasados.

1 inserção ÷ 4 palavras = 25% WER

Substituição1 palavra trocada
Você disse
Preciso confirmar o conserto para amanhã
A máquina escreveu
Preciso confirmar o conserto concerto para amanhã

Uma letra entre a oficina mecânica e a sala de espetáculos.

1 substituição ÷ 6 palavras = 17% WER

Calculadora de WER: teste a fórmula você mesmo

Agora que você sabe o que conta como erro, faça as contas. Defina o tamanho da sua transcrição de referência, arraste os erros que encontrou e veja a taxa de erro por palavra se mexer — esta é exatamente a aritmética por trás de toda alegação de precisão que você vai ler.

2.0%taxa de erro por palavra
98.0%precisão

≈ um erro a cada 50 palavras

Território de áudio limpo — uma revisão rápida e já está pronto para publicar.

A conta, ao vivo: (6 + 3 + 1) ÷ 500 = 2.0%

A corrida pela precisão, e onde ela parou

O reconhecimento de fala percorreu um longo caminho desde os anos 1950 — nossa breve história do reconhecimento de fala conta essa trajetória. Por volta de 2017, as maiores empresas de tecnologia disputavam publicamente umas com as outras no WER, medido em relação a um benchmark padrão de conversas telefônicas gravadas:

Mar 2017: IBM reivindica 5,5% de word error rate
Maio 2017: Google reivindica 4,9% de word error rate
Ago 2017: Microsoft reivindica 5,1% de Word Error Rate

Esses anúncios importaram porque se aproximaram da taxa de erro de transcritores humanos profissionais no mesmo benchmark — o momento que a indústria chamou de "paridade humana". Mas a corrida em benchmarks limpos praticamente terminou num amontoado de números parecidos. Em conjuntos de teste cuidadosamente gravados e de um único domínio, todo mecanismo moderno sério vai bem — e é exatamente por isso que o WER de benchmark deixou de ser a pergunta interessante.

As diferenças reais entre sistemas de transcrição aparecem agora em outro lugar: em áudio de reunião captado à distância, falas sobrepostas, sotaques carregados, vocabulário especializado e gravações barulhentas do mundo real. Dois mecanismos com pontuações de benchmark quase idênticas podem se comportar de maneira muito diferente na sua reunião de terça-feira — por isso a única comparação que importa é a que você faz no seu próprio áudio.

O que o WER não mede

O WER conta erros de palavra e nada mais — e boa parte do que torna uma transcrição útil é invisível para ele. Pontuação e uso de maiúsculas não entram na conta: um bloco de palavras perfeitamente reconhecidas, mas sem pontuação, pode registrar um WER excelente e ainda assim ser terrível de ler. A atribuição de quem falou também não é pontuada — colocar as palavras certas na boca da pessoa errada sai de graça, no que depende do WER. Números, datas e nomes são pontuados como qualquer outra palavra, embora errar "MRSA" ou "receita do 3º trimestre" costume custar muito mais caro do que engolir um "o".

É por isso que uma transcrição com taxa de erro um pouco maior, mas com pontuação, parágrafos e identificação de falantes limpos, costuma ser mais útil do que uma tecnicamente "mais precisa" sem estrutura. Ao avaliar a qualidade de uma transcrição, leia o resultado como um documento, não apenas como uma contagem de palavras — e pese os erros pelo que eles custariam a você, não por quantos são.

Como fazer seu próprio teste de WER

Ignore o número de marketing de todo fornecedor, inclusive o nosso — o teste que importa leva cerca de uma hora. Escolha dez minutos de áudio que realmente representem o seu trabalho: suas salas de reunião, seus entrevistados, seu jargão. Prepare com cuidado uma transcrição de referência dele (esta é a parte lenta — a referência precisa estar certa). Depois passe o mesmo trecho por cada serviço que estiver avaliando e conte substituições, exclusões e inserções em relação à sua referência.

Dois avisos práticos. Primeiro, normalize antes de contar: decida logo de início se "OK" e "okay", dígitos e números por extenso, ou palavras de preenchimento contam como erros, e aplique as mesmas regras a todos os mecanismos — a maioria das comparações caseiras erra aqui, e não na contagem. Segundo, não pare na taxa de erro: anote que tipos de palavra cada mecanismo errou e quanto trabalho de limpeza o resultado realmente exigiu. Um atalho que funciona quase tão bem: transcreva o trecho em todos os serviços, deixe cada transcrição em qualidade de publicação e cronometre a limpeza. O mecanismo que exige o menor número de correções no seu áudio é o preciso, digam o que disserem os benchmarks.

Como ler as alegações de precisão dos fornecedores (inclusive as nossas)

Quando o Sonix diz "até 99% de precisão", esse número descreve um áudio claro e bem gravado — microfones próximos, ruído de fundo mínimo, um falante de cada vez. É um número honesto nessas condições, e o número de destaque de todo fornecedor carrega a mesma letra miúda, quer eles a declarem ou não. A precisão cai com ruído, distância, falas sobrepostas e compressão pesada; nenhum mecanismo escapa, porque é a física do áudio que define o teto.

Portanto, trate qualquer alegação de precisão como uma afirmação sobre condições ideais, e trate suas próprias gravações como o benchmark que conta. Melhorar o áudio — um microfone mais próximo, uma sala mais silenciosa, uma voz de cada vez — fará mais pela sua taxa de erro por palavra do que trocar entre dois mecanismos modernos quaisquer. E o que sobrar depois disso, um editor sincronizado que permite clicar numa palavra suspeita e ouvir o áudio por trás dela é o que fecha a distância entre a precisão medida e uma transcrição que você pode publicar.

Comece agora

Experimente o Sonix gratuitamente

O Sonix transcreve, gera carimbos de data/hora e organiza seus arquivos de áudio e vídeo para que você possa pesquisar, editar e compartilhar sua mídia.

Inclui 30 minutes minutos de transcrição gratuita

Continue lendo

99% de precisão. Cada palavra importa.

Transcrição e tradução por IA em 54+ idiomas.

30 minutes grátis
Sem cartão de crédito
Cancele a qualquer momento