- Você disse
- Não assine o contrato
- A máquina escreveu
Nãoassine o contrato
Uma palavra a menos, uma tarde muito diferente para o departamento jurídico.
1 exclusão ÷ 4 palavras = 25% WER — e 100% do significado
O número por trás de toda alegação de precisão em transcrição — como é calculado, o que esconde e como medi-lo no seu próprio áudio.
A taxa de erro por palavra — WER, na sigla em inglês — é a forma padrão de medir o desempenho de um sistema de reconhecimento automático de fala (ASR). Ela compara a transcrição da máquina com uma transcrição de referência cuidadosamente preparada por humanos e conta três tipos de erro: substituições, exclusões e inserções. Medi-la é mais complicado do que parece, porque o resultado do ASR pode ter comprimento diferente do que foi realmente falado.
Aqui está uma maneira simples de entender como o WER é calculado:

Um WER de 5% significa mais ou menos um erro a cada vinte palavras — dito de outra forma, 95% de precisão. Números são abstratos, no entanto. Veja cada tipo de erro causando estrago de verdade:
Uma palavra a menos, uma tarde muito diferente para o departamento jurídico.
1 exclusão ÷ 4 palavras = 25% WER — e 100% do significado
A mesma palavrinha, chegando sem ser convidada. Investidores momentaneamente arrasados.
1 inserção ÷ 4 palavras = 25% WER
Uma letra entre a oficina mecânica e a sala de espetáculos.
1 substituição ÷ 6 palavras = 17% WER
Agora que você sabe o que conta como erro, faça as contas. Defina o tamanho da sua transcrição de referência, arraste os erros que encontrou e veja a taxa de erro por palavra se mexer — esta é exatamente a aritmética por trás de toda alegação de precisão que você vai ler.
≈ um erro a cada 50 palavras
Território de áudio limpo — uma revisão rápida e já está pronto para publicar.
A conta, ao vivo: (6 + 3 + 1) ÷ 500 = 2.0%
O reconhecimento de fala percorreu um longo caminho desde os anos 1950 — nossa breve história do reconhecimento de fala conta essa trajetória. Por volta de 2017, as maiores empresas de tecnologia disputavam publicamente umas com as outras no WER, medido em relação a um benchmark padrão de conversas telefônicas gravadas:
Mar 2017: IBM reivindica 5,5% de word error rate
Maio 2017: Google reivindica 4,9% de word error rate
Ago 2017: Microsoft reivindica 5,1% de Word Error Rate
Esses anúncios importaram porque se aproximaram da taxa de erro de transcritores humanos profissionais no mesmo benchmark — o momento que a indústria chamou de "paridade humana". Mas a corrida em benchmarks limpos praticamente terminou num amontoado de números parecidos. Em conjuntos de teste cuidadosamente gravados e de um único domínio, todo mecanismo moderno sério vai bem — e é exatamente por isso que o WER de benchmark deixou de ser a pergunta interessante.
As diferenças reais entre sistemas de transcrição aparecem agora em outro lugar: em áudio de reunião captado à distância, falas sobrepostas, sotaques carregados, vocabulário especializado e gravações barulhentas do mundo real. Dois mecanismos com pontuações de benchmark quase idênticas podem se comportar de maneira muito diferente na sua reunião de terça-feira — por isso a única comparação que importa é a que você faz no seu próprio áudio.
O WER conta erros de palavra e nada mais — e boa parte do que torna uma transcrição útil é invisível para ele. Pontuação e uso de maiúsculas não entram na conta: um bloco de palavras perfeitamente reconhecidas, mas sem pontuação, pode registrar um WER excelente e ainda assim ser terrível de ler. A atribuição de quem falou também não é pontuada — colocar as palavras certas na boca da pessoa errada sai de graça, no que depende do WER. Números, datas e nomes são pontuados como qualquer outra palavra, embora errar "MRSA" ou "receita do 3º trimestre" costume custar muito mais caro do que engolir um "o".
É por isso que uma transcrição com taxa de erro um pouco maior, mas com pontuação, parágrafos e identificação de falantes limpos, costuma ser mais útil do que uma tecnicamente "mais precisa" sem estrutura. Ao avaliar a qualidade de uma transcrição, leia o resultado como um documento, não apenas como uma contagem de palavras — e pese os erros pelo que eles custariam a você, não por quantos são.
Ignore o número de marketing de todo fornecedor, inclusive o nosso — o teste que importa leva cerca de uma hora. Escolha dez minutos de áudio que realmente representem o seu trabalho: suas salas de reunião, seus entrevistados, seu jargão. Prepare com cuidado uma transcrição de referência dele (esta é a parte lenta — a referência precisa estar certa). Depois passe o mesmo trecho por cada serviço que estiver avaliando e conte substituições, exclusões e inserções em relação à sua referência.
Dois avisos práticos. Primeiro, normalize antes de contar: decida logo de início se "OK" e "okay", dígitos e números por extenso, ou palavras de preenchimento contam como erros, e aplique as mesmas regras a todos os mecanismos — a maioria das comparações caseiras erra aqui, e não na contagem. Segundo, não pare na taxa de erro: anote que tipos de palavra cada mecanismo errou e quanto trabalho de limpeza o resultado realmente exigiu. Um atalho que funciona quase tão bem: transcreva o trecho em todos os serviços, deixe cada transcrição em qualidade de publicação e cronometre a limpeza. O mecanismo que exige o menor número de correções no seu áudio é o preciso, digam o que disserem os benchmarks.
Quando o Sonix diz "até 99% de precisão", esse número descreve um áudio claro e bem gravado — microfones próximos, ruído de fundo mínimo, um falante de cada vez. É um número honesto nessas condições, e o número de destaque de todo fornecedor carrega a mesma letra miúda, quer eles a declarem ou não. A precisão cai com ruído, distância, falas sobrepostas e compressão pesada; nenhum mecanismo escapa, porque é a física do áudio que define o teto.
Portanto, trate qualquer alegação de precisão como uma afirmação sobre condições ideais, e trate suas próprias gravações como o benchmark que conta. Melhorar o áudio — um microfone mais próximo, uma sala mais silenciosa, uma voz de cada vez — fará mais pela sua taxa de erro por palavra do que trocar entre dois mecanismos modernos quaisquer. E o que sobrar depois disso, um editor sincronizado que permite clicar numa palavra suspeita e ouvir o áudio por trás dela é o que fecha a distância entre a precisão medida e uma transcrição que você pode publicar.
O Sonix transcreve, gera carimbos de data/hora e organiza seus arquivos de áudio e vídeo para que você possa pesquisar, editar e compartilhar sua mídia.
Inclui 30 minutes minutos de transcrição gratuita
Transcrição e tradução por IA em 54+ idiomas.