Acabou de transcrever uma consulta médica crítica, um depoimento judicial ou horas de entrevistas de investigação — apenas para descobrir que a ferramenta de transcrição com IA inseriu palavras, frases ou frases inteiras que nunca foram ditas. Trata-se de um modo de falha documentado, conhecido como «alucinação de transcrição», que pode causar problemas graves quando as transcrições são utilizadas sem verificação.
Num estudo realizado em 2024, que analisou 13 140 segmentos áudio curtos em inglês, os investigadores identificaram frases ou expressões alucinadas em 1.4% dos segmentos processados nas condições de teste do estudo. Esta taxa não deve ser considerada universal: os resultados podem variar substancialmente consoante a versão do modelo, o áudio, o idioma, a população de falantes, a segmentação e as definições de descodificação. No entanto, o estudo demonstra por que razão as equipas que dependem de transcrição automática Os trabalhos de grande importância requerem processos de revisão fiáveis e acesso à gravação original.
As implicações vão além dos erros de transcrição comuns. Os investigadores encontraram exemplos que envolviam linguagem violenta, associações raciais incorretas, informações pessoais inventadas e tratamentos médicos inexistentes.
Principais conclusões
- Num estudo, o Whisper gerou frases ou expressões alucinadas em 1,41 TP5T de 13 140 foram testados segmentos de áudio curtos
- Os investigadores classificaram 38% das alucinações identificadas como contaiendo conteúdos prejudiciais explícitos, incluindo linguagem violenta, associações incorretas, informações pessoais inventadas ou falsa autoridade
- Uma comparação posterior revelou que outros cinco serviços de conversão de voz em texto não reproduziram passagens alucinadas comparáveis nas 187 amostras testadas, embora esse resultado não prove que esses serviços nunca produzam alucinações
- O silêncio, as longas pausas, os sons de fundo e outros intervalos sem fala são frequentemente associados às alucinações do tipo «Whisper»
- No conjunto de dados do estudo, as alucinações surgiram com maior frequência nos segmentos de falantes com afasia do que nos segmentos de controlo, levantando questões relacionadas com a acessibilidade do rai e a fairness
- A deteção de atividade de voz e outros métodos de filtragem de sinais não vocais podem reduzir as alucinações em alguns fluxos de trabalho do Whisper, mas a sua eficácia depende do modelo, do áudio e da configuração
- As gravações originais devem permanecer disponíveis até que as transcrições de grande importância tenham sido revistas e aprovadas
- Não se deve partir do princípio de que qualquer sistema de transcrição automatizada esteja isento de erros, especialmente em contextos de cuidados de saúde, jurídicos, laborais ou de investigação
Compreender a transcrição por IA: como a fala se transforma em texto
A transcrição moderna com IA baseia-se em redes neurais treinadas com grandes conjuntos de dados de áudio para converter a linguagem falada em texto escrito. Esta tecnologia transformou a forma como os profissionais lidam com conteúdos de áudio, convertendo gravações em texto pesquisável muito mais rapidamente do que a transcrição manual.
Os diferentes sistemas utilizam arquiteturas distintas, mas o processo inclui normalmente várias etapas:
- Processamento de áudio: O áudio bruto é convertido numa representação, como um espectrograma
- Reconhecimento de voz: Um modelo identifica padrões no áudio e associa-os a tokens de texto
- Decodificação de sequências: O sistema seleciona uma sequência provável de palavras com base tanto no áudio como nos padrões aprendidos durante o treino
- Pós-processamento: Podem ser adicionados sinais de pontuação, marcas temporais, identificações dos oradores e formatação
Estes sistemas podem apresentar um bom desempenho com áudio nítido, mas a precisão depende da qualidade da gravação, dos sotaques, da sobreposição de vozes, da terminologia técnica, do ruído de fundo e do grau de semelhança entre o áudio e os dados de treino do modelo.
O que são as «alucinações» da IA na transcrição?
As alucinações da IA na transcrição ocorrem quando um sistema de conversão de voz em texto gera texto que não tem qualquer fundamento significativo no áudio original. Isto difere de uma substituição comum, como transcrever “gato” por “chapéu”. Uma alucinação pode introduzir uma frase ou um período inteiro que nunca foi proferido.
Os investigadores, ao analisarem 13 140 segmentos de áudio, identificaram 187 alucinações. Classificaram 38% dessas passagens alucinadas como contendo danos explícitos, incluindo:
- Linguagem violenta: Inserir declarações violentas num discurso que, de resto, seria inofensivo
- Associações incorretas: Acrescentar características, como a raça, que o orador nunca mencionou
- Invenções médicas: Inventar tratamentos ou nomes de medicamentos que não existem
- Autoridade falsa: Inserir texto que se assemelhe a uma citação, legenda ou declaração oficial
Estes exemplos são preocupantes porque o texto inventado pode parecer fluente e credível, tornando difícil detetá-lo sem comparar a transcrição com o áudio original.
Um estudo separado de 2025 alimentou intencionalmente o Whisper com sons não verbais para analisar quando o modelo gera texto sem entrada de voz. Os investigadores observaram frases recorrentes, tais como “obrigado” e “obrigado por assistirem”. Sugeriram que estes padrões podem refletir a linguagem comum nos meios de comunicação provenientes da Internet utilizados durante o treino do modelo. Uma vez que as experiências se centraram em ficheiros não vocais, as respetivas percentagens não devem ser interpretadas como taxas de alucinação esperadas para conversas ou entrevistas normais.
Por que é que os modelos de transcrição baseados em IA, como o Whisper, apresentam alucinações
A OpenAI descreve o Whisper como um Transformer do tipo codificador-decodificador. O áudio é convertido num espectrograma log-Mel e processado por um codificador de áudio, enquanto um descodificador gera os tokens de texto correspondentes.
Uma vez que o modelo gera texto de forma sequencial, pode, por vezes, produzir resultados fluentes que não se baseiam suficientemente na entrada acústica. Investigadores e programadores observaram que este comportamento é especialmente provável em situações como:
- Silêncio e longas pausas: Os intervalos prolongados sem voz podem deixar o descodificador com poucas evidências acústicas
- Áudio não vocal: A música, os sons de fundo e o ruído ambiente podem, por vezes, desencadear a geração de texto
- Má qualidade de gravação: A distorção, o volume baixo, o clipping ou um ruído de fundo intenso tornam o sinal da fala mais difícil de interpretar
- Disfluências na fala: A gaguez, a hesitação, a fala fragmentada e as pausas prolongadas podem aumentar a dificuldade de compreensão
- Definições de segmentação e descodificação: O comprimento dos blocos, os limiares, as instruções e outras opções de implementação podem afetar o resultado
A OpenAI informou que o sistema Whisper original foi treinado com 680 000 horas de áudio supervisionado, multilingue e multitarefa, recolhido na Internet. Este vasto conjunto de dados contribui para a flexibilidade do modelo, mas o material de treino proveniente da Internet também pode expor o sistema a padrões repetitivos de legendagem e de linguagem de vídeo.
Os investigadores ainda não identificaram uma causa única para todas as alucinações. As evidências disponíveis sugerem que as alucinações resultam de uma interação entre as condições de áudio, a arquitetura do modelo, os dados de treino e as opções de descodificação.
O impacto das alucinações na precisão da transcrição
Para os profissionais dos setores da saúde, dos serviços jurídicos, da investigação e dos meios de comunicação social, uma expressão inventada pode ter consequências mais graves do que um simples erro ortográfico.
Consequências para a saúde
Em outubro de 2024, a Associated Press noticiou que o produto de documentação clínica da Nabla, baseado no Whisper, era utilizado por mais de 30 000 profissionais de saúde em 40 sistemas de saúde. A Nabla também informou que o produto tinha processado cerca de sete milhões de consultas médicas.
A AP noticiou que a Nabla apagou o áudio original após o processamento, por motivos de segurança dos dados. Os clínicos da Nabla said foram obrigados a rever e aprovar as notas geradas. Este exemplo ilustra uma contradição importante: apagar as gravações pode reduzir alguns riscos de retenção, mas também pode impedir uma comparação posterior com a conversa original.
A OpenAI alertou que não se deve confiar nos resultados do reconhecimento de voz em contextos de tomada de decisão em que as imprecisões possam ter consequências significativas. As organizações de saúde devem, por conseguinte, exigir a revisão por parte de profissionais de saúde, estabelecer políticas claras de conservação e verificação de dados e utilizar serviços abrangidos por salvaguardas adequadas em matéria de privacidade e contratuais.
Implicações jurídicas e de investigação
No âmbito jurídico, o conteúdo falsificado de uma transcrição pode afetar a preparação de depoimentos, a análise de processos ou a revisão de provas. Um rascunho gerado automaticamente não deve ser considerado um registo oficial sem a revisão e certificação exigidas pelo tribunal, pela jurisdição ou pelas normas profissionais aplicáveis.
As equipas de investigação enfrentam um risco relacionado. Se uma citação inventada for incluída na codificação qualitativa ou na análise temática, pode influenciar as conclusões e comprometer a integridade do estudo. Os investigadores devem conservar as gravações originais, documentar o seu processo de transcrição e verificar as citações utilizadas em relatórios ou publicações.
O estudo liderado pela Universidade de Cornell também revelou uma disparidade entre os seus conjuntos de dados relativos à afasia e aos grupos de controlo. As alucinações surgiram em 1,71 TP5T de segmentos de falantes com afasia e 1,2% de segmentos de controlo. Os investigadores associaram essa diferença a durações mais longas dos intervalos não vocais. Isto não significa que todas as pessoas com uma deficiência da fala venham a enfrentar a mesma disparidade, mas levanta questões de acessibilidade e adequação para as organizações que utilizam transcrições automatizadas em contextos de grande importância.
Melhores práticas para minimizar as «alucinações» na transcrição por IA
Nenhum método de mitigação garante uma transcrição perfeita. No entanto, existem várias práticas que podem reduzir o risco e facilitar a deteção de erros.
Abordagens técnicas de mitigação
- Pré-processamento da deteção de atividade vocal: A remoção ou separação dos intervalos sem fala antes da transcrição pode reduzir a probabilidade de um modelo gerar texto durante os silêncios
- Segmentação cuidadosa: Processar o áudio em segmentos adequados ao modelo selecionado, em vez de aplicar regras de duração arbitrárias
- Definições de descodificação conservadoras: Consulte a documentação relativa à implementação específica do Whisper e teste as definições com um ficheiro de áudio representativo against
- Verificações de repetições e anomalias: Assinale frases repetidas, mudanças bruscas de tema, despedidas ao estilo de vídeos ou texto invulgarmente fluente durante intervalos de silêncio
- Avaliação com controlo de versões: Voltar a testar os fluxos de trabalho sempre que se alterarem modelos, definições de idioma, prompts, pré-processamento ou bibliotecas de descodificação
Um estudo de 2025 também testou um método de pós-processamento denominado “bag of hallucinations”, que filtrou os resultados recorrentes produzidos nas suas experiências não relacionadas com a fala. O método reduziu os erros nessas condições controladas, mas não deve ser considerado um substituto geral da revisão do áudio original.
Melhores práticas de fluxo de trabalho
- Maintain – fonte de áudio: Manter as gravações disponíveis até que a transcrição tenha sido verificada, sem prejuízo dos requisitos relativos ao consentimento, à privacidade, à conservação e aos requisitos legais
- Implementar a revisão humana: Exigir uma revisão antes de que os registos clínicos de grande importância influenciem cuidados de saúde, decisões jurídicas, processos de contratação, resultados de investigação ou publicações
- Dar prioridade às passagens de alto risco: Secções de revisão que incluem números, medicamentos, nomes, datas, citações, termos jurídicos ou longas pausas
- As equipas da Train sobre sinais de alerta: Esteja atento a frases repetidas, conteúdo inesperado, mudanças abruptas de estilo ou palavras que surjam durante o silêncio
- Responsabilidade pelo documento: Especificar quem deve rever, aprovar, corrigir e retain cada transcrição
Como escolher um software de transcrição com IA fiável
A investigação liderada pela Universidade de Cornell sugere que as alucinações que identificou não foram reproduzidas de forma uniforme em todos os serviços de conversão de voz em texto. Quando os investigadores testaram as 187 amostras de «alucinações do Whisper» com o Google Cloud Speech-to-Text, o Microsoft Azure Speech-to-Text, o Amazon Transcribe, o AssemblyAI e o Rev AI, esses sistemas não produziram passagens alucinadas comparáveis nessa experiência.
Esta é uma conclusão útil, mas não constitui prova de que algum serviço seja incapaz de apresentar erros. A comparação limitou-se a amostras, versões de serviço e configurações específicas.
Ao avaliar software de transcrição, considere o seguinte:
- Acesso ao áudio original: Os revisores podem ouvir a gravação em simultâneo com a transcrição?
- Analisar a eficiência: As palavras estão associadas a registos de data e hora para uma verificação rápida?
- Ferramentas para oradores: Os utilizadores conseguem identificar e corrigir as etiquetas dos falantes?
- Controlos de terminologia: As equipas podem adicionar nomes, acrónimos e terminologia técnica?
- Documentação de segurança: O prestador de serviços documenta claramente a encriptação, os controlos de acesso, as auditorias, a localização dos dados e a retenção?
- Adequação contratual: Existem acordos adequados para dados regulamentados ou confidenciais?
- Opções de exportação e auditoria: As equipas podem guardar as versões corrigidas e documentar as aprovações?
- Testes representativos: O serviço foi testado com os idiomas, sotaques, microfones e ambientes reais da organização?
O preço, por si só, não determina se um sistema irá apresentar falhas. A arquitetura, a implementação, a qualidade de áudio, as funcionalidades de revisão e os controlos operacionais são todos fatores importantes.
Aproveitar funcionalidades avançadas para melhorar a qualidade da transcrição
As funcionalidades relacionadas com o modelo de transcrição podem facilitar a identificação e a correção de erros.
Ferramentas de edição e revisão
- Códigos temporais ao nível da palavra: Associar o texto da transcrição ao momento correspondente na gravação
- Reprodução sincronizada: Permitir que os revisores ouçam enquanto lêem ou editam
- Identificação do orador: Separar os oradores e permitir a correção das etiquetas
- Edição no navegador: Permitir a realização de correções sem transferir o conteúdo para uma aplicação separada
- Dicionários personalizados: Permitir que os utilizadores adicionem nomes próprios, terminologia técnica, acrónimos e grafias preferidas
Análise e Conclusões
Ferramentas de análise de IA podem extrair temas, resumos, capítulos, tópicos, sentimentos ou momentos-chave das transcrições. Estes resultados dependem da transcrição subjacente. As equipas devem corrigir erros de transcrição importantes antes de se basearem em análises posteriores, especialmente quando os resultados servem de base a investigação, relatórios ou decisões empresariais.
Caraterísticas de colaboração
Os espaços de trabalho partilhados, as permissões, os comentários e os fluxos de trabalho de revisão podem ajudar as equipas a atribuir responsabilidades e a evitar confusões entre versões. As funcionalidades de colaboração revelam-se mais valiosas quando uma organização define também quem é responsável pela aprovação do texto final.
Transcrição por IA segura e em conformidade com as normas para dados sensíveis
A segurança e a conformidade exigem mais do que um logótipo de certificação. As organizações devem avaliar o serviço, o plano selecionado, os termos contratuais, a configuração e a utilização pretendida.
O processo de registo de fornecedores de tecnologia de voz ambiente do NHS England exige que os fornecedores participantes apresentem comprovativos do estatuto de dispositivo médico de Classe I e uma avaliação atualizada ao abrigo dos Critérios de Avaliação de Tecnologia Digital. Isto ilustra o crescente escrutínio a que estão sujeitas as ferramentas de documentação clínica, mas não deve ser interpretado como uma regra universal que se aplique de forma idêntica a todos os produtos de transcrição em todos os contextos do NHS.
As funcionalidades de segurança a analisar incluem:
- Auditorias independentes de controlos, tais como a SOC 2 Tipo II
- Encriptação em trânsito e em repouso
- Controlos de acesso baseados em funções
- Autenticação multifatorial e opções de identidade empresarial
- Informações sobre a localização e a retenção dos dados
- Controlos de eliminação e exportação
- Acordos de Parceria Comercial ou outras salvaguardas contratuais adequadas, quando necessário
As organizações devem verificar o âmbito exato de cada certificação e determinar se esta se aplica ao serviço, ao plano e ao caso de utilização que pretendem implementar.
Por que é que a Sonix apoia fluxos de trabalho de transcrição com IA verificável
Para equipas que precisam de rever e gerir transcrições de forma eficiente, Sonix combina a transcrição automatizada com ferramentas para verificar o resultado em relação à gravação original.
As funcionalidades atuais do Sonix incluem:
- Um editor baseado no navegador com reprodução sincronizada, pesquisa, navegação ao nível da palavra e identificação dos interlocutores
- Dicionários personalizados que permitem aos utilizadores adicionar nomes, terminologia técnica, acrónimos e grafias preferidas
- Certificação SOC 2 Tipo II, encriptação TLS em trânsito e encriptação AES-256 em repouso
- Medidas de proteção em conformidade com a HIPAA através da Medical Sonix, incluindo Acordos de Parceria Comercial para organizações de cuidados de saúde elegíveis
- Suporte à transcrição em mais de 54 idiomas
- Análise com base em IA para resumos, capítulos, temas, tom e outras informações extraídas das transcrições
- Controlos de colaboração em equipa, incluindo espaços de trabalho, permissões e funcionalidades de partilha
Estes controlos ajudam os utilizadores a detetar e corrigir erros, mas não eliminam a necessidade de revisão. Não se deve partir do princípio de que qualquer transcrição automática representa na perfeição todas as palavras proferidas sem que seja feita uma verificação.
Quer sejas um empresa de investigação analisando entrevistas, a sala de imprensa trabalhar com prazos against, ou um empresa Para uma equipa que gere grandes volumes de gravações, o fluxo de trabalho mais seguro é aquele que mantém a transcrição associada ao áudio original e atribui responsabilidades claras em matéria de aprovação.
Veredicto final: Escolher a solução de transcrição mais adequada às suas necessidades
A escolha entre um fluxo de trabalho do Whisper gerido internamente e uma plataforma de transcrição alojada depende dos recursos técnicos, dos requisitos de dados, das necessidades de revisão e da tolerância ao risco.
Um fluxo de trabalho do Whisper autogerido pode ser adequado quando:
- O conteúdo apresenta um risco reduzido e são aceitáveis erros ocasionais
- A organização pode testar versões do modelo, o pré-processamento, a segmentação e as definições de descodificação
- O pessoal técnico pode implementar medidas de monitorização e mitigação
- Gravações originais remain disponíveis para verificação
- Uma pessoa qualificada verifica os resultados importantes antes da utilização
Uma plataforma de transcrição gerida pode ser a melhor opção quando precisar de:
- Um editor sincronizado para comparar texto com o áudio original
- Orador, marca temporal, terminologia e ferramentas de correção
- Espaços de trabalho partilhados e permissões
- Controlos de segurança e privacidade documentados
- Suporte a vários idiomas e formatos de exportação
- Um fluxo de trabalho que permite aos revisores sem conhecimentos técnicos aprovar transcrições de forma eficiente
Nos setores da saúde, jurídico, da investigação, do jornalismo e noutros ambientes de grande importância, a questão fundamental não é se um fornecedor promete uma precisão perfeita. Trata-se de saber se o sistema torna os erros visíveis, preserva as provas necessárias para os corrigir e apoia um processo de revisão adequado às consequências de uma transcrição incorreta.
Perguntas frequentes
O que é uma «alucinação da IA» na transcrição?
A alucinação da IA na transcrição ocorre quando um sistema de conversão de voz em texto gera uma palavra, frase ou oração que não tem qualquer fundamento significativo na gravação original. Ao contrário de uma substituição comum, uma alucinação pode introduzir conteúdo totalmente novo. Num estudo realizado com 13 140 segmentos de áudio curtos, os investigadores identificaram 187 alucinações e classificaram 38% delas como contaiendo danos explícitos, tais como linguagem violenta, associações imprecisas, informações inventadas ou falsa autoridade.
Por que é que o Whisper AI, por vezes, inventa palavras ou frases?
O Whisper é um Transformer de codificador-decodificador que gera tokens de texto com base no áudio. Quando as evidências acústicas são fracas — como durante silêncios, pausas longas, ruído de fundo, música ou discurso fragmentado —, o descodificador pode, por vezes, produzir texto fluente que não está suficientemente fundamentado na gravação. Os dados de treino, a segmentação, os prompts, a versão do modelo e as definições de descodificação também podem influenciar o resultado.
Como posso reduzir as alucinações nas transcrições geradas por IA?
Utilize a deteção de atividade vocal ou outros métodos de filtragem de sinais não vocais, conforme apropriado; teste as definições de segmentação e descodificação em gravações representativas; assinale repetições suspeitas ou texto que apareça durante o silêncio; retain o áudio original; e exija uma revisão humana para conteúdos relevantes. As medidas de mitigação podem reduzir o risco, mas nenhum método de pré-processamento garante uma transcrição isenta de erros.
As ferramentas gratuitas de transcrição baseadas em IA são mais propensas a «alucinações»?
Não necessariamente. O risco de alucinações não é determinado apenas pelo preço. Depende do modelo, da arquitetura, da implementação, das condições de áudio e dos controlos de qualidade associados ao sistema. As plataformas Paid podem oferecer melhores funcionalidades de revisão, segurança, colaboração e auditoria, mas os utilizadores devem avaliar essas capacidades diretamente, em vez de partirem do princípio de que o preço garante a precisão.
O Sonix aborda o problema das «alucinações» na transcrição por IA?
A Sonix disponibiliza um editor baseado no navegador, sincronizado com a gravação original, navegação ao nível da palavra, ferramentas para identificadores de oradores, dicionários personalizados e controlos de revisão colaborativa. Estas funcionalidades ajudam os utilizadores a identificar e corrigir erros de transcrição. Devem ser consideradas como medidas de segurança para verificação e não como prova de que uma transcrição automatizada não pode cometer erros, especialmente quando o conteúdo influencia decisões na área da saúde, jurídica, de investigação ou outras decisões de alto risco.
Obtenha uma transcrição exacta em minutos
Comece a transcrever de forma mais inteligente. Experimente o Sonix gratuitamente ou explore nossos preços para encontrar o plano certo para você.