Educación

¿Puede Whisper tener alucinaciones en las transcripciones? Por qué la transcripción con IA se inventa cosas

por LoudSpeaker Marketing 13 minutos de lectura
En este artículo

Acabas de transcribir una consulta médica crítica, una declaración judicial o horas de entrevistas de investigación, solo para descubrir que la herramienta de transcripción con IA insertó palabras, frases u oraciones completas que nunca se dijeron. Este es un modo de error documentado conocido como «alucinación de transcripción», y puede generar graves problemas cuando las transcripciones se utilizan sin verificación.

En un estudio realizado en 2024 con 13 140 segmentos cortos de audio en inglés, los investigadores identificaron frases u oraciones alucinadas en 1.4% de los segmentos procesados en las condiciones de prueba del estudio. Esta tasa no debe considerarse universal: los resultados pueden variar considerablemente según la versión del modelo, el audio, el idioma, la población de hablantes, la segmentación y los ajustes de decodificación. Sin embargo, el estudio demuestra por qué los equipos que dependen de transcripción automática Los trabajos de gran importancia requieren procesos de revisión confiables y acceso a la grabación original.

Las implicaciones van más allá de los simples errores de transcripción. Los investigadores encontraron ejemplos que incluían lenguaje violento, asociaciones raciales inexactas, información personal inventada y tratamientos médicos inexistentes.

Principales conclusiones

  • En un estudio, Whisper generó frases u oraciones alucinadas en 1,41 TP5T de 13 140 se evaluaron segmentos cortos de audio
  • Los investigadores clasificaron 38% de las alucinaciones identificadas como aquellas que contenían daños explícitos, entre ellos lenguaje violento, asociaciones inexactas, información personal inventada o autoridad falsa
  • Una comparación posterior reveló que otros cinco servicios de conversión de voz a texto no reprodujeron pasajes «alucinados» similares en las 187 muestras evaluadas, aunque ese resultado no prueba que esos servicios nunca produzcan «alucinaciones».
  • El silencio, las pausas prolongadas, los sonidos de fondo y otros intervalos sin habla se asocian con frecuencia a las alucinaciones de tipo «susurro»
  • En el conjunto de datos del estudio, las alucinaciones aparecieron con mayor frecuencia en los segmentos de los hablantes con afasia que en los segmentos del grupo de control, lo que plantea cuestiones relacionadas con la accesibilidad de rai y la fairness.
  • La detección de actividad de voz y otros métodos de filtrado de señales que no sean de voz pueden reducir las alucinaciones en algunos flujos de trabajo de Whisper, pero su efectividad depende del modelo, del audio y de la configuración
  • Las grabaciones originales deben permanecer disponibles hasta que se hayan revisado y aprobado las transcripciones de alto riesgo.
  • No se debe dar por sentado que ningún sistema de transcripción automatizada esté libre de errores, especialmente en los ámbitos de la salud, el derecho, el empleo o la investigación

Entender la transcripción con IA: cómo el habla se convierte en texto

La transcripción moderna con inteligencia artificial se basa en redes neuronales entrenadas con grandes conjuntos de datos de audio para convertir el lenguaje hablado en texto escrito. Esta tecnología ha transformado la forma en que los profesionales manejan el contenido de audio, al convertir las grabaciones en texto en el que se pueden realizar búsquedas mucho más rápido que con la transcripción manual.

Los distintos sistemas utilizan diferentes arquitecturas, pero el proceso suele incluir varias etapas:

  • Procesamiento de audio: El audio sin procesar se convierte en una representación, como un espectrograma
  • Reconocimiento de voz: Un modelo identifica patrones en el audio y los asocia a unidades de texto
  • Decodificación de secuencias: El sistema selecciona una secuencia probable de palabras basándose tanto en el audio como en los patrones aprendidos durante el entrenamiento
  • Posprocesamiento: Se pueden agregar signos de puntuación, marcas de tiempo, etiquetas de interlocutores y formato

Estos sistemas pueden funcionar bien con audio nítido, pero la precisión depende de la calidad de la grabación, los acentos, el habla superpuesta, la terminología técnica, el ruido de fondo y el grado de similitud entre el audio y los datos de entrenamiento del modelo.

¿Qué son las alucinaciones de la IA en la transcripción?

Las alucinaciones de la IA en la transcripción ocurren cuando un sistema de conversión de voz a texto genera texto que no tiene una base significativa en el audio original. Esto es diferente de una sustitución común, como transcribir “gato” como “sombrero”. Una alucinación puede introducir una frase o un enunciado completo que nunca se dijo.

Los investigadores, tras analizar 13 140 segmentos de audio, identificaron 187 alucinaciones. Clasificaron 38% de esos pasajes alucinados como aquellos que contenían daños explícitos, entre ellos:

  • Lenguaje violento: Insertar declaraciones violentas en un discurso que, por lo demás, sería inofensivo
  • Asociaciones erróneas: Agregar características como la raza que el hablante nunca mencionó
  • Falsificaciones médicas: Inventar tratamientos o nombres de medicamentos que no existen
  • Autoridad falsa: Agregar texto que se asemeje a una cita, un pie de foto o una declaración de autoridad

Estos ejemplos son preocupantes porque el texto inventado puede parecer fluido y creíble, lo que hace que sea difícil detectarlo sin comparar la transcripción con el audio original.

En un estudio independiente de 2025, se alimentó intencionalmente a Whisper con sonidos no verbales para examinar cuándo el modelo genera texto sin una entrada de voz. Los investigadores observaron frases recurrentes como “gracias” y “gracias por vernos”. Sugirieron que estos patrones podrían reflejar el lenguaje común de los medios de origen web utilizados durante el entrenamiento del modelo. Dado que los experimentos se centraron en archivos que no contenían voz, sus porcentajes no deben interpretarse como tasas esperadas de alucinaciones para conversaciones o entrevistas comunes.

¿Por qué los modelos de transcripción con IA como Whisper tienen alucinaciones?

OpenAI describe a Whisper como un Transformer de tipo codificador-decodificador. El audio se convierte en un espectrograma log-Mel y es procesado por un codificador de audio, mientras que un decodificador genera los tokens de texto correspondientes.

Dado que el modelo genera texto de manera secuencial, en ocasiones puede producir resultados fluidos que no se basan lo suficiente en la entrada acústica. Los investigadores y desarrolladores han observado que este comportamiento es especialmente probable en torno a:

  • Silencio y pausas largas: Los intervalos prolongados sin voz pueden dejar al decodificador con poca evidencia acústica
  • Audio no verbal: La música, los sonidos de fondo y el ruido ambiental pueden, en ocasiones, desencadenar la generación de texto
  • Mala calidad de grabación: La distorsión, el volumen bajo, el clipping o el ruido de fondo intenso hacen que la señal de voz sea más difícil de interpretar
  • Disfluencias del habla: La tartamudez, las vacilaciones, el habla fragmentada y las pausas prolongadas pueden aumentar la dificultad de comprensión
  • Configuración de segmentación y decodificación: La longitud de los fragmentos, los umbrales, las indicaciones y otras decisiones de implementación pueden afectar el resultado

OpenAI informó que el sistema Whisper original se entrenó con 680 000 horas de audio supervisado, multilingüe y multitarea, recopilado de la web. Este amplio conjunto de datos contribuye a la flexibilidad del modelo, pero el material de entrenamiento proveniente de la web también puede exponer al sistema a patrones repetitivos de subtítulos y de lenguaje en los videos.

Los investigadores no han identificado una causa única para todas las alucinaciones. La evidencia disponible sugiere que las alucinaciones surgen de una interacción entre las condiciones de audio, la arquitectura del modelo, los datos de entrenamiento y las opciones de decodificación.

El impacto de las alucinaciones en la precisión de la transcripción

Para los profesionales del sector de la salud, los servicios legales, la investigación y los medios de comunicación, una frase inventada puede tener más consecuencias que un simple error ortográfico.

Consecuencias para la salud

En octubre de 2024, Associated Press informó que Nabla said su producto de documentación clínica basado en Whisper era utilizado por más de 30 000 profesionales de la salud en 40 sistemas de salud. Nabla también said que el producto había procesado aproximadamente siete millones de consultas médicas.

La agencia AP informó que Nabla borró el audio original después de procesarlo por razones de seguridad de los datos. Se exigió a los profesionales clínicos de Nabla said que revisaran y aprobaran las notas generadas. Este ejemplo ilustra una tensión importante: borrar las grabaciones puede reducir algunos riesgos de retención, pero también puede impedir una comparación posterior con la conversación original.

OpenAI ha advertido que no se debe confiar en los resultados del reconocimiento de voz en contextos de toma de decisiones en los que las imprecisiones puedan acarrear consecuencias significativas. Por lo tanto, las organizaciones de salud deben exigir la revisión por parte de personal clínico, establecer políticas claras de retención y verificación, y utilizar servicios que cuenten con las garantías contractuales y de privacidad adecuadas.

En el ámbito jurídico, el contenido falsificado de una transcripción podría afectar la preparación de una declaración, el análisis de un caso o la revisión de las pruebas. Un borrador generado automáticamente no debe considerarse un registro oficial sin la revisión y certificación exigidas por el tribunal, la jurisdicción o las normas profesionales aplicables.

Los equipos de investigación se enfrentan a un riesgo relacionado. Si una cita inventada se incluye en la codificación cualitativa o en el análisis temático, puede influir en los resultados y socavar la integridad del estudio. Los investigadores deben conservar las grabaciones originales, documentar su proceso de transcripción y verificar las citas utilizadas en los informes o publicaciones.

El estudio dirigido por Cornell también reveló una disparidad entre sus conjuntos de datos sobre afasia y los de control. Las alucinaciones aparecieron en 1,71 TP5T de segmentos de hablantes con afasia y 1,2% de segmentos de control. Los investigadores asociaron la diferencia con duraciones más largas de los segmentos no vocales. Esto no establece que todas las personas con una discapacidad del habla experimenten la misma disparidad, pero plantea preocupaciones en materia de accesibilidad y equidad para las organizaciones que utilizan transcripciones automatizadas en entornos de importancia crítica.

Mejores prácticas para minimizar las «alucinaciones» en la transcripción con IA

Ningún método de mitigación garantiza una transcripción perfecta. Sin embargo, existen varias prácticas que pueden reducir el riesgo y facilitar la detección de errores.

Enfoques técnicos de mitigación

  • Preprocesamiento de la detección de actividad de voz: Eliminar o separar los intervalos sin habla antes de la transcripción puede reducir la probabilidad de que un modelo genere texto durante los silencios
  • Segmentación cuidadosa: Procesar el audio en segmentos adecuados para el modelo seleccionado, en lugar de aplicar reglas de duración arbitrarias
  • Configuraciones de decodificación conservadoras: Revisa la documentación de la implementación específica de Whisper y prueba la configuración con el audio representativo against
  • Verificaciones de repetición y anomalías: Señala las frases repetidas, los cambios bruscos de tema, las despedidas al estilo de los videos o los textos inusualmente fluidos durante los intervalos de silencio
  • Evaluación con control de versiones: Vuelve a probar los flujos de trabajo cuando cambies los modelos, la configuración de idioma, las indicaciones, el preprocesamiento o las bibliotecas de decodificación

Un estudio de 2025 también evaluó un método de posprocesamiento denominado “bag of hallucinations”, que filtraba los resultados recurrentes generados en sus experimentos no relacionados con el habla. El método redujo los errores en esas condiciones controladas, pero no debe considerarse un sustituto general de la revisión del audio original.

Mejores prácticas en flujos de trabajo

  • Fuente de audio Maintain: Mantener las grabaciones disponibles hasta que se haya verificado la transcripción, con sujeción a los requisitos de consentimiento, privacidad, retención y legales
  • Implementar la revisión humana: Se requiere una revisión antes de que los expedientes académicos de gran importancia influyan en la atención médica, las decisiones legales, la contratación, los resultados de investigaciones o las publicaciones
  • Prioriza los pasajes de alto riesgo: Repasa las secciones que contienen números, medicamentos, nombres, fechas, citas, términos legales o pausas prolongadas
  • Los equipos de Train sobre las señales de advertencia: Presta atención a las frases repetidas, al contenido inesperado, a los cambios bruscos de estilo o a las palabras que aparecen durante el silencio
  • Responsabilidad del documento: Deja claro quién debe revisar, aprobar, corregir y retain cada transcripción

Cómo elegir un software de transcripción con IA confiable

La investigación dirigida por Cornell sugiere que las alucinaciones que identificó no se reprodujeron de manera uniforme en todos los servicios de conversión de voz a texto. Cuando los investigadores probaron las 187 muestras de alucinaciones de Whisper con Google Cloud Speech-to-Text, Microsoft Azure Speech-to-Text, Amazon Transcribe, AssemblyAI y Rev AI, esos sistemas no generaron pasajes alucinados comparables en ese experimento.

Este es un hallazgo útil, pero no prueba que ningún servicio sea incapaz de producir alucinaciones. La comparación se limitó a muestras, versiones de servicio y configuraciones específicas.

Al evaluar software de transcripción, ten en cuenta lo siguiente:

  • Acceso al audio original: ¿Pueden los revisores reproducir la grabación al mismo tiempo que leen la transcripción?
  • Eficiencia de revisión: ¿Las palabras están vinculadas a marcas de tiempo para facilitar su verificación rápida?
  • Herramientas para oradores: ¿Pueden los usuarios identificar y corregir las etiquetas de los hablantes?
  • Controles terminológicos: ¿Pueden los equipos agregar nombres, acrónimos y términos técnicos?
  • Documentación de seguridad: ¿El proveedor documenta claramente el cifrado, los controles de acceso, las auditorías, la ubicación de los datos y la retención?
  • Idoneidad contractual: ¿Existen acuerdos adecuados para los datos regulados o confidenciales?
  • Opciones de exportación y auditoría: ¿Pueden los equipos guardar las versiones corregidas y documentar las aprobaciones?
  • Pruebas representativas: ¿Se ha probado el servicio con los idiomas, acentos, micrófonos y entornos reales de la organización?

El precio por sí solo no determina si un sistema va a dar problemas. La arquitectura, la implementación, la calidad de audio, las funciones de revisión y los controles operativos son factores importantes.

Aprovechamiento de funciones avanzadas para mejorar la calidad de la transcripción

Las características relacionadas con el modelo de transcripción pueden facilitar la identificación y corrección de errores.

Herramientas de edición y revisión

  • Códigos de tiempo a nivel de palabra: Vincular el texto de la transcripción al momento correspondiente de la grabación
  • Reproducción sincronizada: Que los revisores puedan escuchar mientras leen o editan
  • Identificación del orador: Separar los oradores y permitir que se corrijan las etiquetas
  • Edición en el navegador: Permitir realizar correcciones sin tener que trasladar el contenido a una aplicación aparte
  • Diccionarios personalizados: Permitir a los usuarios agregar nombres propios, terminología técnica, acrónimos y formas de escritura preferidas

Análisis y perspectivas

Herramientas de análisis de IA pueden extraer temas, resúmenes, capítulos, asuntos, opiniones o momentos clave de las transcripciones. Estos resultados dependen de la transcripción original. Los equipos deben corregir los errores importantes de transcripción antes de basarse en los análisis posteriores, especialmente cuando los resultados sirven de base para investigaciones, informes o decisiones empresariales.

Funciones de colaboración

Los espacios de trabajo compartidos, los permisos, los comentarios y los flujos de trabajo de revisión pueden ayudar a los equipos a asignar responsabilidades y evitar confusiones entre versiones. Las funciones de colaboración son más valiosas cuando una organización también define quién es responsable de aprobar el texto final.

Transcripción con IA segura y conforme a las normas para datos confidenciales

La seguridad y el cumplimiento normativo requieren algo más que un logotipo de certificación. Las organizaciones deben evaluar el servicio, el plan seleccionado, los términos contractuales, la configuración y el uso previsto.

El proceso de registro de proveedores de tecnología de voz ambiental del NHS de Inglaterra exige que los proveedores participantes presenten evidencia de que sus productos son dispositivos médicos de Clase I y que cuenten con una evaluación vigente según los Criterios de Evaluación de Tecnología Digital. Esto pone de manifiesto un mayor escrutinio de las herramientas de documentación clínica, pero no debe interpretarse como una regla universal que se aplique de manera idéntica a todos los productos de transcripción en todos los entornos del NHS.

Las capacidades de seguridad que se deben examinar incluyen:

  • Auditorías independientes de controles, como la SOC 2 Tipo II
  • Cifrado en tránsito y en reposo
  • Controles de acceso basados en funciones
  • Autenticación multifactorial y opciones de identidad corporativa
  • Información sobre la ubicación y la retención de datos
  • Controles de eliminación y exportación
  • Acuerdos de socios comerciales u otras garantías contractuales adecuadas, cuando sea necesario

Las organizaciones deben verificar el alcance exacto de cada certificación y determinar si se aplica al servicio, al plan y al caso de uso que pretenden implementar.

Por qué Sonix respalda los flujos de trabajo de transcripción con IA verificable

Para los equipos que necesitan revisar y administrar las transcripciones de manera eficiente, Sonix combina la transcripción automatizada con herramientas para verificar el resultado con respecto a la grabación original.

Las funciones actuales de Sonix incluyen:

  • Un editor basado en navegador con reproducción sincronizada, búsqueda, navegación a nivel de palabra y etiquetado de hablantes
  • Diccionarios personalizados que permiten a los usuarios agregar nombres, terminología técnica, acrónimos y formas de escribir preferidas
  • Certificación SOC 2 Tipo II, cifrado TLS en tránsito y cifrado AES-256 en reposo
  • Medidas de protección alineadas con la HIPAA a través de Medical Sonix, incluyendo acuerdos de socio comercial para organizaciones de atención médica que cumplan con los requisitos
  • Compatibilidad con la transcripción en más de 54 idiomas
  • Análisis basados en IA para resúmenes, capítulos, temas, opiniones y otros datos extraídos de las transcripciones
  • Controles de colaboración en equipo, incluyendo espacios de trabajo, permisos y funciones para compartir

Estos controles ayudan a los usuarios a detectar y corregir errores, pero no eliminan la necesidad de una revisión. No se debe dar por sentado que una transcripción automatizada refleje a la perfección cada palabra pronunciada sin antes verificarla.

Ya seas un empresa de investigación análisis de entrevistas, un sala de prensa plazos de trabajo against, o un empresa Para un equipo que maneja grandes volúmenes de grabaciones, el flujo de trabajo más seguro es aquel que mantiene la transcripción vinculada al audio original y asigna claramente la responsabilidad de la aprobación.

Veredicto final: Cómo elegir la solución de transcripción adecuada para tus necesidades

La decisión entre un flujo de trabajo de Whisper autogestionado y una plataforma de transcripción alojada depende de los recursos técnicos, los requisitos de datos, las necesidades de revisión y la tolerancia al riesgo.

Un flujo de trabajo de Whisper autogestionado puede ser adecuado cuando:

  • El contenido presenta un riesgo bajo y se aceptan errores ocasionales
  • La organización puede probar diferentes versiones del modelo, así como los ajustes de preprocesamiento, segmentación y decodificación
  • El personal técnico puede implementar medidas de monitoreo y mitigación
  • Grabaciones originales remain disponibles para su verificación
  • Una persona calificada revisa los resultados importantes antes de su uso

Una plataforma de transcripción gestionada puede ser la mejor opción cuando necesites:

  • Un editor sincronizado para comparar texto con audio original
  • Herramientas de identificación del hablante, marca de tiempo, terminología y corrección
  • Espacios de trabajo compartidos y permisos
  • Controles de seguridad y privacidad documentados
  • Compatibilidad con varios idiomas y formatos de exportación
  • Un flujo de trabajo que permite a los revisores sin conocimientos técnicos aprobar las transcripciones de manera eficiente

En los ámbitos de la salud, el derecho, la investigación, el periodismo y otros entornos de gran importancia, la pregunta clave no es si un proveedor promete una precisión perfecta, sino si el sistema hace visibles los errores, conserva las pruebas necesarias para corregirlos y cuenta con un proceso de revisión adecuado a las consecuencias que podría acarrear una transcripción errónea.

Preguntas frecuentes

¿Qué es una «alucinación de IA» en la transcripción?

La alucinación de la IA en la transcripción ocurre cuando un sistema de conversión de voz a texto genera una palabra, frase u oración que no tiene una base significativa en la grabación original. A diferencia de una sustitución común, una alucinación puede introducir contenido completamente nuevo. En un estudio realizado con 13 140 segmentos cortos de audio, los investigadores identificaron 187 alucinaciones y clasificaron 381 de ellas como contenientes de daños explícitos, tales como lenguaje violento, asociaciones inexactas, información inventada o falsa autoridad.

¿Por qué a veces Whisper AI inventa palabras o frases?

Whisper es un Transformer de codificador-decodificador que genera tokens de texto en función del audio. Cuando la evidencia acústica es débil —como durante el silencio, pausas largas, ruido de fondo, música o habla fragmentada—, el decodificador a veces puede producir texto fluido que no está suficientemente basado en la grabación. Los datos de entrenamiento, la segmentación, las indicaciones, la versión del modelo y la configuración de decodificación también pueden influir en el resultado.

¿Cómo puedo reducir las alucinaciones en las transcripciones generadas por IA?

Utiliza la detección de actividad de voz u otros filtros de señales no vocales cuando sea apropiado; prueba los ajustes de segmentación y decodificación con grabaciones representativas; marca las repeticiones sospechosas o el texto que aparezca durante los silencios; retain el audio original; y solicita una revisión humana para el contenido relevante. Las medidas de mitigación pueden reducir el riesgo, pero ningún método de preprocesamiento garantiza una transcripción libre de errores.

¿Las herramientas gratuitas de transcripción con IA son más propensas a las «alucinaciones»?

No necesariamente. El riesgo de alucinaciones no depende únicamente del precio. Depende del modelo, la arquitectura, la implementación, las condiciones de audio y los controles de calidad del sistema. Las plataformas Paid pueden ofrecer mejores funciones de revisión, seguridad, colaboración y auditoría, pero los usuarios deben evaluar esas capacidades directamente, en lugar de dar por sentado que el precio garantiza la precisión.

¿Sonix aborda el problema de las «alucinaciones» en la transcripción con IA?

Sonix ofrece un editor basado en navegador sincronizado con la grabación original, navegación a nivel de palabra, herramientas para identificadores de hablantes, diccionarios personalizados y controles de revisión colaborativa. Estas funciones ayudan a los usuarios a identificar y corregir errores de transcripción. Deben considerarse como medidas de seguridad para la verificación, más que como prueba de que una transcripción automatizada no puede cometer errores, especialmente cuando el contenido influirá en decisiones de salud, legales, de investigación u otras de alto riesgo.

Obtenga transcripciones precisas en cuestión de minutos

Empiece a transcribir de forma más inteligente. Prueba Sonix gratis o explora nuestros precios para encontrar el plan adecuado para ti.