L'éducation

Whisper peut-il produire des transcriptions erronées ? Pourquoi la transcription par IA invente des choses

par LoudSpeaker Marketing 13 min lecture
Dans cet article

Vous venez de transcrire une consultation médicale cruciale, une déposition judiciaire ou des heures d’entretiens de recherche, pour finalement vous rendre compte que l’outil de transcription basé sur l’IA a inséré des mots, des expressions ou des phrases entières qui n’ont jamais été prononcés. Il s’agit d’un mode de fonctionnement documenté, connu sous le nom d’« hallucination de transcription », qui peut entraîner de graves problèmes lorsque les transcriptions sont utilisées sans vérification préalable.

Dans une étude réalisée en 2024 portant sur 13 140 courts extraits audio en anglais, des chercheurs ont identifié des expressions ou des phrases hallucinatoires dans 1.4% des segments traités dans les conditions de test de l'étude. Ce taux ne doit pas être considéré comme universel : les résultats peuvent varier considérablement en fonction de la version du modèle, du contenu audio, de la langue, de la population de locuteurs, de la segmentation et des paramètres de décodage. Cependant, l'étude démontre pourquoi les équipes qui s'appuient sur transcription automatisée Les travaux à enjeux élevés nécessitent des processus de révision fiables et l'accès à l'enregistrement original.

Les implications vont bien au-delà des simples erreurs de transcription. Les chercheurs ont relevé des exemples comportant des propos violents, des associations raciales erronées, des informations personnelles inventées de toutes pièces et des traitements médicaux inexistants.

Principaux enseignements

  • Dans une étude, Whisper a généré des expressions ou des phrases hallucinatoires dans 1,41 TP5T sur 13 140 courts extraits audio testés
  • Les chercheurs ont classé 38% des hallucinations identifiées comme comportant des préjudices explicites, notamment un langage violent, des associations erronées, des informations personnelles inventées ou une fausse autorité.
  • Une comparaison complémentaire a révélé que cinq autres services de reconnaissance vocale n'avaient pas généré de passages erronés comparables sur les 187 échantillons testés, bien que ce résultat ne prouve pas que ces services ne commettent jamais d'erreurs.
  • Le silence, les longues pauses, les bruits de fond et autres intervalles sans parole sont souvent associés aux hallucinations de type « chuchotement ».
  • Dans l'ensemble de données de l'étude, les hallucinations sont apparues plus fréquemment dans les segments provenant de locuteurs aphasiques que dans les segments du groupe témoin, ce qui soulève des questions concernant l'accessibilité raising et la fairness.
  • La détection d'activité vocale et d'autres méthodes de filtrage des signaux non vocaux peuvent réduire les « hallucinations » dans certains workflows Whisper, mais leur efficacité dépend du modèle, du fichier audio et de la configuration.
  • Les enregistrements originaux doivent rester disponibles jusqu’à ce que les transcriptions officielles aient été vérifiées et approuvées.
  • Il ne faut jamais considérer qu'un système de transcription automatisé est exempt d'erreurs, en particulier dans les domaines de la santé, du droit, de l'emploi ou de la recherche.

Comprendre la transcription par IA : comment la parole se transforme en texte

La transcription par IA moderne s'appuie sur des réseaux neuronaux entraînés à partir de vastes ensembles de données audio pour convertir la parole en texte écrit. Cette technologie a révolutionné la manière dont les professionnels traitent les contenus audio, en transformant les enregistrements en texte consultable bien plus rapidement que la transcription manuelle.

Les différents systèmes utilisent des architectures variées, mais le processus comprend généralement plusieurs étapes :

  • Traitement audio: Le signal audio brut est converti en une représentation telle qu'un spectrogramme
  • Reconnaissance vocale: Un modèle identifie des motifs dans le signal audio et les associe à des tokens de texte
  • Décodage de séquences: Le système sélectionne une séquence probable de mots en se basant à la fois sur l'audio et sur les modèles appris lors de l'entraînement.
  • Post-traitement: Des signes de ponctuation, des horodatages, des indications d'interlocuteur et des mises en forme peuvent être ajoutés

Ces systèmes peuvent donner de bons résultats avec des enregistrements audio clairs, mais leur précision dépend de la qualité de l'enregistrement, des accents, des interférences vocales, de la terminologie technique, des bruits de fond et du degré de similitude entre l'enregistrement audio et les données d'entraînement du modèle.

Qu'est-ce que les « hallucinations » de l'IA dans la transcription ?

Les “ hallucinations ” de l'IA dans la transcription se produisent lorsqu'un système de reconnaissance vocale génère un texte qui n'a aucun fondement significatif dans l'enregistrement audio source. Cela diffère d'une simple substitution, comme le fait de transcrire “ chat ” par « chapeau ». Une hallucination peut introduire une expression ou une phrase entière qui n'a jamais été prononcée.

Les chercheurs, après avoir analysé 13 140 segments audio, ont identifié 187 hallucinations. Ils ont classé 38% de ces passages hallucinatoires comme comportant des menaces explicites, notamment :

  • Langage violent: Intégrer des propos violents dans un discours par ailleurs inoffensif
  • Associations erronées: Ajouter des caractéristiques, telles que l'origine ethnique, que l'orateur n'a jamais mentionnées
  • Fabrications médicales: Inventer des traitements ou des noms de médicaments qui n'existent pas
  • Fausse autorité: Ajouter une formulation qui s'apparente à une citation, à une légende ou à une déclaration faisant autorité

Ces exemples sont préoccupants, car un texte inventé de toutes pièces peut paraître fluide et crédible, ce qui rend difficile de s'en rendre compte sans comparer la transcription avec l'enregistrement audio d'origine.

Une autre étude menée en 2025 a délibérément soumis Whisper à des sons non vocaux afin d’examiner dans quelles conditions le modèle génère du texte en l’absence d’entrée vocale. Les chercheurs ont observé des expressions récurrentes telles que “ merci ” et “ merci d’avoir regardé ”. Ils ont émis l’hypothèse que ces schémas pourraient refléter le langage courant des contenus issus du Web utilisés lors de l’entraînement du modèle. Les expériences portant spécifiquement sur des fichiers non vocaux, leurs pourcentages ne doivent pas être interprétés comme des taux d’hallucinations attendus dans le cadre de conversations ou d’entretiens ordinaires.

Pourquoi les modèles de transcription basés sur l'IA, comme Whisper, produisent-ils des « hallucinations » ?

OpenAI décrit Whisper comme un Transformer de type encodeur-décodeur. Le signal audio est converti en un spectrogramme log-Mel puis traité par un encodeur audio, tandis qu'un décodeur génère les tokens de texte correspondants.

Comme le modèle génère du texte de manière séquentielle, il peut parfois produire un résultat fluide qui n'est pas suffisamment ancré dans l'entrée acoustique. Les chercheurs et les développeurs ont observé que ce comportement est particulièrement fréquent dans les cas suivants :

  • Le silence et les longues pauses: Les intervalles prolongés sans voix peuvent ne fournir au décodeur que des indices acoustiques peu probants
  • Sons non verbaux: La musique, les sons de fond et les bruits ambiants peuvent parfois déclencher la génération de texte
  • Mauvaise qualité d'enregistrement: La distorsion, un faible volume, l'écrêtage ou un bruit de fond important rendent le signal vocal plus difficile à comprendre
  • Troubles de la fluidité verbale: Le bégaiement, les hésitations, un discours saccadé et les longues pauses peuvent rendre la compréhension plus difficile
  • Paramètres de segmentation et de décodage: La longueur des segments, les seuils, les invites et d'autres choix de mise en œuvre peuvent influencer le résultat

OpenAI a indiqué que le système Whisper original avait été entraîné sur 680 000 heures d'enregistrements audio multilingues et multitâches supervisés, collectés sur le Web. L'étendue de cet ensemble de données contribue à la flexibilité du modèle, mais les données d'entraînement issues du Web peuvent également exposer le système à des schémas répétitifs en matière de sous-titrage et de langage vidéo.

Les chercheurs n'ont pas identifié de cause unique à l'origine de toutes les hallucinations. Les données disponibles suggèrent que les hallucinations résultent d'une interaction entre les conditions audio, l'architecture du modèle, les données d'apprentissage et les choix de décodage.

L'impact des hallucinations sur la précision de la transcription

Pour les professionnels de la santé, du droit, de la recherche et des médias, une expression inventée peut avoir des conséquences plus graves qu'une simple faute d'orthographe.

Conséquences sur la santé

En octobre 2024, l'Associated Press a rapporté que Nabla said indiquait que son produit de documentation clinique basé sur Whisper était utilisé par plus de 30 000 professionnels de santé au sein de 40 réseaux de santé. Nabla said a également précisé que ce produit avait traité environ sept millions de consultations médicales.

L'agence AP a rapporté que Nabla avait effacé les enregistrements audio originaux après leur traitement, pour des raisons de sécurité des données. Les cliniciens de Nabla said étaient tenus d'examiner et d'approuver les notes générées. Cet exemple illustre une tension importante : la suppression des enregistrements peut réduire certains risques liés à la conservation des données, mais elle peut également empêcher toute comparaison ultérieure avec la conversation originale.

OpenAI a mis en garde contre le fait de se fier aux résultats de la reconnaissance vocale dans des contextes décisionnels où des inexactitudes peuvent avoir des conséquences importantes. Les établissements de santé devraient donc exiger un contrôle par des professionnels de santé, mettre en place des politiques claires en matière de conservation et de vérification des données, et recourir à des services couverts par des garanties contractuelles et de confidentialité appropriées.

Dans le domaine juridique, le contenu d'un procès-verbal falsifié pourrait avoir des répercussions sur la préparation d'une déposition, l'analyse d'une affaire ou l'examen des éléments de preuve. Un projet de procès-verbal généré automatiquement ne doit pas être considéré comme un document officiel sans avoir fait l'objet de la vérification et de la certification requises par le tribunal compétent, la juridiction concernée ou les règles professionnelles applicables.

Les équipes de recherche sont confrontées à un risque connexe. Si une citation inventée est intégrée au codage qualitatif ou à l'analyse thématique, elle peut influencer les résultats et compromettre l'intégrité de l'étude. Les chercheurs doivent conserver les enregistrements sources, documenter leur processus de transcription et vérifier les citations utilisées dans les rapports ou les publications.

L'étude menée par l'université de Cornell a également mis en évidence une disparité entre ses ensembles de données relatifs à l'aphasie et ceux du groupe témoin. Des hallucinations sont apparues chez 1,71 TP5T de segments provenant de locuteurs aphasiques et 1,2% de segments témoins. Les chercheurs ont attribué cette différence à des durées non vocales plus longues. Cela ne signifie pas que toutes les personnes présentant un trouble de la parole connaîtront la même disparité, mais cela soulève des préoccupations en matière d’accessibilité et de fiabilité pour les organisations utilisant des transcriptions automatisées dans des contextes à enjeux importants.

Bonnes pratiques pour réduire au minimum les « hallucinations » liées à la transcription par IA

Aucune méthode de correction ne garantit une transcription parfaite. Cependant, plusieurs pratiques permettent de réduire les risques et de faciliter la détection des erreurs.

Approches techniques d'atténuation

  • Prétraitement par détection d'activité vocale: Le fait de supprimer ou d'isoler les intervalles sans parole avant la transcription peut réduire la probabilité qu'un modèle génère du texte pendant les moments de silence
  • Une segmentation minutieuse: Traiter l'audio par segments adaptés au modèle sélectionné plutôt que d'appliquer des règles de durée arbitraires
  • Paramètres de décodage prudents: Consultez la documentation relative à l'implémentation spécifique de Whisper et testez les paramètres against sur un fichier audio représentatif
  • Contrôles de répétition et d'anomalies: Signaler les phrases répétées, les changements brusques de sujet, les formules de conclusion de type vidéo ou les passages particulièrement fluides pendant les moments de silence
  • Évaluation sous contrôle de version: Tester à nouveau les workflows en cas de modification des modèles, des paramètres linguistiques, des invites, du prétraitement ou des bibliothèques de décodage

Une étude de 2025 a également testé une méthode de post-traitement appelée “ bag of hallucinations ”, qui filtrait les résultats récurrents générés lors d'expériences ne portant pas sur la parole. Cette méthode a permis de réduire les erreurs dans ces conditions contrôlées, mais elle ne doit pas être considérée comme un substitut général à la vérification de l'audio source.

Meilleures pratiques en matière de flux de travail

  • Source audio Maintain: Conserver les enregistrements à disposition jusqu'à ce que la transcription ait été vérifiée, sous réserve des exigences en matière de consentement, de confidentialité, de conservation et des obligations légales
  • Mettre en place une vérification par un opérateur humain: Exiger un examen préalable avant que des dossiers médicaux à fort enjeu n'influencent les soins, les décisions juridiques, les recrutements, les résultats de recherche ou les publications
  • Donner la priorité aux passages à haut risque: Revoir les passages contenant des chiffres, des noms de médicaments, des noms propres, des dates, des citations, des termes juridiques ou de longs silences
  • Les équipes Train et les panneaux d'avertissement: Soyez attentif aux phrases répétées, aux contenus inattendus, aux changements brusques de style ou aux mots qui surgissent dans le silence
  • Responsabilité relative au document: Précisez clairement qui doit vérifier, approuver, corriger et retain chaque relevé de notes

Choisir un logiciel de transcription par IA fiable

Les recherches menées par l’université de Cornell suggèrent que les hallucinations identifiées n’ont pas été reproduites de manière uniforme par tous les services de reconnaissance vocale. Lorsque les chercheurs ont testé les 187 échantillons d'« hallucinations Whisper » avec Google Cloud Speech-to-Text, Microsoft Azure Speech-to-Text, Amazon Transcribe, AssemblyAI et Rev AI, ces systèmes n'ont pas produit de passages hallucinatoires comparables dans le cadre de cette expérience.

Il s'agit là d'une constatation utile, mais elle ne prouve pas qu'un service quelconque soit incapable d'halluciner. La comparaison s'est limitée à des échantillons, des versions de service et des configurations spécifiques.

Lors de l'évaluation logiciel de transcription, réfléchissez à ceci :

  • Accès à la source audio: Les relecteurs peuvent-ils écouter l'enregistrement tout en consultant la transcription ?
  • Évaluer l'efficacité: Les mots sont-ils associés à des horodatages afin de permettre une vérification rapide ?
  • Outils pour les intervenants: Les utilisateurs peuvent-ils identifier et corriger les étiquettes attribuées aux locuteurs ?
  • Contrôles terminologiques: Les équipes peuvent-elles ajouter des noms, des acronymes et du vocabulaire technique ?
  • Documentation relative à la sécurité: Le prestataire documente-t-il clairement le chiffrement, les contrôles d'accès, les audits, l'emplacement des données et leur durée de conservation ?
  • Adéquation contractuelle: Existe-t-il des accords adaptés aux données réglementées ou confidentielles ?
  • Options d'exportation et d'audit: Les équipes peuvent-elles conserver les versions corrigées et consigner les validations ?
  • Tests représentatifs: Le service a-t-il été testé avec les langues, les accents, les microphones et les environnements réels de l'organisation ?

Le prix ne suffit pas à lui seul à déterminer si un système va « délirer ». L'architecture, la mise en œuvre, la qualité audio, les fonctions de contrôle et les commandes de fonctionnement sont autant d'éléments qui comptent.

Tirer parti des fonctionnalités avancées pour améliorer la qualité de la transcription

Certaines fonctionnalités liées au modèle de transcription peuvent faciliter l'identification et la correction des erreurs.

Outils d'édition et de révision

  • Codes temporels au niveau des mots: Associer le texte de la transcription au moment correspondant de l'enregistrement
  • Lecture synchronisée: Permettre aux relecteurs d'écouter tout en lisant ou en corrigeant
  • Identification de l'orateur: Séparer les intervenants et permettre la correction des légendes
  • Édition directement dans le navigateur: Permettre d'effectuer des corrections sans avoir à transférer le contenu vers une autre application
  • Dictionnaires personnalisés: Permettre aux utilisateurs d'ajouter des noms propres, des termes techniques, des acronymes et les orthographes de leur choix

Analyses et perspectives

Outils d'analyse de l'IA peuvent extraire des thèmes, des résumés, des chapitres, des sujets, des sentiments ou des moments clés à partir de transcriptions. Ces résultats dépendent de la transcription sur laquelle ils s'appuient. Les équipes doivent corriger les erreurs de transcription importantes avant de s'appuyer sur les analyses en aval, en particulier lorsque les résultats servent à étayer des travaux de recherche, des rapports ou des décisions commerciales.

Fonctionnalités de la collaboration

Les espaces de travail partagés, les autorisations, les commentaires et les processus de révision peuvent aider les équipes à répartir les responsabilités et à éviter toute confusion entre les différentes versions. Les fonctionnalités de collaboration sont particulièrement utiles lorsque l'organisation définit également qui est chargé d'approuver le texte final.

Transcription par IA sécurisée et conforme aux normes pour les données sensibles

La sécurité et la conformité ne se résument pas à un simple logo de certification. Les organisations doivent évaluer le service, l'offre choisie, les conditions contractuelles, la configuration et l'usage prévu.

La procédure d'enregistrement des fournisseurs de solutions de reconnaissance vocale du NHS England exige que les fournisseurs participants fournissent la preuve que leurs produits relèvent de la classe I des dispositifs médicaux et qu'ils disposent d'une évaluation en cours de validité selon les critères d'évaluation des technologies numériques (Digital Technology Assessment Criteria). Cela témoigne d'une surveillance accrue des outils de documentation clinique, mais ne doit pas être interprété comme une règle universelle s'appliquant de manière identique à tous les produits de transcription dans tous les contextes du NHS.

Les fonctionnalités de sécurité à examiner sont les suivantes :

  • Audits de contrôles indépendants, tels que SOC 2 Type II
  • Chiffrement en transit et au repos
  • Contrôles d'accès basés sur les rôles
  • Authentification multifactorielle et options de gestion des identités d'entreprise
  • Informations relatives à la localisation et à la conservation des données
  • Contrôles relatifs à la suppression et à l'exportation
  • Accords de partenariat commercial ou autres garanties contractuelles appropriées, le cas échéant

Les organisations doivent vérifier la portée exacte de chaque certification et déterminer si celle-ci s'applique au service, au plan et au cas d'utilisation qu'elles envisagent de mettre en œuvre.

Pourquoi Sonix prend en charge les flux de travail de transcription basés sur l'IA vérifiable

Pour les équipes qui ont besoin d'examiner et de gérer efficacement les transcriptions, Sonix associe la transcription automatisée à des outils permettant de vérifier le résultat par rapport à l'enregistrement source.

Les fonctionnalités actuelles de Sonix comprennent :

  • Un éditeur accessible via un navigateur, offrant une lecture synchronisée, une fonction de recherche, une navigation au niveau des mots et l'identification des locuteurs
  • Des dictionnaires personnalisés permettant aux utilisateurs d'ajouter des noms, des termes techniques, des acronymes et des orthographes préférées
  • Certification SOC 2 de type II, chiffrement TLS en transit et chiffrement AES-256 au repos
  • Mesures de protection conformes à la loi HIPAA mises en place par Medical Sonix, notamment des accords de partenariat commercial destinés aux établissements de santé éligibles
  • Prise en charge de la transcription dans plus de 54 langues
  • Analyse alimentée par l'IA pour des résumés, des chapitres, des thèmes, des sentiments et d'autres informations tirées des transcriptions
  • Fonctionnalités de gestion de la collaboration en équipe, notamment les espaces de travail, les autorisations et les fonctionnalités de partage

Ces contrôles aident les utilisateurs à détecter et à corriger les erreurs, mais ils ne dispensent pas d'une relecture. Il ne faut pas considérer qu'une transcription automatisée reflète parfaitement chaque mot prononcé sans vérification préalable.

Que vous soyez un cabinet d'études l'analyse d'entretiens, a salle de presse respect des délais against, ou un entreprise Pour une équipe chargée de traiter d'importants volumes d'enregistrements, le flux de travail le plus sûr est celui qui maintient le lien entre la transcription et l'enregistrement audio d'origine et qui définit clairement les responsabilités en matière de validation.

Conclusion finale : choisir la solution de transcription la mieux adaptée à vos besoins

Le choix entre un flux de travail Whisper autogéré et une plateforme de transcription hébergée dépend des ressources techniques, des exigences en matière de données, des besoins en matière de révision et de la tolérance au risque.

Un workflow Whisper autogéré peut s'avérer approprié dans les cas suivants :

  • Le contenu présente peu de risques et quelques erreurs occasionnelles sont acceptables.
  • L'organisation peut tester différentes versions du modèle, ainsi que les paramètres de prétraitement, de segmentation et de décodage.
  • Le personnel technique peut mettre en place des mesures de surveillance et d'atténuation
  • Enregistrements sources remain et available à des fins de vérification
  • Une personne qualifiée vérifie les résultats importants avant leur utilisation.

Une plateforme de transcription gérée peut s'avérer préférable lorsque vous avez besoin :

  • Un éditeur synchronisé permettant de comparer un texte avec l'audio source
  • Outils de reconnaissance vocale, d'horodatage, de terminologie et de correction
  • Espaces de travail partagés et autorisations
  • Mesures de sécurité et de protection de la vie privée documentées
  • Prise en charge de plusieurs langues et formats d'exportation
  • Un processus permettant aux relecteurs non spécialisés en informatique de valider efficacement les transcriptions

Dans les domaines de la santé, du droit, de la recherche, du journalisme et d’autres secteurs où les enjeux sont importants, la question essentielle n’est pas de savoir si un fournisseur promet une précision parfaite. Il s’agit plutôt de déterminer si le système rend les erreurs visibles, conserve les éléments de preuve nécessaires pour les corriger et prend en charge un processus de révision adapté aux conséquences d’une transcription erronée.

Questions fréquemment posées

Qu'est-ce qu'une « hallucination » de l'IA dans la transcription ?

Une « hallucination » de l’IA dans la transcription se produit lorsqu’un système de reconnaissance vocale génère un mot, une expression ou une phrase qui n’a aucun fondement significatif dans l’enregistrement source. Contrairement à une simple substitution, une hallucination peut introduire un contenu entièrement nouveau. Dans une étude portant sur 13 140 courts segments audio, les chercheurs ont identifié 187 hallucinations et en ont classé 38% comme comportant des préjudices explicites, tels que des propos violents, des associations erronées, des informations inventées ou une fausse autorité.

Pourquoi Whisper AI invente-t-il parfois des mots ou des expressions ?

Whisper est un Transformer de type encodeur-décodeur qui génère des tokens de texte en fonction d'un signal audio. Lorsque les indices acoustiques sont faibles — par exemple en cas de silence, de longues pauses, de bruit de fond, de musique ou de discours fragmenté —, le décodeur peut parfois produire un texte fluide qui n'est pas suffisamment ancré dans l'enregistrement. Les données d'entraînement, la segmentation, les invites, la version du modèle et les paramètres de décodage peuvent également influencer le résultat.

Comment puis-je réduire les erreurs dans les transcriptions générées par l'IA ?

Utilisez la détection d'activité vocale ou tout autre filtrage des éléments non vocaux lorsque cela est approprié, testez les paramètres de segmentation et de décodage sur des enregistrements représentatifs, signalez les répétitions suspectes ou le texte apparaissant pendant les silences, retain l'audio d'origine, et exigez une vérification humaine pour les contenus sensibles. Les mesures d'atténuation peuvent réduire les risques, mais aucune méthode de prétraitement ne garantit une transcription sans erreur.

Les outils de transcription gratuits basés sur l'IA sont-ils plus enclins à produire des « hallucinations » ?

Pas nécessairement. Le risque d'erreur n'est pas déterminé uniquement par le prix. Il dépend du modèle, de l'architecture, de la mise en œuvre, des conditions audio et des contrôles de qualité associés au système. Les plateformes Paid peuvent offrir de meilleures fonctionnalités en matière de révision, de sécurité, de collaboration et d'audit, mais les utilisateurs devraient évaluer ces capacités directement plutôt que de partir du principe que le prix est un gage de précision.

Sonix prend-il en compte les « hallucinations » liées à la transcription par IA ?

Sonix propose un éditeur accessible via un navigateur, synchronisé avec l'enregistrement source, une navigation au niveau des mots, des outils de gestion des locuteurs, des dictionnaires personnalisés et des fonctionnalités de révision collaborative. Ces fonctionnalités aident les utilisateurs à identifier et à corriger les erreurs de transcription. Elles doivent être considérées comme des mesures de vérification plutôt que comme la preuve qu’une transcription automatisée ne peut pas produire d’erreurs, en particulier lorsque le contenu est susceptible d’influencer des décisions dans les domaines de la santé, du droit, de la recherche ou d’autres domaines où les enjeux sont importants.

Obtenez une transcription précise en quelques minutes

Commencez à transcrire plus intelligemment. Essayez Sonix gratuitement ou découvrez nos tarifs pour trouver le plan qui vous convient.