Qu'est-ce que le taux d'erreur de mots ?

Le chiffre derrière toutes les promesses de précision de transcription — comment il se calcule, ce qu'il dissimule et comment le mesurer sur votre propre audio.

Formule du taux d'erreur de mots

Le taux d'erreur sur les mots — WER, pour word error rate — est la manière standard de mesurer la performance d'un système de reconnaissance automatique de la parole (ASR). Il compare la transcription de la machine à une transcription de référence soigneusement préparée par un humain et compte trois types d'erreurs : les substitutions, les suppressions et les insertions. Le mesurer est plus délicat qu'il n'y paraît, car le résultat de l'ASR peut avoir une longueur différente de celle de l'audio d'origine.

Voici une manière simple de comprendre comment le WER est calculé :

Sonix - Formule du taux d'erreur de mots

Un WER de 5% signifie à peu près une erreur tous les vingt mots — dit autrement, 95% de précision. Mais les chiffres restent abstraits. Voici chaque type d'erreur faisant de vrais dégâts :

Suppression1 mot perdu
Vous avez dit
Ne signez pas ce contrat
La machine a écrit
Ne signez pas ce contrat

Un seul mot disparu, et un après-midi radicalement différent pour le service juridique.

1 suppression ÷ 5 mots = 20% de WER — et 100% du sens

Insertion1 mot ajouté
Vous avez dit
Les résultats étaient prometteurs
La machine a écrit
Les résultats étaient peu prometteurs

Le même petit mot, surgi sans invitation. Les investisseurs brièvement effondrés.

1 insertion ÷ 4 mots = 25% de WER

Substitution1 mot remplacé
Vous avez dit
Apportez un verre au campement
La machine a écrit
Apportez un verre ver au campement

Une seule lettre entre l'apéro et une partie de pêche.

1 substitution ÷ 5 mots = 20% de WER

Calculateur de WER : essayez la formule vous-même

Maintenant que vous savez ce qui compte comme une erreur, faites le calcul. Définissez la longueur de votre transcription de référence, glissez-y les erreurs repérées et regardez le taux d'erreur sur les mots évoluer — c'est exactement l'arithmétique qui se cache derrière chaque promesse de précision que vous lirez.

2.0%taux d'erreur sur les mots
98.0%précision

≈ une erreur tous les 50 mots

Territoire audio impeccable — un survol rapide et c'est prêt à publier.

Le calcul, en direct : (6 + 3 + 1) ÷ 500 = 2.0%

La course à la précision, et là où elle a abouti

La reconnaissance vocale a fait beaucoup de chemin depuis les années 1950 — notre brève histoire de la reconnaissance vocale retrace le parcours. Dès 2017, les plus grandes entreprises technologiques se livraient publiquement une course au WER, mesuré sur une référence standard de conversations téléphoniques enregistrées :

Mars 2017 : IBM revendique un taux d'erreur de mots de 5,5 %
Mai 2017 : Google revendique un taux d'erreur de mots de 4,9 %
Août 2017 : Microsoft revendique un taux d'erreur de mots de 5,1 %

Ces annonces comptaient parce qu'elles approchaient le taux d'erreur des transcripteurs humains professionnels sur la même référence — le moment que l'industrie a baptisé « parité humaine ». Mais la course sur les références propres s'est essentiellement soldée par une nuée de chiffres semblables. Sur des jeux de test soigneusement enregistrés et mono-domaine, tous les moteurs modernes sérieux obtiennent de bons scores — c'est précisément pour cela que le WER de référence a cessé d'être la question intéressante.

Les vraies différences entre systèmes de transcription se révèlent désormais ailleurs : sur l'audio de réunion capté à distance, les locuteurs qui se chevauchent, les accents prononcés, le vocabulaire spécialisé et les enregistrements bruités du monde réel. Deux moteurs aux scores de référence quasi identiques peuvent se comporter très différemment sur votre conférence téléphonique du mardi — c'est pourquoi la seule comparaison qui compte est celle que vous menez sur votre propre audio.

Ce que le WER ne mesure pas

Le WER compte les erreurs de mots et rien d'autre — or une bonne partie de ce qui rend une transcription exploitable lui est invisible. La ponctuation et les majuscules ne sont pas notées : un mur de mots parfaitement reconnus mais sans ponctuation peut afficher un excellent WER tout en étant pénible à lire. L'attribution des locuteurs n'est pas notée non plus — mettre les bons mots dans la bouche de la mauvaise personne est gratuit, du point de vue du WER. Les nombres, les dates et les noms sont notés comme n'importe quel autre mot, même si se tromper sur « MRSA » ou « chiffre d'affaires du T3 » coûte généralement bien plus cher qu'un « le » oublié.

C'est pourquoi une transcription au taux d'erreur légèrement plus élevé, mais avec une ponctuation, des paragraphes et des étiquettes de locuteurs propres, est souvent plus utile qu'une transcription techniquement « plus précise » mais sans structure. Lorsque vous évaluez la qualité d'une transcription, lisez le résultat comme un document, et pas seulement comme un décompte de mots — et pondérez les erreurs selon ce qu'elles vous coûteraient, non selon leur nombre.

Comment mener votre propre test de WER

Ignorez le chiffre marketing de chaque fournisseur, le nôtre y compris — le test qui compte prend environ une heure. Choisissez dix minutes d'audio réellement représentatives de votre travail : vos salles de réunion, vos personnes interviewées, votre jargon. Préparez-en une transcription de référence soignée (c'est l'étape lente — la référence doit être exacte). Passez ensuite le même extrait dans chaque service que vous évaluez et comptez les substitutions, les suppressions et les insertions par rapport à votre référence.

Deux avertissements pratiques. Premièrement, normalisez avant de compter : décidez d'emblée si « OK » et « okay », les chiffres et les nombres écrits en toutes lettres, ou les mots de remplissage comptent comme des erreurs, et appliquez les mêmes règles à chaque moteur — c'est là que la plupart des comparaisons maison dérapent, pas dans le décompte. Deuxièmement, ne vous arrêtez pas au taux d'erreur : notez quels types de mots chaque moteur a manqués et à quel point le résultat a réellement dû être nettoyé. Un raccourci presque aussi efficace : transcrivez l'extrait partout, corrigez chaque transcription jusqu'à la qualité de publication, et chronométrez le nettoyage. Le moteur qui vous coûte le moins de corrections sur votre audio est le plus précis, quoi que disent les références.

Décrypter les promesses de précision des fournisseurs (y compris les nôtres)

Quand Sonix annonce « jusqu'à 99% de précision », ce chiffre décrit un audio clair et bien enregistré — micros rapprochés, bruit de fond minimal, un seul locuteur à la fois. C'est un chiffre honnête dans ces conditions, et le chiffre phare de chaque fournisseur s'accompagne des mêmes petits caractères, qu'ils le disent ou non. La précision se dégrade avec le bruit, la distance, les voix qui se croisent et la forte compression ; aucun moteur n'y échappe, car c'est la physique de l'audio qui fixe le plafond.

Considérez donc toute promesse de précision comme une affirmation portant sur des conditions idéales, et prenez vos propres enregistrements comme la référence qui compte. Améliorer l'audio — un micro plus proche, une pièce plus silencieuse, une voix à la fois — fera davantage pour votre taux d'erreur sur les mots que de passer d'un moteur moderne à un autre. Et pour tout ce qui subsiste ensuite, un éditeur synchronisé qui vous laisse cliquer sur un mot suspect et entendre l'audio correspondant est ce qui comble l'écart entre la précision mesurée et une transcription publiable.

Commencer

Essayez Sonix gratuitement

Sonix transcrit, ajoute des horodatages et organise vos fichiers audio et vidéo afin que vous puissiez rechercher, éditer et partager vos médias.

Comprend 30 minutes de transcription gratuite

Continuer la lecture

Précision de 99 %. Chaque mot compte.

Transcription et traduction par IA en 54+ langues.

30 minutes gratuit
Sans carte de crédit
Annulez à tout moment