L'histoire de la
reconnaissance vocale

La reconnaissance vocale a été inventée à Bell Labs en 1952. Voici comment elle est passée de dix chiffres prononcés à 54+ langues, décennie après décennie.

La reconnaissance vocale en bref

Invention
La reconnaissance vocale a été inventée en 1952, lorsque le système Audrey de Bell Labs a reconnu les chiffres de 0 à 9 prononcés par une seule voix.
Premier logiciel grand public
Dragon Dictate, lancé en 1990 pour environ 9 000 dollars, a été le premier produit de reconnaissance vocale vendu au grand public, et il exigeait une pause après chaque mot.
Premier vocabulaire de 1 000 mots
Harpy, à Carnegie Mellon, comprenait 1 011 mots en 1976, l'objectif que la DARPA avait fixé à son programme quinquennal Speech Understanding Research.
Parité humaine
En 2017, Microsoft a mesuré un taux d'erreur de mots de 5,1 % sur le corpus téléphonique Switchboard, à égalité avec les transcripteurs professionnels chargés des mêmes appels.
Modèles ouverts
Whisper, publié par OpenAI en septembre 2022, a été entraîné sur 680 000 heures d'audio et transcrit près de 100 langues, avec des poids rendus publics.
Aujourd'hui
Sonix, fondée en 2017, transcrit 54+ langues avec une précision de 99% et renvoie un fichier d'une heure en 5 à 6 minutes environ.

La reconnaissance vocale a été inventée en 1952

Le premier système de reconnaissance de la parole a été construit à Bell Labs en 1952, et il comprenait exactement dix mots : les chiffres de zéro à neuf.

Audrey, le reconnaisseur automatique de chiffres

K. H. Davis, R. Biddulph et S. Balashek ont construit Audrey à partir de circuits analogiques qui remplissaient une baie de relais de six pieds, soit près de deux mètres de haut. Le locuteur prononçait un chiffre dans un combiné téléphonique, la machine mesurait les formants des voyelles et une lampe s'allumait à côté du chiffre reconnu. Réglée sur la voix de ses concepteurs, elle atteignait 97 à 99 pour cent de réussite ; face à des inconnus, elle s'effondrait. Audrey n'a jamais quitté le laboratoire, parce qu'un opérateur humain qui composait les numéros revenait moins cher, mais elle a tranché une question : oui, une machine pouvait entendre.

Shoebox d'IBM et les années 1960

En 1962, IBM a présenté Shoebox à l'Exposition universelle de Seattle. La machine reconnaissait 16 mots parlés, les dix chiffres et six commandes arithmétiques, et pilotait avec eux une machine à additionner. Tout au long de la décennie, des laboratoires aux États-Unis, en Grande-Bretagne, au Japon et en Union soviétique ont construit des reconnaisseurs de voyelles, de consonnes et de petites listes de mots, et en 1968 Taras Vintsyuk a décrit l'alignement temporel dynamique, ou DTW, la méthode qui permettait à une machine de comparer des paroles prononcées à des vitesses différentes. En 1969, le domaine avait de l'ambition mais pas de théorie : John Pierce, de Bell Labs, l'a comparé aux projets visant à transformer l'eau en essence, et le laboratoire a cessé de le financer pendant des années.

Le programme Speech Understanding Research de la DARPA a porté les vocabulaires au-delà de 1 000 mots

De 1971 à 1976, la DARPA a financé le plus vaste effort de reconnaissance vocale jamais entrepris jusque-là, et Harpy, à Carnegie Mellon, a atteint l'objectif des 1 000 mots.

L'objectif sur cinq ans

Le programme Speech Understanding Research réclamait un système capable de comprendre de la parole enchaînée, prononcée par plusieurs locuteurs, sur un vocabulaire de 1 000 mots avec moins de 10 pour cent d'erreur, et il a financé Carnegie Mellon, BBN, SRI et d'autres pour qu'ils se mesurent les uns aux autres. Trois systèmes ont franchi la ligne d'arrivée : Hearsay-II et Harpy à Carnegie Mellon, et HWIM chez BBN. Harpy, achevé en 1976, comprenait 1 011 mots, à peu près le vocabulaire d'un enfant de trois ans, et a été le seul à atteindre la cible. Son astuce : une recherche qui élaguait tôt les séquences de mots improbables au lieu de peser chaque possibilité, une idée qui reste au cœur de tout décodeur.

Le tournant statistique

Ces mêmes années ont produit l'idée qui allait surpasser toutes les autres pendant 40 ans. À Carnegie Mellon, la thèse de James Baker, en 1975, décrivait le système DRAGON, qui traitait la parole comme un modèle de Markov caché et laissait les probabilités, et non des règles écrites à la main, décider des mots prononcés. Chez IBM, l'équipe de Fred Jelinek a intégré la même approche dans un système de dictée expérimental et y a ajouté des modèles de langage n-grammes, pour que le reconnaisseur puisse deviner le mot suivant à partir des deux précédents. Bell Labs, de son côté, est passé d'une voix à plusieurs et a construit des reconnaisseurs qui fonctionnaient d'un locuteur à l'autre, ce qu'exigeaient les applications téléphoniques.

Dans les années 1980, les modèles de Markov cachés ont rendu la reconnaissance vocale statistique

Les années 1980 ont remplacé l'appariement de formes par les probabilités, et les vocabulaires sont passés de quelques centaines de mots à 20 000 en une décennie.

Comment entend un modèle de Markov caché

Un modèle de Markov caché ne cherche pas à faire correspondre un son à un gabarit. Il se demande quelle séquence de sons de parole a le plus probablement produit l'audio reçu, puis quelle séquence de mots a le plus probablement produit ces sons. L'entraînement sur de la parole enregistrée fixe les probabilités : plus de données, c'est un meilleur reconnaisseur, une propriété qui allait compter énormément avec l'arrivée d'internet. Combiné aux modèles de langage n-grammes, le HMM est devenu l'architecture de référence dans tous les laboratoires de recherche, et il y est resté jusqu'à ce que l'apprentissage profond le supplante en 2012.

Tangora, Sphinx et les premiers produits

Au milieu des années 1980, Tangora, chez IBM, reconnaissait un vocabulaire de 20 000 mots, à condition de marquer une pause entre les mots et d'entraîner le système sur chaque locuteur. En 1988, le système Sphinx de Kai-Fu Lee, à Carnegie Mellon, a été le premier à réunir grand vocabulaire, parole continue et indépendance vis-à-vis du locuteur dans un seul reconnaisseur. Dragon Systems, fondée par James et Janet Baker en 1982, a commencé à vendre des logiciels de reconnaissance pour ordinateurs personnels. La reconnaissance vocale est aussi entrée pour la première fois chez les particuliers : la poupée Julie de Worlds of Wonder répondait à une poignée de phrases en 1987, et les opérateurs téléphoniques testaient la numérotation vocale. Ces jouets étaient rudimentaires, mais ils ont fait entrer l'expression « reconnaissance vocale » dans les foyers.

Les années 1990 ont mis la reconnaissance vocale sur les PC

Des processeurs plus rapides ont transformé la dictée, jusque-là démonstration de laboratoire, en logiciel vendu en boîte, et un corpus de référence commun a rendu les progrès faciles à mesurer.

De Dragon Dictate à NaturallySpeaking

Dragon Dictate est sorti en 1990 pour environ 9 000 dollars. C'était le premier produit de reconnaissance vocale qu'un particulier pouvait acheter, et il imposait une pause après chaque mot. En 1997, Dragon NaturallySpeaking a supprimé la pause : il reconnaissait la parole continue à environ 100 mots par minute sur un PC familial, et IBM a répliqué la même année avec ViaVoice. Pour la première fois, un avocat, un médecin ou un écrivain pouvait parler à un ordinateur et obtenir un texte exploitable, à condition de l'entraîner et de le corriger.

Serveurs vocaux et premiers benchmarks

En 1996, BellSouth a lancé VAL, un portail vocal accessible par téléphone qui répondait à des questions parlées, et tous les serveurs vocaux contre lesquels vous avez pesté depuis en descendent. En coulisses, la DARPA et le National Institute of Standards and Technology organisaient des évaluations annuelles sur des enregistrements communs comme le corpus téléphonique Switchboard, et le taux d'erreur de mots est devenu le chiffre que chaque laboratoire publiait. À partir de là, l'histoire de la reconnaissance vocale est en grande partie celle de la chute de ce chiffre.

Les années 2000 ont envoyé la reconnaissance vocale dans le cloud

La précision a plafonné autour de 80 pour cent pendant l'essentiel de la décennie, jusqu'à ce que Google déplace la reconnaissance de l'appareil vers ses serveurs.

Le plateau

En 2001, les meilleurs systèmes transcrivaient la parole dictée avec une précision d'environ 80 pour cent, et les années suivantes ont apporté des raffinements plutôt que des bonds. La dictée sur ordinateur est restée une niche, les serveurs vocaux sont restés agaçants et les financements de la recherche se sont raréfiés. Le modèle de Markov caché approchait de son plafond, et les modèles appelés à le remplacer n'avaient pas encore la puissance de calcul ni les données dont ils avaient besoin.

Google Voice Search

Le service de renseignements téléphoniques GOOG-411 de Google, lancé en 2007, était un moyen de collecter des millions de requêtes parlées. En novembre 2008, l'entreprise a sorti Google Voice Search sous forme d'application iPhone, et la reconnaissance vocale a changé de forme : le téléphone se contentait d'enregistrer, et la reconnaissance tournait dans les centres de données de Google, sur des modèles bien plus gros que ce qu'un appareil pouvait contenir. Le système anglais de Google avait été entraîné sur 230 milliards de mots issus de requêtes de recherche, il pouvait donc prédire ce que les gens allaient probablement dire, et chaque nouvelle requête alimentait le modèle suivant. La reconnaissance est devenue un service plutôt qu'un programme, la forme qu'elle conserve encore aujourd'hui.

Chronologie

Les jalons de la reconnaissance vocale,
année par année

Chaque événement ci-dessous est daté. Les sections qui entourent ce tableau expliquent pourquoi chacun a compté.

AnnéeJalonPourquoi cela compte
1952Bell Labs construit AudreyLa première machine à reconnaître la parole : les chiffres de 0 à 9 d'un seul locuteur
1962IBM présente Shoebox16 mots, présentés au public à l'Exposition universelle de Seattle
1971La DARPA lance le programme Speech Understanding ResearchCinq ans de financement et un objectif de 1 000 mots
1976Harpy, à Carnegie Mellon, atteint l'objectif1 011 mots, avec une recherche élaguée que les décodeurs utilisent encore
1986Tangora, chez IBM, atteint 20 000 motsLes modèles de Markov cachés et les modèles de langage n-grammes deviennent la norme
1988Sphinx à Carnegie MellonParole continue, indépendance du locuteur et grand vocabulaire dans un seul système
1990Sortie de Dragon DictateLe premier produit de reconnaissance vocale vendu au grand public
1997Dragon NaturallySpeaking et IBM ViaVoiceDictée continue sur un PC familial à environ 100 mots par minute
2008Google Voice SearchLa reconnaissance passe dans le cloud et apprend de chaque requête
2011Apple lance SiriUn assistant vocal dans un téléphone grand public
2012Les réseaux de neurones profonds remplacent les mélanges de gaussiennesJusqu'à un tiers d'erreurs en moins, d'un seul coup
2016Microsoft annonce 5,9 % sur SwitchboardPremière revendication de parité humaine sur un benchmark conversationnel
2017Microsoft 5,1 %, IBM 5,5 %, Google 4,9 % ; le Transformer est publiéLa course à la parité s'achève et l'architecture suivante arrive
2020wav2vec 2.0 et le ConformerL'apprentissage auto-supervisé réduit le besoin de données annotées
2022OpenAI publie Whisper680 000 heures d'entraînement, près de 100 langues, poids ouverts

Dans les années 2010, l'apprentissage profond a divisé les taux d'erreur par plus de deux

De 2011 à 2017, le taux d'erreur de mots sur la parole téléphonique conversationnelle est passé d'un peu plus de 10 pour cent à environ 5 pour cent, et les assistants vocaux se sont installés dans les foyers.

Siri et les assistants

Apple a livré Siri avec l'iPhone 4S en octobre 2011, et pour la première fois un téléphone grand public embarquait un assistant vocal derrière le bouton d'accueil. Amazon a suivi avec Alexa sur l'Echo en 2014, puis Google avec Google Home en 2016. Ces assistants ont compté moins pour leur reconnaissance, qui tournait dans le cloud à la manière de Google Voice Search, que pour l'habitude qu'ils ont créée : des centaines de millions de personnes se sont mises à parler chaque jour à des machines, et chaque phrase prononcée est devenue une donnée d'entraînement.

L'étape des réseaux de neurones

En 2012, des chercheurs de Microsoft, Google, IBM et de l'université de Toronto, dont Geoffrey Hinton, ont publié un article commun montrant que des réseaux de neurones profonds entraînés sur le volet acoustique du problème réduisaient les taux d'erreur d'un tiers, dans les meilleurs cas, par rapport aux modèles de mélange de gaussiennes que les systèmes HMM utilisaient depuis 25 ans. Deep Speech, de Baidu, est allé plus loin en 2014 en entraînant un seul réseau récurrent de bout en bout, de l'audio aux caractères, sans dictionnaire de prononciation ni chaîne de traitement construite à la main. La reconnaissance est devenue un problème d'apprentissage profond, et les laboratoires disposant du plus de GPU et de données ont pris les devants.

La course à la parité humaine

Le benchmark Switchboard, un ensemble de conversations téléphoniques enregistrées, est devenu le tableau des scores. En octobre 2016, Microsoft a annoncé 5,9 pour cent de taux d'erreur de mots, le même que celui des transcripteurs professionnels engagés pour traiter les mêmes appels, et a parlé de parité humaine. IBM a répondu avec 5,5 pour cent en mars 2017, Google a annoncé 4,9 pour cent sur ses propres jeux de test en mai, et en août 2017 Microsoft a atteint 5,1 pour cent face à une mesure plus rigoureuse de la référence humaine. Le graphique ci-dessous, tiré du rapport Internet Trends 2017 de Mary Meeker, montre la précision par mot de Google franchissant la barre des 95 pour cent que le secteur considérait comme le seuil humain. La même année, l'architecture Transformer a été publiée pour la traduction automatique, et en trois ans elle avait aussi conquis la parole.

Graphique du taux de précision par mot de Google dépassant 95 pour cent, tiré du rapport Internet Trends 2017 de Mary Meeker

Whisper et le Transformer ont banalisé la transcription

L'entraînement auto-supervisé et un seul modèle ouvert ont transformé la transcription multilingue précise, jusque-là réservée aux géants de la tech, en une fonction que n'importe quel produit peut proposer.

Apprendre à partir d'audio non annoté

Le goulet d'étranglement des années 2010, c'étaient les données annotées : chaque heure d'entraînement exigeait une transcription humaine. En 2020, wav2vec 2.0, de Facebook AI, a d'abord appris des représentations de la parole à partir d'audio brut, non transcrit, et n'a eu besoin que de dix minutes de parole annotée pour affiner un reconnaisseur utilisable. Le Conformer de Google, publié la même année, a combiné convolution et attention de type Transformer et établi de nouveaux records sur les benchmarks standard. À eux deux, ils ont fait du Transformer l'architecture par défaut pour la parole et réduit le coût d'ajout d'une nouvelle langue.

Whisper

En septembre 2022, OpenAI a publié Whisper, entraîné sur 680 000 heures d'audio collectées sur le web, couvrant près de 100 langues, avec des poids de modèle publiés pour que chacun puisse l'exécuter. Ce n'était pas le système le plus précis sur chaque benchmark, mais il résistait aux accents, au bruit de fond et au vocabulaire technique comme aucun modèle académique avant lui, et il était gratuit. En quelques mois, il équipait des milliers de produits, et pour les entreprises de transcription la question n'était plus de savoir si elles pouvaient reconnaître la parole, mais ce qu'elles construisaient autour de la transcription.

Ce que cela change pour vous aujourd'hui

Un enregistrement d'une heure envoyé à Sonix revient sous forme de transcription en 5 à 6 minutes environ, avec l'identification des locuteurs, les horodatages et une précision de 99% sur un audio net, dans n'importe laquelle des 54+ langues prises en charge. Sonix a été fondée en 2017, l'année de la course à la parité humaine, et a suivi chaque étape depuis : les modèles s'améliorent chaque année, et le travail porte désormais sur l'éditeur, les résumés, les traductions et les exports qui rendent une transcription utile. Les sept décennies ci-dessus expliquent pourquoi une première transcription ne coûte rien aujourd'hui : vos 30 premières minutes sont gratuites.

L'identification automatique de la langue a sa propre histoire

Savoir quelle langue est parlée est un problème distinct de savoir quels mots le sont, et il a lui aussi fallu 50 ans pour le résoudre.

Des statistiques de phonèmes aux i-vectors

Les premières expériences d'identification de la langue, dans les années 1970, tentaient de distinguer les langues par les statistiques de leurs sons, en partant du principe que chaque langue utilise un mélange de phonèmes différent, à des fréquences différentes. Dans les années 1990, c'est devenu l'approche phonotactique : on fait tourner un reconnaisseur de phonèmes, puis on cherche la langue dont les enchaînements de phonèmes correspondent le mieux. Le National Institute of Standards and Technology a lancé des évaluations formelles de reconnaissance de la langue, les Language Recognition Evaluations, en 1996, et la culture du benchmark qui a porté la reconnaissance vocale a aussi porté l'identification de la langue. Dans les années 2010, l'i-vector, un résumé compact et de longueur fixe d'un enregistrement, emprunté à la reconnaissance du locuteur, a produit des systèmes capables de nommer une langue à partir de quelques secondes d'audio.

Intégrée au modèle

Les reconnaisseurs multilingues modernes fusionnent les deux problèmes. Whisper et ses successeurs prédisent la langue comme premier token de la transcription, si bien que l'identification est un sous-produit de la reconnaissance plutôt qu'une étape à part. C'est ce qui permet à un seul produit de gérer 54+ langues sans un reconnaisseur distinct pour chacune, et c'est pourquoi la langue que vous parlez ne limite plus ce que vous pouvez transcrire.

Et ensuite : la voix devient l'interface

La technologie nécessaire aux applications vocales est désormais bon marché et précise, et la question n'est plus de savoir si les machines peuvent entendre, mais ce qu'elles doivent faire de ce qu'elles entendent.

Produits conçus pour la voix

Les appareils conçus pour la voix, des enceintes connectées aux écouteurs et aux voitures, ont rendu banal le fait de parler à une machine, et la précision qu'il a fallu 70 ans pour atteindre est désormais un acquis plutôt qu'une fonctionnalité. Le langage est la seule interface que presque tout le monde maîtrise déjà, c'est pourquoi une petite amélioration de la reconnaissance touche plus de gens qu'un nouvel écran ne le pourra jamais. Les entreprises qui misent tôt sur la voix ont tendance à garder ce terrain, comme l'ont fait celles qui ont misé sur le mobile dans les années 2010.

Au-delà de la transcription

La transcription elle-même est devenue la matière première. Les grands modèles de langage résument des réunions, répondent à des questions sur un entretien, traduisent une conférence et en tirent l'e-mail de suivi, et ils ne font bien tout cela que parce que la transcription en dessous est exacte. Chez Sonix, c'est là que se fait le travail : la reconnaissance est le socle posé par tous ceux nommés ci-dessus, et le produit, c'est ce que vous pouvez faire des mots une fois qu'ils existent.

Questions fréquentes

Histoire de la reconnaissance vocale,
vos questions, nos réponses

Quand et où la reconnaissance vocale a-t-elle été inventée ?

En 1952, à Bell Labs. Le système Audrey, construit par K. H. Davis, R. Biddulph et S. Balashek, reconnaissait les chiffres de 0 à 9 prononcés par un seul locuteur. Shoebox, d'IBM, a suivi en 1962 avec 16 mots, et le premier produit que l'on pouvait acheter, Dragon Dictate, est arrivé en 1990.

Qui a inventé la reconnaissance vocale ?

Personne en particulier. Trois ingénieurs de Bell Labs ont construit le premier reconnaisseur, Audrey, en 1952. James Baker et Fred Jelinek ont rendu la reconnaissance statistique avec les modèles de Markov cachés dans les années 1970, le Sphinx de Kai-Fu Lee l'a rendue continue et indépendante du locuteur en 1988, et les collaborateurs de Geoffrey Hinton y ont apporté l'apprentissage profond en 2012.

Quel a été le premier logiciel de reconnaissance vocale ?

Dragon Dictate, lancé par Dragon Systems en 1990 pour environ 9 000 dollars, a été le premier logiciel de reconnaissance vocale vendu au grand public. Il exigeait une pause entre les mots. Dragon NaturallySpeaking, sorti en 1997, a été le premier produit de dictée en parole continue pour les ordinateurs familiaux.

Reconnaissance de la parole ou reconnaissance vocale : quelle différence ?

La reconnaissance de la parole identifie les mots qui ont été prononcés. La reconnaissance vocale au sens strict, que les spécialistes appellent reconnaissance du locuteur, identifie qui les a prononcés d'après les caractéristiques de la voix, ce qui permet à un téléphone de se déverrouiller pour son propriétaire. Dans l'usage courant, les deux termes s'emploient indifféremment. Cet article porte sur la reconnaissance des mots, la technologie derrière la transcription, la dictée et les assistants vocaux.

La reconnaissance vocale relève-t-elle de l'IA ?

Oui. Depuis 2012, tout reconnaisseur vocal compétitif est un réseau de neurones profond entraîné sur de grandes quantités d'audio, la même famille de méthodes que celle des grands modèles de langage. Avant cela, les modèles de Markov cachés relevaient déjà de l'apprentissage automatique : ils apprenaient des probabilités à partir de parole enregistrée au lieu de suivre des règles écrites à la main.

Quelle précision atteint la reconnaissance vocale aujourd'hui ?

Sur des enregistrements conversationnels nets, les meilleurs systèmes égalent les transcripteurs professionnels : Microsoft a mesuré un taux d'erreur de mots de 5,1 % sur le benchmark Switchboard en 2017, et les modèles ont progressé depuis. Sonix atteint 99% de précision sur un bon audio. Les accents marqués, les voix qui se chevauchent et le bruit de fond font encore grimper le taux d'erreur, et c'est pourquoi chaque transcription est livrée avec un éditeur.

Commencer

Essayez Sonix gratuitement

Sonix transcrit, ajoute des horodatages et organise vos fichiers audio et vidéo afin que vous puissiez rechercher, éditer et partager vos médias.

Comprend 30 minutes de transcription gratuite

Continuer la lecture

Précision de 99 %. Chaque mot compte.

Transcription et traduction par IA en 54+ langues.

30 minutes gratuit
Sans carte de crédit
Annulez à tout moment