De geschiedenis van
spraakherkenning

Spraakherkenning werd in 1952 uitgevonden bij Bell Labs. Zo ging het van tien gesproken cijfers naar 54+ talen, decennium na decennium.

Spraakherkenning in een oogopslag

Uitgevonden
Spraakherkenning werd in 1952 uitgevonden, toen het Audrey-systeem van Bell Labs de cijfers 0 tot 9 herkende, uitgesproken door één stem.
Eerste consumentensoftware
Dragon Dictate, in 1990 uitgebracht voor ongeveer 9.000 dollar, was het eerste spraakherkenningsproduct dat aan het publiek werd verkocht, en het had na elk woord een pauze nodig.
Eerste woordenschat van 1.000 woorden
In 1976 begreep Harpy van Carnegie Mellon 1.011 woorden, het doel dat DARPA voor zijn vijfjarige Speech Understanding Research-programma had gesteld.
Menselijk niveau
In 2017 mat Microsoft een woordfoutpercentage van 5,1% op de Switchboard-telefoonbenchmark, gelijk aan de professionele transcribenten die dezelfde gesprekken uitwerkten.
Open modellen
Whisper van OpenAI, uitgebracht in september 2022, is getraind op 680.000 uur audio en transcribeert bijna 100 talen met gepubliceerde gewichten.
Vandaag
Sonix, opgericht in 2017, transcribeert 54+ talen met 99% nauwkeurigheid en levert een bestand van een uur in ongeveer 5 tot 6 minuten terug.

Spraakherkenning werd in 1952 uitgevonden

De eerste spraakherkenner werd in 1952 bij Bell Labs gebouwd en begreep precies tien woorden: de cijfers nul tot en met negen.

Audrey, de Automatic Digit Recognizer

K. H. Davis, R. Biddulph en S. Balashek bouwden Audrey uit analoge schakelingen die een relaisrek van 1,8 meter hoog vulden. Een spreker zei een cijfer in een telefoonhoorn, de machine mat de klinkerformanten en naast het herkende cijfer ging een lampje branden. Afgestemd op de stemmen van de ontwerpers haalde Audrey 97 tot 99 procent; bij vreemden ging het mis. Audrey heeft het laboratorium nooit verlaten, omdat een telefoniste die nummers draaide goedkoper was, maar het beslechtte wel de vraag of een machine überhaupt kon horen.

IBM's Shoebox en de jaren 60

In 1962 demonstreerde IBM Shoebox op de wereldtentoonstelling in Seattle. Het herkende 16 gesproken woorden, de tien cijfers en zes rekencommando's, en stuurde daarmee een telmachine aan. In de loop van het decennium bouwden laboratoria in de Verenigde Staten, Groot-Brittannië, Japan en de Sovjet-Unie herkenners voor klinkers, medeklinkers en kleine woordenlijsten, en in 1968 beschreef Taras Vintsyuk dynamic time warping, de uitlijnmethode waarmee een machine spraak in verschillende tempo's kon vergelijken. Tegen 1969 had het vakgebied wel ambitie maar geen theorie: John Pierce van Bell Labs vergeleek het met plannen om van water benzine te maken, en het lab draaide de geldkraan jarenlang dicht.

DARPA's Speech Understanding Research-programma bracht de woordenschat voorbij de 1.000 woorden

Tussen 1971 en 1976 financierde DARPA de grootste spraakherkenningsinspanning tot dan toe, en Harpy van Carnegie Mellon haalde het doel van 1.000 woorden.

Het vijfjarige doel

Het Speech Understanding Research-programma vroeg om een systeem dat aaneengesloten spraak van meerdere sprekers kon begrijpen, met een woordenschat van 1.000 woorden en minder dan 10 procent fouten, en betaalde Carnegie Mellon, BBN, SRI en anderen om met elkaar te wedijveren. Drie systemen haalden de finish: Hearsay-II en Harpy van Carnegie Mellon en HWIM van BBN. Harpy, voltooid in 1976, begreep 1.011 woorden, ruwweg de woordenschat van een driejarige, en was de enige die het doel haalde. De truc was een zoekmethode die onwaarschijnlijke woordreeksen vroegtijdig wegsnoeide in plaats van elke mogelijkheid af te wegen, een idee dat nog altijd de kern van elke decoder vormt.

De statistische wending

Diezelfde jaren brachten het idee voort dat de volgende 40 jaar alles zou verslaan. Aan Carnegie Mellon beschreef James Baker in zijn proefschrift uit 1975 het DRAGON-systeem, dat spraak behandelde als een hidden-markovmodel en waarschijnlijkheden, niet handgeschreven regels, liet bepalen welke woorden er waren gezegd. Bij IBM bouwde de groep van Fred Jelinek dezelfde aanpak in een dicteersysteem voor onderzoek en voegde n-gram-taalmodellen toe, zodat de herkenner het volgende woord uit de vorige twee kon raden. Bell Labs ging intussen van één stem naar vele en bouwde herkenners die met verschillende sprekers overweg konden, een vereiste voor telefoontoepassingen.

Hidden-markovmodellen maakten spraakherkenning in de jaren 80 statistisch

In de jaren 80 maakte patroonherkenning plaats voor waarschijnlijkheid, en de woordenschat groeide in tien jaar van een paar honderd woorden naar 20.000.

Hoe een hidden-markovmodel hoort

Een hidden-markovmodel probeert een klank niet aan een sjabloon te koppelen. Het vraagt welke reeks spraakklanken de ontvangen audio het meest waarschijnlijk heeft voortgebracht, en vervolgens welke reeks woorden die klanken het meest waarschijnlijk heeft voortgebracht. Trainen op opgenomen spraak stelt de waarschijnlijkheden vast, dus meer data betekent een betere herkenner, een eigenschap die enorm zou gaan tellen zodra het internet er was. Gecombineerd met n-gram-taalmodellen werd het HMM de standaardarchitectuur in elk onderzoekslab, en dat bleef zo totdat deep learning het in 2012 verdrong.

Tangora, Sphinx en de eerste producten

Tangora van IBM herkende halverwege de jaren 80 een woordenschat van 20.000 woorden, al had het een pauze tussen de woorden nodig en training per spreker. In 1988 was het Sphinx-systeem van Kai-Fu Lee aan Carnegie Mellon het eerste dat een grote woordenschat, aaneengesloten spraak en sprekeronafhankelijkheid in één herkenner combineerde. Dragon Systems, in 1982 opgericht door James en Janet Baker, begon herkenningssoftware voor personal computers te verkopen. Ook consumenten kwamen voor het eerst met stemherkenning in aanraking: de Julie-pop van Worlds of Wonder reageerde in 1987 op een handvol gesproken zinnen, en telefoonmaatschappijen testten spraakgestuurd bellen. Het speelgoed was primitief, maar het bracht de term "stemherkenning" in gewone huiskamers.

De jaren 90 brachten spraakherkenning naar de personal computer

Snellere processors maakten van dicteren software uit de winkel in plaats van een laboratoriumdemonstratie, en een gedeelde benchmark maakte vooruitgang goed meetbaar.

Van Dragon Dictate tot NaturallySpeaking

Dragon Dictate kwam in 1990 op de markt voor ongeveer 9.000 dollar. Het was het eerste spraakherkenningsproduct dat een gewone burger kon kopen, en het eiste een pauze na elk woord. In 1997 schrapte Dragon NaturallySpeaking die pauze: het herkende aaneengesloten spraak met zo'n 100 woorden per minuut op een thuis-pc, en IBM antwoordde datzelfde jaar met ViaVoice. Voor het eerst kon een advocaat, een arts of een schrijver tegen een computer praten en bruikbare tekst terugkrijgen, mits ze het programma trainden en corrigeerden.

Keuzemenu's en de eerste benchmarks

In 1996 lanceerde BellSouth VAL, een inbelbaar spraakportaal dat gesproken vragen beantwoordde, en elk geautomatiseerd telefoonsysteem waar u sindsdien ruzie mee hebt gehad stamt ervan af. Achter de schermen hielden DARPA en het National Institute of Standards and Technology jaarlijkse evaluaties op gedeelde opnamen zoals het Switchboard-telefooncorpus, en het woordfoutpercentage werd het getal dat elk lab rapporteerde. Vanaf dat moment is de geschiedenis van spraakherkenning grotendeels de geschiedenis van dat dalende getal.

De jaren 2000 verplaatsten spraakherkenning naar de cloud

De nauwkeurigheid bleef het grootste deel van het decennium steken rond 80 procent, totdat Google de herkenning van het apparaat naar zijn servers verhuisde.

Het plateau

In 2001 transcribeerden de beste systemen gedicteerde spraak met ruwweg 80 procent nauwkeurigheid, en de jaren daarna brachten verfijningen in plaats van sprongen. Dicteren op de desktop bleef een niche, de keuzemenu's bleven frustrerend en de onderzoeksfinanciering droogde op. Het hidden-markovmodel zat tegen zijn plafond aan, en de modellen die het zouden vervangen hadden de rekenkracht en de data die ze nodig hadden nog niet.

Google Voice Search

De telefonische inlichtingendienst GOOG-411 van Google, gelanceerd in 2007, was een manier om miljoenen gesproken zoekopdrachten te verzamelen. In november 2008 bracht het bedrijf Google Voice Search uit als iPhone-app, en spraakherkenning veranderde van gedaante: de telefoon nam alleen op, en de herkenning draaide in de datacenters van Google op modellen die veel groter waren dan welk apparaat ook kon bevatten. Googles Engelstalige systeem was getraind op 230 miljard woorden aan zoekopdrachten, dus het kon voorspellen wat mensen waarschijnlijk zouden zeggen, en elke nieuwe zoekopdracht voedde het volgende model. Herkenning werd een dienst in plaats van een programma, en die vorm heeft het nog steeds.

Tijdlijn

Mijlpalen in spraakherkenning,
jaar na jaar

Elke gebeurtenis hieronder is gedateerd. De secties rond deze tabel leggen uit waarom elke mijlpaal ertoe deed.

JaarMijlpaalWaarom het ertoe deed
1952Bell Labs bouwt AudreyDe eerste machine die spraak herkent: de cijfers 0 tot 9 van één spreker
1962IBM demonstreert Shoebox16 woorden, aan het publiek getoond op de wereldtentoonstelling in Seattle
1971DARPA start het Speech Understanding Research-programmaVijf jaar financiering en een doel van 1.000 woorden
1976Harpy van Carnegie Mellon haalt het doel1.011 woorden, met een gesnoeide zoekmethode die decoders nog gebruiken
1986Tangora van IBM haalt 20.000 woordenHidden-markovmodellen en n-gram-taalmodellen worden de standaard
1988Sphinx aan Carnegie MellonAaneengesloten, sprekeronafhankelijke herkenning met grote woordenschat in één systeem
1990Dragon Dictate komt uitHet eerste spraakherkenningsproduct voor consumenten
1997Dragon NaturallySpeaking en IBM ViaVoiceAaneengesloten dicteren op een thuis-pc met zo'n 100 woorden per minuut
2008Google Voice SearchHerkenning verhuist naar de cloud en leert van elke zoekopdracht
2011Apple brengt Siri uitEen spraakassistent in een gangbare telefoon
2012Diepe neurale netwerken vervangen Gaussian mixture modelsFoutpercentages dalen in één stap met tot een derde
2016Microsoft meldt 5,9% op SwitchboardDe eerste claim van menselijk niveau op een gespreksbenchmark
2017Microsoft 5,1%, IBM 5,5%, Google 4,9%; de Transformer wordt gepubliceerdDe pariteitsrace eindigt en de volgende architectuur komt eraan
2020wav2vec 2.0 en de ConformerSelf-supervised learning vermindert de behoefte aan gelabelde data
2022OpenAI brengt Whisper uit680.000 trainingsuren, bijna 100 talen, open gewichten

Deep learning bracht de foutpercentages in de jaren 2010 tot minder dan de helft terug

Tussen 2011 en 2017 daalde het woordfoutpercentage op telefoongesprekken van ruim tien naar ongeveer 5 procent, en spraakassistenten deden hun intrede in huis.

Siri en de assistenten

Apple leverde Siri in oktober 2011 mee met de iPhone 4S, en voor het eerst had een gangbare telefoon een spraakassistent achter de homeknop. Amazon volgde in 2014 met Alexa op de Echo en Google in 2016 met Google Home. De assistenten waren minder belangrijk om hun herkenning, die net als bij Google Voice Search in de cloud draaide, dan om de gewoonte die ze aankweekten: honderden miljoenen mensen begonnen dagelijks tegen machines te praten, en elke uiting werd trainingsdata.

De stap naar neurale netwerken

In 2012 publiceerden onderzoekers van Microsoft, Google, IBM en de Universiteit van Toronto, onder wie Geoffrey Hinton, een gezamenlijk artikel waaruit bleek dat diepe neurale netwerken, getraind op de akoestische kant van het probleem, de foutpercentages met tot wel een derde verlaagden vergeleken met de Gaussian mixture models die HMM-systemen 25 jaar lang hadden gebruikt. Deep Speech van Baidu ging in 2014 verder en trainde één recurrent netwerk end-to-end, van audio tot letters, zonder uitspraakwoordenboek en zonder handgebouwde pijplijn. Herkenning werd een deep-learningprobleem, en de labs met de meeste GPU's en data namen de leiding.

De race naar menselijk niveau

De Switchboard-benchmark, een verzameling opgenomen telefoongesprekken, werd het scorebord. In oktober 2016 meldde Microsoft 5,9 procent woordfoutpercentage, gelijk aan dat van de professionele transcribenten die het inhuurde om dezelfde gesprekken uit te werken, en noemde dat menselijk niveau. IBM antwoordde in maart 2017 met 5,5 procent, Google kondigde die mei 4,9 procent aan op zijn eigen testsets, en in augustus 2017 haalde Microsoft 5,1 procent tegenover een zorgvuldiger meting van de menselijke referentie. De grafiek hieronder, uit het Internet Trends-rapport van Mary Meeker uit 2017, laat zien hoe de woordnauwkeurigheid van Google de grens van 95 procent passeert die de sector als menselijke drempel beschouwde. Datzelfde jaar werd de Transformer-architectuur gepubliceerd voor machinevertaling, en binnen drie jaar had die ook spraak overgenomen.

Grafiek van Googles woordnauwkeurigheid die de grens van 95 procent passeert, uit het Internet Trends-rapport van Mary Meeker uit 2017

Whisper en de Transformer maakten transcriptie tot gemeengoed

Self-supervised learning en één open model maakten nauwkeurige meertalige transcriptie van een voorrecht van Big Tech tot iets wat elk product kan bieden.

Leren van ongelabelde audio

Het knelpunt van de jaren 2010 was gelabelde data: elk trainingsuur had een menselijk transcript nodig. In 2020 leerde wav2vec 2.0 van Facebook AI eerst spraakrepresentaties uit ruwe, niet-getranscribeerde audio en had het nog maar tien minuten gelabelde spraak nodig om een bruikbare herkenner te finetunen. De Conformer van Google, datzelfde jaar gepubliceerd, combineerde convolutie met Transformer-attention en zette nieuwe records neer op de standaardbenchmarks. Samen maakten ze de Transformer tot de standaardarchitectuur voor spraak en drukten ze de kosten van het toevoegen van een nieuwe taal.

Whisper

In september 2022 bracht OpenAI Whisper uit, getraind op 680.000 uur audio van het web, met bijna 100 talen en met modelgewichten die iedereen kon downloaden en draaien. Het was niet op elke benchmark het nauwkeurigste systeem, maar het was bestand tegen accenten, achtergrondgeluid en vakjargon op een manier die eerdere academische modellen niet waren, en het was gratis. Binnen enkele maanden zat het in duizenden producten, en voor transcriptiebedrijven verschoof de vraag van of ze spraak konden herkennen naar wat ze rond het transcript bouwden.

Wat dat vandaag voor u betekent

Een opname van een uur die u naar Sonix uploadt, komt in ongeveer 5 tot 6 minuten terug als transcript, met sprekerlabels, tijdstempels en 99% nauwkeurigheid op heldere audio, in elk van 54+ talen. Sonix werd opgericht in 2017, het jaar van de race naar menselijk niveau, en heeft sindsdien elke stap meegemaakt: de modellen worden elk jaar beter, en het werk zit nu in de editor, de samenvattingen, de vertalingen en de exports die een transcript bruikbaar maken. De zeven decennia hierboven zijn de reden dat een eerste transcript vandaag niets kost: uw eerste 30 minuten zijn gratis.

Automatische taalherkenning heeft een eigen geschiedenis

Weten welke taal er wordt gesproken is een ander probleem dan weten welke woorden, en het kostte zijn eigen 50 jaar om het op te lossen.

Van foneemstatistiek tot i-vectors

De eerste experimenten met taalherkenning in de jaren 70 probeerden talen uit elkaar te houden op basis van de statistiek van hun klanken, vanuit de gedachte dat elke taal een andere mix van fonemen in andere verhoudingen gebruikt. In de jaren 90 werd dat de fonotactische aanpak: laat een foneemherkenner draaien en vraag vervolgens welke taal het beste bij de foneempatronen past. Het National Institute of Standards and Technology begon in 1996 met formele Language Recognition Evaluations, en de benchmarkcultuur die spraakherkenning vooruitdreef, dreef ook de taalherkenning vooruit. In de jaren 2010 leverde de i-vector, een compacte samenvatting van vaste lengte van een opname, geleend uit de sprekerherkenning, systemen op die een taal konden benoemen op basis van een paar seconden audio.

Ingebouwd in het model

Moderne meertalige herkenners voegen de twee problemen samen. Whisper en zijn opvolgers voorspellen de taal als eerste token van het transcript, zodat taalherkenning een bijproduct van spraakherkenning is en geen aparte stap. Dat is wat één product in staat stelt 54+ talen aan te kunnen zonder voor elke taal een aparte herkenner, en waarom de taal die u spreekt niet langer bepaalt wat u kunt transcriberen.

Wat hierna komt: stem wordt de interface

De technologie voor spraaktoepassingen is nu goedkoop en nauwkeurig, en de vraag is verschoven van of machines kunnen horen naar wat ze moeten doen met wat ze horen.

Voice-first producten

Voice-first-apparaten, van slimme speakers tot oordopjes en auto's, hebben praten tegen een machine tot iets alledaags gemaakt, en de nauwkeurigheid waar 70 jaar voor nodig was is nu een vanzelfsprekendheid in plaats van een functie. Taal is de enige interface die vrijwel iedereen al beheerst, en daarom bereikt een kleine verbetering in herkenning meer mensen dan een nieuw scherm ooit zou kunnen. De bedrijven die vroeg op stem bouwen, houden dat terrein doorgaans vast, zoals de mobile-first-bedrijven van de jaren 2010 deden.

Voorbij het transcript

Het transcript zelf is de grondstof geworden. Grote taalmodellen vatten vergaderingen samen, beantwoorden vragen over een interview, vertalen een college en schrijven er de opvolgmail bij, en dat doen ze alleen goed omdat het onderliggende transcript klopt. Bij Sonix is dat het werk: herkenning is het fundament dat door iedereen hierboven is gelegd, en het product is wat u met de woorden kunt doen zodra ze er zijn.

Veelgestelde vragen

Geschiedenis van spraakherkenning,
uw vragen beantwoord

Wanneer en waar is spraakherkenning uitgevonden?

In 1952. Het Audrey-systeem van Bell Labs, gebouwd door K. H. Davis, R. Biddulph en S. Balashek, herkende de gesproken cijfers 0 tot 9 van één spreker. IBM's Shoebox volgde in 1962 met 16 woorden, en het eerste product dat u kon kopen, Dragon Dictate, verscheen in 1990.

Wie heeft spraakherkenning uitgevonden?

Niet één persoon. Drie ingenieurs van Bell Labs bouwden in 1952 de eerste herkenner, Audrey. James Baker en Fred Jelinek maakten herkenning in de jaren 70 statistisch met hidden-markovmodellen, Sphinx van Kai-Fu Lee maakte haar in 1988 aaneengesloten en sprekeronafhankelijk, en de medeonderzoekers van Geoffrey Hinton brachten er in 2012 deep learning in.

Welke spraakherkenningssoftware kwam als eerste?

Dragon Dictate, in 1990 door Dragon Systems uitgebracht voor ongeveer 9.000 dollar, was de eerste spraakherkenningssoftware die aan het publiek werd verkocht. Het vereiste een pauze tussen de woorden. Dragon NaturallySpeaking, uitgebracht in 1997, was het eerste dicteerproduct voor aaneengesloten spraak op thuiscomputers.

Spraakherkenning of stemherkenning: wat is het verschil?

Spraakherkenning bepaalt welke woorden er zijn gezegd. Stemherkenning bepaalt wie ze heeft gezegd, aan de hand van de kenmerken van de stem; zo ontgrendelt een telefoon voor zijn eigenaar. In het dagelijks taalgebruik worden de termen vrijelijk door elkaar gehaald. Dit artikel gaat over het herkennen van woorden, de technologie achter transcriptie, dicteren en spraakassistenten.

Is spraakherkenning een vorm van AI?

Ja. Sinds 2012 is elke serieuze spraakherkenner een diep neuraal netwerk dat op grote hoeveelheden audio is getraind, dezelfde familie van methoden als achter grote taalmodellen. Daarvoor waren hidden-markovmodellen ook al een vorm van machine learning: ze leerden waarschijnlijkheden uit opgenomen spraak in plaats van handgeschreven regels te volgen.

Hoe nauwkeurig is spraakherkenning op dit moment?

Op heldere gespreksopnamen evenaren de beste systemen professionele transcribenten: Microsoft mat in 2017 een woordfoutpercentage van 5,1% op de Switchboard-benchmark, en de modellen zijn sindsdien verder verbeterd. Sonix haalt 99% nauwkeurigheid op goede audio. Zware accenten, door elkaar pratende sprekers en achtergrondgeluid drijven het foutpercentage nog altijd op, en daarom komt elk transcript met een editor.

Aan de slag

Probeer Sonix gratis

Sonix transcribeert, tijdstempelt en organiseert je audio- en videobestanden, zodat je je media kunt doorzoeken, bewerken en delen.

Inclusief 30 minutes minuten gratis transcriptie

Lees verder

99% nauwkeurigheid. Elk woord telt.

AI transcriptie en vertaling in 54+ talen.

30 minutes gratis
Geen creditcard nodig
Altijd opzegbaar