Die Geschichte der
Spracherkennung

Die Spracherkennung wurde 1952 in den Bell Labs erfunden. So kam sie Jahrzehnt für Jahrzehnt von zehn gesprochenen Ziffern zu 54+ Sprachen.

Spracherkennung auf einen Blick

Erfunden
Die Spracherkennung wurde 1952 erfunden, als das Audrey-System der Bell Labs die Ziffern 0 bis 9 einer einzelnen Stimme erkannte.
Erste Software für Endkunden
Dragon Dictate, 1990 für rund 9.000 Dollar erschienen, war das erste Spracherkennungsprodukt für die Öffentlichkeit, und es brauchte nach jedem Wort eine Pause.
Erstmals 1.000 Wörter
1976 verstand Harpy von der Carnegie Mellon University 1.011 Wörter, genau das Ziel, das die DARPA für ihr fünfjähriges Programm Speech Understanding Research gesetzt hatte.
Auf Augenhöhe
2017 maß Microsoft auf dem Telefon-Benchmark Switchboard eine Wortfehlerrate von 5,1% und lag damit gleichauf mit den professionellen Transkribenten, die dieselben Gespräche bearbeitet hatten.
Offene Modelle
Whisper von OpenAI, veröffentlicht im September 2022, wurde mit 680.000 Stunden Audio trainiert und transkribiert fast 100 Sprachen, die Gewichte sind frei verfügbar.
Heute
Sonix, gegründet 2017, transkribiert 54+ Sprachen mit 99% Genauigkeit und liefert eine einstündige Datei in etwa 5 bis 6 Minuten zurück.

Die Spracherkennung wurde 1952 erfunden

Der erste Spracherkenner entstand 1952 in den Bell Labs und verstand genau zehn Wörter: die Ziffern null bis neun.

Audrey, der Automatic Digit Recognizer

K. H. Davis, R. Biddulph und S. Balashek bauten Audrey aus analogen Schaltungen, die einen gut 1,80 Meter hohen Relaisschrank füllten. Ein Sprecher sagte eine Ziffer in einen Telefonhörer, die Maschine maß die Vokalformanten, und neben der erkannten Ziffer leuchtete eine Lampe auf. Auf die Stimmen ihrer Entwickler abgestimmt erreichte sie 97 bis 99 Prozent; bei Fremden brach sie ein. Audrey verließ das Labor nie, weil ein Mensch, der die Nummern wählte, billiger war, aber sie klärte die Frage, ob eine Maschine überhaupt hören kann.

IBMs Shoebox und die 1960er Jahre

1962 führte IBM Shoebox auf der Weltausstellung in Seattle vor. Das Gerät erkannte 16 gesprochene Wörter, die zehn Ziffern und sechs Rechenbefehle, und steuerte damit eine Addiermaschine. Im Laufe des Jahrzehnts bauten Labore in den USA, Großbritannien, Japan und der Sowjetunion Erkenner für Vokale, Konsonanten und kleine Wortlisten, und 1968 beschrieb Taras Vintsyuk das Dynamic Time Warping, das Ausrichtungsverfahren, mit dem eine Maschine unterschiedlich schnell gesprochene Sprache vergleichen konnte. 1969 hatte das Feld Ehrgeiz, aber keine Theorie: John Pierce von den Bell Labs verglich es mit Plänen, Wasser in Benzin zu verwandeln, und das Labor stellte die Förderung für Jahre ein.

Das DARPA-Programm Speech Understanding Research brachte den Wortschatz auf über 1.000 Wörter

Zwischen 1971 und 1976 finanzierte die DARPA das bis dahin größte Vorhaben zur Spracherkennung, und Harpy von der Carnegie Mellon University erreichte das Ziel von 1.000 Wörtern.

Das Fünfjahresziel

Das Programm Speech Understanding Research verlangte ein System, das zusammenhängende Sprache mehrerer Sprecher bei einem Wortschatz von 1.000 Wörtern mit weniger als 10 Prozent Fehlern versteht, und bezahlte Carnegie Mellon, BBN, SRI und andere dafür, gegeneinander anzutreten. Drei Systeme erreichten die Ziellinie: Hearsay-II und Harpy an der Carnegie Mellon University sowie HWIM bei BBN. Harpy, 1976 fertiggestellt, verstand 1.011 Wörter, ungefähr den Wortschatz eines Dreijährigen, und war das einzige System, das die Vorgabe erfüllte. Sein Kniff war eine Suche, die unwahrscheinliche Wortfolgen früh verwarf, statt jede Möglichkeit abzuwägen, eine Idee, die bis heute im Kern jedes Decoders steckt.

Die statistische Wende

Aus denselben Jahren stammt die Idee, die für die nächsten 40 Jahre alles andere schlug. An der Carnegie Mellon University beschrieb James Baker 1975 in seiner Dissertation das System DRAGON, das Sprache als Hidden-Markov-Modell behandelte und Wahrscheinlichkeiten statt handgeschriebener Regeln entscheiden ließ, welche Wörter gesagt worden waren. Bei IBM baute die Gruppe um Fred Jelinek denselben Ansatz in ein Forschungssystem fürs Diktieren ein und ergänzte n-Gramm-Sprachmodelle, sodass der Erkenner das nächste Wort aus den beiden vorherigen erraten konnte. Die Bell Labs gingen derweil von einer Stimme zu vielen über und bauten Erkenner, die über Sprecher hinweg funktionierten, wie es Telefonanwendungen verlangten.

Hidden-Markov-Modelle machten die Spracherkennung in den 1980ern statistisch

Die 1980er ersetzten den Mustervergleich durch Wahrscheinlichkeiten, und der Wortschatz wuchs innerhalb eines Jahrzehnts von wenigen hundert auf 20.000 Wörter.

Wie ein Hidden-Markov-Modell hört

Ein Hidden-Markov-Modell versucht nicht, einen Klang mit einer Vorlage abzugleichen. Es fragt, welche Folge von Sprachlauten das empfangene Audio am wahrscheinlichsten erzeugt hat, und dann, welche Wortfolge am wahrscheinlichsten diese Laute erzeugt hat. Das Training mit aufgezeichneter Sprache legt die Wahrscheinlichkeiten fest, mehr Daten bedeuten also einen besseren Erkenner, eine Eigenschaft, die mit dem Aufkommen des Internets enorm wichtig werden sollte. In Kombination mit n-Gramm-Sprachmodellen wurde das HMM zur Standardarchitektur in jedem Forschungslabor und blieb es, bis Deep Learning es 2012 verdrängte.

Tangora, Sphinx und die ersten Produkte

IBMs Tangora erkannte Mitte der 1980er einen Wortschatz von 20.000 Wörtern, brauchte aber eine Pause zwischen den Wörtern und ein Training auf jeden Sprecher. 1988 vereinte Kai-Fu Lees System Sphinx an der Carnegie Mellon University als erstes großen Wortschatz, kontinuierliche Sprache und Sprecherunabhängigkeit in einem Erkenner. Dragon Systems, 1982 von James und Janet Baker gegründet, begann Erkennungssoftware für Personal Computer zu verkaufen. Auch Verbraucher kamen erstmals mit Spracherkennung in Berührung: Die Puppe Julie von Worlds of Wonder reagierte 1987 auf eine Handvoll gesprochener Sätze, und Telefongesellschaften erprobten die Sprachwahl. Die Spielzeuge waren primitiv, aber sie brachten das Wort "Spracherkennung" in ganz normale Haushalte.

Die 1990er brachten die Spracherkennung auf den PC

Schnellere Prozessoren machten aus dem Diktieren im Labor Software aus dem Regal, und ein gemeinsamer Benchmark machte den Fortschritt leicht messbar.

Von Dragon Dictate zu NaturallySpeaking

Dragon Dictate kam 1990 für rund 9.000 Dollar auf den Markt. Es war das erste Spracherkennungsprodukt, das jeder kaufen konnte, und es verlangte nach jedem Wort eine Pause. 1997 schaffte Dragon NaturallySpeaking die Pause ab: Es erkannte kontinuierliche Sprache mit rund 100 Wörtern pro Minute auf einem Heim-PC, und IBM antwortete im selben Jahr mit ViaVoice. Zum ersten Mal konnten Anwälte, Ärzte oder Autoren mit einem Computer sprechen und brauchbaren Text bekommen, sofern sie ihn trainierten und korrigierten.

Telefonmenüs und die ersten Benchmarks

1996 startete BellSouth VAL, ein Sprachportal zum Anrufen, das gesprochene Fragen beantwortete, und jedes automatische Telefonsystem, mit dem Sie sich seither gestritten haben, stammt davon ab. Im Hintergrund führten die DARPA und das National Institute of Standards and Technology jährliche Auswertungen auf gemeinsamen Aufnahmen wie dem Telefonkorpus Switchboard durch, und die Wortfehlerrate wurde zur Kennzahl, die jedes Labor meldete. Von da an ist die Geschichte der Spracherkennung weitgehend die Geschichte dieser sinkenden Zahl.

Die 2000er verlagerten die Spracherkennung in die Cloud

Die Genauigkeit stagnierte den Großteil des Jahrzehnts bei etwa 80 Prozent, bis Google die Erkennung vom Gerät auf seine Server verlegte.

Das Plateau

2001 transkribierten die besten Systeme diktierte Sprache mit rund 80 Prozent Genauigkeit, und die folgenden Jahre brachten Feinschliff statt Sprünge. Diktieren am Desktop blieb eine Nische, die Telefonmenüs blieben frustrierend, und die Forschungsgelder wurden knapper. Das Hidden-Markov-Modell war nahe an seiner Obergrenze, und den Modellen, die es ablösen sollten, fehlten noch die Rechenleistung und die Daten.

Google Voice Search

Googles Auskunftsdienst GOOG-411, gestartet 2007, war ein Weg, Millionen gesprochener Anfragen zu sammeln. Im November 2008 veröffentlichte das Unternehmen Google Voice Search als iPhone-App, und die Spracherkennung änderte ihre Gestalt: Das Telefon nahm nur noch auf, die Erkennung lief in Googles Rechenzentren auf Modellen, die weit größer waren, als jedes Gerät hätte fassen können. Googles englisches System war mit 230 Milliarden Wörtern aus Suchanfragen trainiert, es konnte also vorhersagen, was Menschen wahrscheinlich sagen würden, und jede neue Anfrage floss ins nächste Modell. Aus dem Programm wurde ein Dienst, und das ist die Spracherkennung bis heute geblieben.

Zeitleiste

Meilensteine der Spracherkennung,
Jahr für Jahr

Jedes Ereignis unten ist datiert. Die Abschnitte rund um diese Tabelle erklären, warum es jeweils wichtig war.

JahrMeilensteinWarum es wichtig war
1952Die Bell Labs bauen AudreyDie erste Maschine, die Sprache erkennt: die Ziffern 0 bis 9 eines Sprechers
1962IBM führt Shoebox vor16 Wörter, öffentlich gezeigt auf der Weltausstellung in Seattle
1971Die DARPA startet das Programm Speech Understanding ResearchFünf Jahre Förderung und ein Ziel von 1.000 Wörtern
1976Harpy von Carnegie Mellon erreicht das Ziel1.011 Wörter und eine Suche mit Pruning, die Decoder bis heute nutzen
1986IBMs Tangora erreicht 20.000 WörterHidden-Markov-Modelle und n-Gramm-Sprachmodelle werden zum Standard
1988Sphinx an der Carnegie MellonKontinuierliche, sprecherunabhängige Erkennung mit großem Wortschatz in einem System
1990Dragon Dictate erscheintDas erste Spracherkennungsprodukt für Endkunden
1997Dragon NaturallySpeaking und IBM ViaVoiceKontinuierliches Diktieren auf dem Heim-PC mit rund 100 Wörtern pro Minute
2008Google Voice SearchDie Erkennung wandert in die Cloud und lernt aus jeder Anfrage
2011Apple stellt Siri vorEin Sprachassistent in einem Smartphone für alle
2012Tiefe neuronale Netze ersetzen Gauß-MischmodelleFehlerraten sinken in einem Schritt um bis zu ein Drittel
2016Microsoft meldet 5,9% auf SwitchboardErster Anspruch auf menschliches Niveau bei einem Gesprächs-Benchmark
2017Microsoft 5,1%, IBM 5,5%, Google 4,9%; der Transformer wird veröffentlichtDas Rennen um menschliches Niveau endet, die nächste Architektur kommt
2020wav2vec 2.0 und der ConformerSelbstüberwachtes Lernen senkt den Bedarf an gelabelten Daten
2022OpenAI veröffentlicht Whisper680.000 Trainingsstunden, fast 100 Sprachen, offene Gewichte

Deep Learning senkte die Fehlerraten in den 2010ern um mehr als die Hälfte

Zwischen 2011 und 2017 fiel die Wortfehlerrate bei Telefongesprächen von gut 10 Prozent auf etwa 5 Prozent, und Sprachassistenten zogen in die Wohnzimmer ein.

Siri und die Assistenten

Apple lieferte Siri im Oktober 2011 mit dem iPhone 4S aus, und zum ersten Mal hatte ein Smartphone für den Massenmarkt einen Sprachassistenten hinter dem Home-Button. Amazon folgte 2014 mit Alexa auf dem Echo, Google 2016 mit Google Home. Die Assistenten waren weniger wegen ihrer Erkennung wichtig, die ähnlich wie Google Voice Search in der Cloud lief, als wegen der Gewohnheit, die sie schufen: Hunderte Millionen Menschen begannen, täglich mit Maschinen zu sprechen, und jede Äußerung wurde zu Trainingsdaten.

Der Schritt zum neuronalen Netz

2012 veröffentlichten Forscher von Microsoft, Google, IBM und der University of Toronto, darunter Geoffrey Hinton, eine gemeinsame Arbeit, die zeigte, dass tiefe neuronale Netze auf der akustischen Seite des Problems die Fehlerraten um bis zu ein Drittel senkten, verglichen mit den Gauß-Mischmodellen, die HMM-Systeme 25 Jahre lang verwendet hatten. Baidus Deep Speech ging 2014 noch weiter und trainierte ein einzelnes rekurrentes Netz End-to-End, vom Audio bis zu den Buchstaben, ohne Aussprachewörterbuch und ohne handgebaute Pipeline. Erkennung wurde zu einem Deep-Learning-Problem, und die Labore mit den meisten GPUs und Daten zogen davon.

Das Rennen um menschliches Niveau

Der Benchmark Switchboard, eine Sammlung aufgezeichneter Telefongespräche, wurde zur Anzeigetafel. Im Oktober 2016 meldete Microsoft eine Wortfehlerrate von 5,9 Prozent, dieselbe wie die der professionellen Transkribenten, die es für dieselben Gespräche angeheuert hatte, und nannte das Human Parity, Gleichstand mit dem Menschen. IBM antwortete im März 2017 mit 5,5 Prozent, Google meldete im Mai desselben Jahres 4,9 Prozent auf eigenen Testdaten, und im August 2017 erreichte Microsoft 5,1 Prozent gegenüber einer sorgfältigeren Messung der menschlichen Referenz. Die Grafik unten aus Mary Meekers Internet Trends Report 2017 zeigt, wie Googles Wortgenauigkeit die Marke von 95 Prozent überschreitet, die die Branche als menschliche Schwelle betrachtete. Im selben Jahr wurde die Transformer-Architektur für die maschinelle Übersetzung veröffentlicht, und binnen drei Jahren hatte sie auch die Spracherkennung übernommen.

Grafik: Googles Wortgenauigkeit überschreitet 95 Prozent, aus Mary Meekers Internet Trends Report 2017

Whisper und der Transformer machten Transkription zur Massenware

Selbstüberwachtes Training und ein offenes Modell machten aus genauer mehrsprachiger Transkription, bis dahin eine Fähigkeit der Tech-Konzerne, etwas, das jedes Produkt anbieten kann.

Lernen aus ungelabeltem Audio

Der Engpass der 2010er waren gelabelte Daten: Jede Trainingsstunde brauchte ein von Menschen erstelltes Transkript. 2020 lernte wav2vec 2.0 von Facebook AI Sprachrepräsentationen zunächst aus rohem, nicht transkribiertem Audio und brauchte dann gerade einmal zehn Minuten gelabelte Sprache, um daraus per Fine-Tuning einen brauchbaren Erkenner zu machen. Googles Conformer, im selben Jahr veröffentlicht, verband Faltungsschichten mit Transformer-Attention und stellte auf den Standard-Benchmarks neue Rekorde auf. Zusammen machten sie den Transformer zur Standardarchitektur für Sprache und senkten die Kosten, eine neue Sprache hinzuzufügen.

Whisper

Im September 2022 veröffentlichte OpenAI Whisper, trainiert mit 680.000 Stunden Audio aus dem Web, für fast 100 Sprachen, mit Modellgewichten, die jeder herunterladen und ausführen kann. Es war nicht auf jedem Benchmark das genaueste System, aber es kam mit Akzenten, Hintergrundgeräuschen und Fachvokabular zurecht wie kein akademisches Modell zuvor, und es war kostenlos. Binnen Monaten steckte es in Tausenden Produkten, und für Transkriptionsanbieter lautete die Frage nicht mehr, ob sie Sprache erkennen können, sondern was sie rund um das Transkript bauen.

Was das heute für Sie bedeutet

Eine einstündige Aufnahme, die Sie bei Sonix hochladen, kommt in etwa 5 bis 6 Minuten als Transkript zurück, mit Sprechermarkierungen, Zeitstempeln und 99% Genauigkeit bei klarem Audio, in jeder von 54+ Sprachen. Sonix wurde 2017 gegründet, im Jahr des Rennens um menschliches Niveau, und hat seither jeden Schritt mitgemacht: Die Modelle werden jedes Jahr besser, und die Arbeit fließt heute in den Editor, die Zusammenfassungen, die Übersetzungen und die Exporte, die ein Transkript nützlich machen. Die sieben Jahrzehnte oben sind der Grund, warum ein erstes Transkript heute nichts kostet: Ihre ersten 30 Minuten sind kostenlos.

Die automatische Sprachidentifikation hat ihre eigene Geschichte

Zu erkennen, welche Sprache gesprochen wird, ist ein anderes Problem, als zu erkennen, welche Wörter gesagt werden, und es brauchte seine eigenen 50 Jahre bis zur Lösung.

Von Phonemstatistik zu i-Vektoren

Die ersten Versuche zur Sprachidentifikation in den 1970ern wollten Sprachen anhand der Statistik ihrer Laute unterscheiden, nach der Theorie, dass jede Sprache eine andere Mischung von Phonemen in anderer Häufigkeit verwendet. In den 1990ern wurde daraus der phonotaktische Ansatz: Man lässt einen Phonemerkenner laufen und fragt dann, zu welcher Sprache die Phonemmuster am besten passen. Das National Institute of Standards and Technology begann 1996 mit formalen Language Recognition Evaluations, und die Benchmark-Kultur, die die Spracherkennung vorantrieb, trieb auch die Sprachidentifikation voran. In den 2010ern lieferte der i-Vektor, eine kompakte Zusammenfassung fester Länge für eine Aufnahme, entlehnt aus der Sprechererkennung, Systeme, die eine Sprache nach wenigen Sekunden Audio benennen konnten.

Im Modell eingebaut

Moderne mehrsprachige Erkenner falten die beiden Probleme zusammen. Whisper und seine Nachfolger sagen die Sprache als erstes Token des Transkripts vorher, die Identifikation ist also ein Nebenprodukt der Erkennung und kein eigener Schritt. Das erlaubt es einem Produkt, 54+ Sprachen ohne einen eigenen Erkenner pro Sprache zu verarbeiten, und deshalb begrenzt die Sprache, die Sie sprechen, nicht mehr, was Sie transkribieren können.

Was als Nächstes kommt: Sprache wird zur Schnittstelle

Die Technik für Sprachanwendungen ist inzwischen günstig und genau, und die Frage hat sich verschoben: nicht mehr, ob Maschinen hören können, sondern was sie mit dem Gehörten tun sollen.

Voice-First-Produkte

Voice-First-Geräte, vom smarten Lautsprecher über Ohrhörer bis zum Auto, haben das Sprechen mit einer Maschine alltäglich gemacht, und die Genauigkeit, für die es 70 Jahre brauchte, ist heute eine Selbstverständlichkeit und kein Merkmal mehr. Sprache ist die eine Schnittstelle, die fast jeder Mensch schon hat, und deshalb erreicht eine kleine Verbesserung der Erkennung mehr Menschen, als ein neuer Bildschirm es je könnte. Unternehmen, die früh auf Sprache setzen, behaupten dieses Terrain meist, so wie es die Mobile-First-Unternehmen der 2010er taten.

Über das Transkript hinaus

Das Transkript selbst ist zum Rohstoff geworden. Große Sprachmodelle fassen Meetings zusammen, beantworten Fragen zu einem Interview, übersetzen eine Vorlesung und entwerfen daraus die Folge-E-Mail, und sie tun das nur deshalb gut, weil das Transkript darunter stimmt. Bei Sonix ist genau das die Arbeit: Die Erkennung ist das Fundament, das alle oben Genannten gelegt haben, und das Produkt ist das, was Sie mit den Wörtern anfangen können, sobald es sie gibt.

Häufige Fragen

Geschichte der Spracherkennung,
Ihre Fragen beantwortet

Wann und wo wurde die Spracherkennung erfunden?

1952. Das Audrey-System der Bell Labs, gebaut von K. H. Davis, R. Biddulph und S. Balashek, erkannte die gesprochenen Ziffern 0 bis 9 eines einzelnen Sprechers. IBMs Shoebox folgte 1962 mit 16 Wörtern, und das erste käufliche Produkt, Dragon Dictate, kam 1990.

Wer hat die Spracherkennung erfunden?

Keine einzelne Person. Drei Ingenieure der Bell Labs bauten 1952 den ersten Erkenner, Audrey. James Baker und Fred Jelinek machten die Erkennung in den 1970ern mit Hidden-Markov-Modellen statistisch, Kai-Fu Lees Sphinx machte sie 1988 kontinuierlich und sprecherunabhängig, und Geoffrey Hintons Mitstreiter brachten ihr 2012 Deep Learning bei.

Welche Spracherkennungssoftware kam zuerst?

Dragon Dictate, 1990 von Dragon Systems für rund 9.000 Dollar veröffentlicht, war die erste Spracherkennungssoftware für die Öffentlichkeit. Sie verlangte eine Pause zwischen den Wörtern. Dragon NaturallySpeaking, erschienen 1997, war das erste Diktierprodukt für kontinuierliche Sprache auf Heimcomputern.

Spracherkennung oder Stimmerkennung: Wo liegt der Unterschied?

Spracherkennung ermittelt, welche Wörter gesagt wurden. Stimmerkennung ermittelt anhand der Stimmmerkmale, wer sie gesagt hat, so entsperrt sich ein Telefon für seinen Besitzer. Im Alltag werden die Begriffe munter vertauscht. Dieser Artikel handelt vom Erkennen der Wörter, der Technik hinter Transkription, Diktat und Sprachassistenten.

Ist Spracherkennung eine Form von KI?

Ja. Seit 2012 ist jeder konkurrenzfähige Spracherkenner ein tiefes neuronales Netz, trainiert mit großen Mengen Audio, dieselbe Methodenfamilie wie hinter großen Sprachmodellen. Davor waren auch Hidden-Markov-Modelle eine Form maschinellen Lernens: Sie lernten Wahrscheinlichkeiten aus aufgezeichneter Sprache, statt handgeschriebenen Regeln zu folgen.

Wie genau ist Spracherkennung heute?

Bei klaren Gesprächsaufnahmen erreichen die besten Systeme das Niveau professioneller Transkribenten: Microsoft maß 2017 auf dem Benchmark Switchboard eine Wortfehlerrate von 5,1%, und die Modelle sind seither besser geworden. Sonix erreicht bei gutem Audio 99% Genauigkeit. Starke Akzente, Durcheinanderreden und Hintergrundgeräusche treiben die Fehlerrate weiterhin nach oben, weshalb jedes Transkript mit einem Editor kommt.

Erste Schritte

Sonix kostenlos testen

Sonix transkribiert, versieht mit Zeitstempeln und organisiert Ihre Audio- und Videodateien, damit Sie Ihre Medien suchen, bearbeiten und teilen können.

Beinhaltet 30 minutes Minuten kostenlose Transkription

Weiterlesen

99% Genauigkeit. Jedes Wort zählt.

KI-Transkription und -Übersetzung in 54+ Sprachen.

30 minutes kostenlos
Keine Kreditkarte
Jederzeit kündbar