El reconocimiento de voz de un vistazo
- Invención
- El reconocimiento de voz se inventó en 1952, cuando el sistema Audrey de Bell Labs reconoció los dígitos del 0 al 9 pronunciados por una sola voz.
- Primer software de consumo
- Dragon Dictate, lanzado en 1990 por unos 9,000 dólares, fue el primer producto de reconocimiento de voz vendido al público, y exigía una pausa después de cada palabra.
- Primer vocabulario de 1,000 palabras
- Harpy, de Carnegie Mellon, entendía 1,011 palabras en 1976, la meta que DARPA había fijado para su programa quinquenal Speech Understanding Research.
- Paridad humana
- En 2017 Microsoft midió una tasa de error de palabras del 5.1% en el benchmark telefónico Switchboard, igualando a los transcriptores profesionales que trabajaron las mismas llamadas.
- Modelos abiertos
- Whisper, de OpenAI, lanzado en septiembre de 2022, se entrenó con 680,000 horas de audio y transcribe casi 100 idiomas con pesos publicados.
- Hoy
- Sonix, fundada en 2017, transcribe 54+ idiomas con una precisión del 99% y devuelve un archivo de una hora en unos 5 a 6 minutos.
El reconocimiento de voz se inventó en 1952
El primer reconocedor de voz se construyó en Bell Labs en 1952 y entendía exactamente diez palabras: los dígitos del cero al nueve.
Audrey, el reconocedor automático de dígitos
K. H. Davis, R. Biddulph y S. Balashek construyeron Audrey con circuitos analógicos que llenaban un bastidor de relés de casi dos metros. El hablante decía un dígito por el auricular de un teléfono, la máquina medía los formantes de las vocales y se encendía una lámpara junto al dígito que había oído. Ajustada a las voces de sus diseñadores acertaba entre el 97 y el 99 por ciento; con desconocidos se venía abajo. Audrey nunca salió del laboratorio, porque salía más barato que una operadora marcara los números, pero zanjó la duda de si una máquina podía oír siquiera.
El Shoebox de IBM y los años 60
En 1962 IBM presentó Shoebox en la Feria Mundial de Seattle. Reconocía 16 palabras habladas, los diez dígitos y seis órdenes aritméticas, y con ellas manejaba una máquina de sumar. A lo largo de la década, laboratorios de Estados Unidos, Gran Bretaña, Japón y la Unión Soviética construyeron reconocedores de vocales, consonantes y listas cortas de palabras, y en 1968 Taras Vintsyuk describió el alineamiento temporal dinámico, el método que permitía a una máquina comparar habla pronunciada a distintas velocidades. En 1969 el campo tenía ambición pero no teoría: John Pierce, de Bell Labs, lo comparó con los planes para convertir agua en gasolina, y el laboratorio dejó de financiarlo durante años.
El programa Speech Understanding Research de DARPA llevó los vocabularios más allá de las 1,000 palabras
Entre 1971 y 1976 DARPA financió el mayor esfuerzo en reconocimiento de voz hasta la fecha, y Harpy, de Carnegie Mellon, alcanzó su meta de 1,000 palabras.
La meta a cinco años
El programa Speech Understanding Research pedía un sistema capaz de entender habla encadenada de varios hablantes con un vocabulario de 1,000 palabras y menos del 10 por ciento de error, y pagó a Carnegie Mellon, BBN, SRI y otros para que compitieran. Tres sistemas llegaron a la meta: Hearsay-II y Harpy, de Carnegie Mellon, y HWIM, de BBN. Harpy, terminado en 1976, entendía 1,011 palabras, más o menos el vocabulario de un niño de tres años, y fue el único que cumplió el objetivo. Su truco era una búsqueda que descartaba pronto las secuencias de palabras improbables en lugar de sopesar cada posibilidad, una idea que sigue siendo el núcleo de todo decodificador.
El giro estadístico
De esos mismos años salió la idea que se impuso a todas las demás durante los 40 años siguientes. En Carnegie Mellon, la tesis de James Baker de 1975 describía el sistema DRAGON, que trataba el habla como un modelo oculto de Márkov y dejaba que las probabilidades, y no reglas escritas a mano, decidieran qué palabras se habían dicho. En IBM, el grupo de Fred Jelinek incorporó el mismo enfoque a un sistema de dictado experimental y añadió modelos de lenguaje de n-gramas, de modo que el reconocedor podía adivinar la siguiente palabra a partir de las dos anteriores. Bell Labs, mientras tanto, pasó de una voz a muchas y construyó reconocedores que funcionaban con distintos hablantes, algo que las aplicaciones telefónicas exigían.
Los modelos ocultos de Márkov hicieron estadístico el reconocimiento de voz en los años 80
Los años 80 sustituyeron la comparación de patrones por la probabilidad, y los vocabularios pasaron de unos cientos de palabras a 20,000 en una década.
Cómo oye un modelo oculto de Márkov
Un modelo oculto de Márkov no intenta emparejar un sonido con una plantilla. Se pregunta qué secuencia de sonidos del habla produjo con mayor probabilidad el audio que recibió, y después qué secuencia de palabras produjo con mayor probabilidad esos sonidos. Las probabilidades se fijan entrenando con habla grabada, así que más datos significan un reconocedor mejor, una propiedad que importaría muchísimo cuando llegara internet. Combinado con modelos de lenguaje de n-gramas, el HMM se convirtió en la arquitectura estándar de todos los laboratorios de investigación y ahí se quedó hasta que el aprendizaje profundo lo desplazó en 2012.
Tangora, Sphinx y los primeros productos
Tangora, de IBM, reconocía un vocabulario de 20,000 palabras a mediados de los años 80, aunque necesitaba una pausa entre palabras y entrenarse con cada hablante. En 1988 el sistema Sphinx de Kai-Fu Lee, en Carnegie Mellon, fue el primero en combinar vocabulario amplio, habla continua e independencia del hablante en un solo reconocedor. Dragon Systems, fundada por James y Janet Baker en 1982, empezó a vender software de reconocimiento para computadoras personales. El reconocimiento de voz también llegó por primera vez a los consumidores: la muñeca Julie, de Worlds of Wonder, respondía a un puñado de frases habladas en 1987, y las compañías telefónicas probaron la marcación por voz. Los juguetes eran rudimentarios, pero metieron la expresión "reconocimiento de voz" en los hogares de la gente común.
Los años 90 llevaron el reconocimiento de voz a las computadoras personales
Procesadores más rápidos convirtieron el dictado de una demostración de laboratorio en software vendido en caja, y una prueba de referencia compartida facilitó medir el progreso.
De Dragon Dictate a NaturallySpeaking
Dragon Dictate salió a la venta en 1990 por unos 9,000 dólares. Fue el primer producto de reconocimiento de voz que cualquier persona podía comprar, y exigía una pausa después de cada palabra. En 1997 Dragon NaturallySpeaking eliminó la pausa: reconocía habla continua a unas 100 palabras por minuto en una computadora doméstica, e IBM respondió con ViaVoice ese mismo año. Por primera vez un abogado, un médico o un escritor podía hablarle a una computadora y obtener texto utilizable, siempre que lo entrenara y lo corrigiera.
Menús telefónicos y las primeras evaluaciones
En 1996 BellSouth lanzó VAL, un portal de voz al que se llamaba por teléfono y que respondía preguntas habladas; de él descienden todos los sistemas telefónicos automáticos con los que usted ha discutido desde entonces. Tras bambalinas, DARPA y el Instituto Nacional de Estándares y Tecnología (NIST) organizaban evaluaciones anuales sobre grabaciones compartidas como el corpus telefónico Switchboard, y la tasa de error de palabras se convirtió en la cifra que todos los laboratorios reportaban. A partir de ahí, la historia del reconocimiento de voz es en buena medida la historia de cómo fue bajando esa cifra.
Los años 2000 llevaron el reconocimiento de voz a la nube
La precisión se estancó cerca del 80 por ciento durante casi toda la década, hasta que Google sacó el reconocimiento del dispositivo y lo llevó a sus servidores.
La meseta
Hacia 2001 los mejores sistemas transcribían habla dictada con una precisión cercana al 80 por ciento, y los años siguientes trajeron retoques más que saltos. El dictado de escritorio siguió siendo un nicho, los menús telefónicos siguieron siendo frustrantes y el financiamiento de la investigación se redujo. El modelo oculto de Márkov estaba cerca de su techo, y los modelos que lo reemplazarían todavía no tenían la capacidad de cómputo ni los datos que necesitaban.
Google Voice Search
El servicio de directorio GOOG-411 de Google, lanzado en 2007, fue una forma de recopilar millones de consultas habladas. En noviembre de 2008 la empresa publicó Google Voice Search como aplicación para iPhone, y el reconocimiento de voz cambió de forma: el teléfono solo grababa, y el reconocimiento se ejecutaba en los centros de datos de Google con modelos mucho más grandes de lo que cualquier dispositivo podía albergar. El sistema en inglés de Google se entrenó con 230 mil millones de palabras de consultas de búsqueda, así que podía predecir lo que la gente tendía a decir, y cada consulta nueva alimentaba el modelo siguiente. El reconocimiento pasó de ser un programa a ser un servicio, la forma que todavía conserva.
