Reconhecimento de fala em resumo
- Invenção
- O reconhecimento de fala foi inventado em 1952, quando o sistema Audrey, da Bell Labs, reconheceu os dígitos de 0 a 9 ditos por uma única voz.
- Primeiro software comercial
- O Dragon Dictate, lançado em 1990 por cerca de US$ 9.000, foi o primeiro produto de reconhecimento de fala vendido ao público, e exigia uma pausa depois de cada palavra.
- Primeiras 1.000 palavras
- Em 1976, o Harpy, da Carnegie Mellon, entendia 1.011 palavras, a meta que a DARPA havia fixado para os cinco anos do seu programa Speech Understanding Research.
- Paridade humana
- Em 2017, a Microsoft mediu uma taxa de erro de palavras de 5,1% no benchmark telefônico Switchboard, igualando os transcritores profissionais que trabalharam nas mesmas ligações.
- Modelos abertos
- O Whisper, da OpenAI, lançado em setembro de 2022, foi treinado com 680.000 horas de áudio e transcreve quase 100 idiomas, com os pesos publicados.
- Hoje
- O Sonix, fundado em 2017, transcreve 54+ idiomas com 99% de precisão e devolve um arquivo de uma hora em cerca de 5 a 6 minutos.
O reconhecimento de fala foi inventado em 1952
O primeiro reconhecedor de fala foi construído na Bell Labs em 1952 e entendia exatamente dez palavras: os dígitos de zero a nove.
Audrey, o reconhecedor automático de dígitos
K. H. Davis, R. Biddulph e S. Balashek construíram a Audrey com circuitos analógicos que ocupavam um rack de relés de quase dois metros. Uma pessoa dizia um dígito ao fone de um telefone, a máquina media os formantes das vogais e uma lâmpada acendia ao lado do dígito ouvido. Ajustada às vozes dos próprios projetistas, acertava de 97 a 99 por cento; com estranhos, desmoronava. A Audrey nunca saiu do laboratório, porque um operador humano discando números saía mais barato, mas encerrou a dúvida sobre se uma máquina era sequer capaz de ouvir.
O Shoebox da IBM e os anos 1960
Em 1962, a IBM demonstrou o Shoebox na Feira Mundial de Seattle. Ele reconhecia 16 palavras faladas, os dez dígitos e seis comandos aritméticos, e com elas operava uma máquina de somar. Ao longo da década, laboratórios nos Estados Unidos, na Grã-Bretanha, no Japão e na União Soviética construíram reconhecedores de vogais, consoantes e pequenas listas de palavras, e em 1968 Taras Vintsyuk descreveu o alinhamento temporal dinâmico (DTW), o método que permite a uma máquina comparar a mesma fala dita em velocidades diferentes. Em 1969, a área tinha ambição, mas não tinha teoria: John Pierce, da Bell Labs, comparou o campo a esquemas para transformar água em gasolina, e o laboratório cortou o financiamento por anos.
O programa Speech Understanding Research da DARPA levou os vocabulários além de 1.000 palavras
Entre 1971 e 1976, a DARPA financiou o maior esforço de reconhecimento de fala até então, e o Harpy, da Carnegie Mellon, alcançou a meta de 1.000 palavras.
A meta de cinco anos
O programa Speech Understanding Research pedia um sistema capaz de entender fala contínua de vários locutores, com um vocabulário de 1.000 palavras e menos de 10 por cento de erro, e pagou a Carnegie Mellon, a BBN, a SRI e outras instituições para competir. Três sistemas cruzaram a linha de chegada: o Hearsay-II e o Harpy, na Carnegie Mellon, e o HWIM, na BBN. O Harpy, concluído em 1976, entendia 1.011 palavras, mais ou menos o vocabulário de uma criança de três anos, e foi o único a cumprir a meta. O truque do Harpy era uma busca que descartava cedo as sequências de palavras improváveis em vez de pesar todas as possibilidades, uma ideia que continua no coração de todo decodificador.
A virada estatística
Os mesmos anos produziram a ideia que venceu todas as outras pelos 40 anos seguintes. Na Carnegie Mellon, a tese de James Baker, de 1975, descrevia o sistema DRAGON, que tratava a fala como um modelo oculto de Markov e deixava que as probabilidades, e não regras escritas à mão, decidissem quais palavras haviam sido ditas. Na IBM, o grupo de Fred Jelinek incorporou a mesma abordagem a um sistema de ditado experimental e acrescentou modelos de linguagem n-gram, para que o reconhecedor pudesse adivinhar a próxima palavra a partir das duas anteriores. A Bell Labs, enquanto isso, passou de uma voz para muitas e construiu reconhecedores que funcionavam com vários locutores, exigência das aplicações telefônicas.
Os modelos ocultos de Markov tornaram o reconhecimento de fala estatístico nos anos 1980
Os anos 1980 trocaram a comparação de padrões pela probabilidade, e os vocabulários passaram de algumas centenas de palavras para 20.000 em uma década.
Como um modelo oculto de Markov ouve
Um modelo oculto de Markov não tenta encaixar um som em um molde. Ele pergunta qual sequência de sons da fala mais provavelmente produziu o áudio recebido e, depois, qual sequência de palavras mais provavelmente produziu esses sons. O treinamento com fala gravada define as probabilidades, então mais dados significam um reconhecedor melhor, uma propriedade que passaria a importar enormemente quando a internet chegasse. Combinado com modelos de linguagem n-gram, o HMM virou a arquitetura padrão de todo laboratório de pesquisa e ali ficou até o aprendizado profundo o destronar em 2012.
Tangora, Sphinx e os primeiros produtos
O Tangora, da IBM, reconhecia um vocabulário de 20.000 palavras em meados dos anos 1980, embora exigisse pausa entre as palavras e treinamento para cada locutor. Em 1988, o sistema Sphinx, de Kai-Fu Lee, na Carnegie Mellon, foi o primeiro a reunir vocabulário grande, fala contínua e independência de locutor em um só reconhecedor. A Dragon Systems, fundada por James e Janet Baker em 1982, começou a vender software de reconhecimento para computadores pessoais. O reconhecimento de voz também chegou ao consumidor pela primeira vez: a boneca Julie, da Worlds of Wonder, respondia a um punhado de frases faladas em 1987, e as companhias telefônicas testaram a discagem por voz. Os brinquedos eram toscos, mas levaram a expressão "reconhecimento de voz" para dentro das casas comuns.
Os anos 1990 levaram o reconhecimento de fala aos computadores pessoais
Processadores mais rápidos transformaram o ditado de demonstração de laboratório em software de prateleira, e um benchmark compartilhado tornou o progresso fácil de medir.
Do Dragon Dictate ao NaturallySpeaking
O Dragon Dictate chegou às lojas em 1990 por cerca de US$ 9.000. Foi o primeiro produto de reconhecimento de fala que uma pessoa comum podia comprar, e exigia uma pausa depois de cada palavra. Em 1997, o Dragon NaturallySpeaking eliminou a pausa: reconhecia fala contínua a cerca de 100 palavras por minuto em um PC doméstico, e a IBM respondeu com o ViaVoice no mesmo ano. Pela primeira vez um advogado, um médico ou um escritor podia falar com o computador e obter um texto utilizável, desde que treinasse o programa e corrigisse o resultado.
Atendimento eletrônico e os primeiros benchmarks
Em 1996, a BellSouth lançou o VAL, um portal de voz por discagem que respondia a perguntas faladas, e todo atendimento eletrônico com o qual você já brigou desde então descende dele. Nos bastidores, a DARPA e o NIST, o instituto de padrões dos Estados Unidos, conduziam avaliações anuais com gravações compartilhadas, como o corpus telefônico Switchboard, e a taxa de erro de palavras virou o número que todo laboratório reportava. Daí em diante, a história do reconhecimento de fala é, em grande parte, a história desse número caindo.
Os anos 2000 levaram o reconhecimento de fala para a nuvem
A precisão ficou estagnada perto de 80 por cento durante a maior parte da década, até o Google tirar o reconhecimento do aparelho e levá-lo para seus servidores.
O platô
Em 2001, os melhores sistemas transcreviam fala ditada com cerca de 80 por cento de precisão, e os anos seguintes trouxeram refinamentos, não saltos. O ditado no desktop continuou um nicho, o atendimento eletrônico continuou irritante e o financiamento de pesquisa minguou. O modelo oculto de Markov estava perto do teto, e os modelos que o substituiriam ainda não tinham o poder computacional nem os dados de que precisavam.
Google Voice Search
O GOOG-411, serviço de auxílio à lista do Google lançado em 2007, era uma forma de coletar milhões de consultas faladas. Em novembro de 2008, a empresa lançou o Google Voice Search como aplicativo para iPhone, e o reconhecimento de fala mudou de forma: o celular apenas gravava, e o reconhecimento rodava nos data centers do Google, em modelos muito maiores do que qualquer aparelho conseguiria armazenar. O sistema em inglês do Google foi treinado com 230 bilhões de palavras de consultas de busca, então conseguia prever o que as pessoas tendiam a dizer, e cada nova consulta alimentava o modelo seguinte. O reconhecimento virou serviço, não programa, e é assim até hoje.
