История
распознавания речи

Распознавание речи изобрели в Bell Labs в 1952 году. Рассказываем, как оно прошло путь от десяти произнесенных цифр до 54+ языков, десятилетие за десятилетием.

Распознавание речи: коротко о главном

Изобретение
Распознавание речи изобрели в 1952 году: система Audrey из Bell Labs распознавала цифры от 0 до 9, произнесенные одним голосом.
Первая программа в продаже
Dragon Dictate вышла в 1990 году по цене около 9000 долларов и стала первым продуктом для распознавания речи в открытой продаже, но требовала паузы после каждого слова.
Первый словарь на 1000 слов
В 1976 году система Harpy из Carnegie Mellon понимала 1011 слов: именно такую планку агентство DARPA поставило перед своей пятилетней программой Speech Understanding Research.
Уровень человека
В 2017 году Microsoft зафиксировала пословную ошибку (WER) 5,1% на телефонном бенчмарке Switchboard, сравнявшись с профессиональными транскрибаторами, которые расшифровывали те же звонки.
Открытые модели
Whisper от OpenAI вышла в сентябре 2022 года: модель обучена на 680 000 часов аудио, транскрибирует почти 100 языков, а ее веса опубликованы в открытом доступе.
Сегодня
Sonix, основанный в 2017 году, транскрибирует 54+ языков с точностью 99% и возвращает часовой файл примерно за 5-6 минут.

Распознавание речи изобрели в 1952 году

Первую систему распознавания речи построили в Bell Labs в 1952 году, и понимала она ровно десять слов: цифры от нуля до девяти.

Audrey, автоматический распознаватель цифр

K. H. Davis, R. Biddulph и S. Balashek собрали Audrey из аналоговых схем, занимавших почти двухметровую релейную стойку. Диктор произносил цифру в телефонную трубку, машина измеряла форманты гласных, и рядом с услышанной цифрой загоралась лампочка. Настроенная на голоса своих создателей, она давала от 97 до 99 процентов верных ответов, а на чужих голосах разваливалась. Audrey так и не покинула лабораторию: живой оператор, набирающий номера, обходился дешевле. Но она закрыла вопрос о том, способна ли машина слышать в принципе.

Shoebox от IBM и 1960-е

В 1962 году IBM показала Shoebox на Всемирной выставке в Сиэтле. Машина распознавала 16 произнесенных слов, десять цифр и шесть арифметических команд, и с их помощью управляла арифмометром. В течение десятилетия лаборатории в США, Великобритании, Японии и Советском Союзе строили распознаватели гласных, согласных и небольших списков слов, а в 1968 году Тарас Винцюк описал метод динамической трансформации времени (dynamic time warping), способ выравнивания, который позволил машине сравнивать речь, произнесенную с разной скоростью. К 1969 году амбиций в этой области хватало, а теории не было: Джон Пирс из Bell Labs сравнил ее со схемами превращения воды в бензин, и лаборатория на годы прекратила финансирование.

Программа DARPA Speech Understanding Research подняла словари выше 1000 слов

С 1971 по 1976 год агентство DARPA финансировало крупнейший на тот момент проект по распознаванию речи, и Harpy из Carnegie Mellon достигла цели в 1000 слов.

Пятилетняя цель

Программа Speech Understanding Research требовала систему, которая понимала бы слитную речь нескольких дикторов со словарем в 1000 слов и ошибкой менее 10 процентов, и платила Carnegie Mellon, BBN, SRI и другим за участие в соревновании. До финиша дошли три системы: Hearsay-II и Harpy из Carnegie Mellon и HWIM из BBN. Harpy, завершенная в 1976 году, понимала 1011 слов, примерно словарный запас трехлетнего ребенка, и единственная взяла заданную планку. Ее секрет заключался в поиске, который рано отсекал маловероятные последовательности слов вместо перебора всех вариантов, и эта идея до сих пор лежит в основе каждого декодера.

Статистический поворот

В те же годы родилась идея, которая следующие 40 лет побеждала все остальные. В Carnegie Mellon Джеймс Бейкер в диссертации 1975 года описал систему DRAGON: она рассматривала речь как скрытую марковскую модель, и какие слова были произнесены, решали вероятности, а не написанные вручную правила. В IBM группа Фредерика Елинека заложила тот же подход в исследовательскую систему диктовки и добавила n-граммные языковые модели, чтобы распознаватель угадывал следующее слово по двум предыдущим. Bell Labs тем временем перешла от одного голоса ко многим и построила распознаватели, работавшие с разными дикторами, чего требовали телефонные приложения.

В 1980-е скрытые марковские модели сделали распознавание речи статистическим

В 1980-е сопоставление с шаблонами уступило место вероятностям, и словари за десятилетие выросли с нескольких сотен слов до 20 000.

Как слышит скрытая марковская модель

Скрытая марковская модель не пытается подогнать звук под шаблон. Она спрашивает, какая последовательность звуков речи вероятнее всего породила полученное аудио, а затем какая последовательность слов вероятнее всего породила эти звуки. Вероятности задаются обучением на записанной речи, поэтому чем больше данных, тем лучше распознаватель, и это свойство приобрело огромное значение с приходом интернета. В сочетании с n-граммными языковыми моделями HMM стала стандартной архитектурой в каждой исследовательской лаборатории и оставалась ею, пока в 2012 году ее не вытеснило глубокое обучение.

Tangora, Sphinx и первые продукты

К середине 1980-х Tangora от IBM распознавала словарь в 20 000 слов, хотя требовала паузы между словами и обучения под каждого диктора. В 1988 году система Sphinx Кай-Фу Ли из Carnegie Mellon первой объединила в одном распознавателе большой словарь, слитную речь и независимость от диктора. Dragon Systems, основанная Джеймсом и Джанет Бейкер в 1982 году, начала продавать программы распознавания для персональных компьютеров. Распознавание голоса впервые дошло и до обычных покупателей: кукла Julie от Worlds of Wonder в 1987 году отвечала на несколько произнесенных фраз, а телефонные компании испытывали голосовой набор номера. Игрушки были грубыми, но именно они принесли словосочетание «распознавание голоса» в обычные дома.

В 1990-е распознавание речи пришло на персональные компьютеры

Более быстрые процессоры превратили диктовку из лабораторной демонстрации в коробочный продукт, а общий бенчмарк позволил легко измерять прогресс.

От Dragon Dictate до NaturallySpeaking

Dragon Dictate вышла в 1990 году по цене около 9000 долларов. Это был первый продукт для распознавания речи, который мог купить любой желающий, и он требовал паузы после каждого слова. В 1997 году Dragon NaturallySpeaking избавилась от паузы: программа распознавала слитную речь со скоростью около 100 слов в минуту на домашнем ПК, и в том же году IBM ответила ViaVoice. Впервые юрист, врач или писатель мог поговорить с компьютером и получить пригодный текст, если сначала обучил программу и потом поправил результат.

Телефонные меню и первые бенчмарки

В 1996 году BellSouth запустила VAL, голосовой портал с дозвоном, который отвечал на произнесенные вопросы, и от него ведет родословную каждая автоматическая телефонная система, с которой вы с тех пор ругались. За кулисами DARPA и Национальный институт стандартов и технологий проводили ежегодные оценки на общих записях, таких как телефонный корпус Switchboard, и пословная ошибка (WER) стала числом, о котором отчитывалась каждая лаборатория. С тех пор история распознавания речи сводится во многом к истории падения этого числа.

В 2000-е распознавание речи переехало в облако

Большую часть десятилетия точность топталась около 80 процентов, пока Google не перенесла распознавание с устройства на свои серверы.

Плато

К 2001 году лучшие системы транскрибировали диктовку с точностью около 80 процентов, а следующие годы принесли доработки, но не рывки. Диктовка на настольных компьютерах осталась нишевой, телефонные меню продолжали раздражать, финансирование исследований иссякало. Скрытая марковская модель подошла к своему потолку, а моделям, которым предстояло ее сменить, еще не хватало ни вычислительной мощности, ни данных.

Google Voice Search

Справочная служба GOOG-411, запущенная Google в 2007 году, была способом собрать миллионы голосовых запросов. В ноябре 2008 года компания выпустила Google Voice Search в виде приложения для iPhone, и распознавание речи изменило форму: телефон только записывал, а само распознавание шло в дата-центрах Google на моделях, куда более крупных, чем могло вместить любое устройство. Английская система Google была обучена на 230 миллиардах слов из поисковых запросов, поэтому умела предсказывать, что люди, скорее всего, скажут, и каждый новый запрос шел на обучение следующей модели. Распознавание стало сервисом, а не программой, и в этой форме существует до сих пор.

Хронология

Вехи распознавания речи, год за годом

У каждого события ниже есть дата. Разделы вокруг этой таблицы объясняют, почему каждое из них было важно.

ГодВехаПочему это важно
1952Bell Labs строит AudreyПервая машина, распознающая речь: цифры от 0 до 9 от одного диктора
1962IBM показывает Shoebox16 слов, показанных публике на Всемирной выставке в Сиэтле
1971DARPA запускает программу Speech Understanding ResearchПять лет финансирования и цель в 1000 слов
1976Harpy из Carnegie Mellon берет планку1011 слов и поиск с отсечением, которым декодеры пользуются до сих пор
1986Tangora от IBM достигает 20 000 словСкрытые марковские модели и n-граммные языковые модели становятся стандартом
1988Sphinx в Carnegie MellonСлитная речь, независимость от диктора и большой словарь в одной системе
1990Выходит Dragon DictateПервый продукт для распознавания речи в открытой продаже
1997Dragon NaturallySpeaking и IBM ViaVoiceСлитная диктовка на домашнем ПК, около 100 слов в минуту
2008Google Voice SearchРаспознавание переезжает в облако и учится на каждом запросе
2011Apple выпускает SiriГолосовой помощник в массовом телефоне
2012Глубокие нейросети сменяют смеси гауссовых распределенийДоля ошибок падает почти на треть за один шаг
2016Microsoft сообщает о 5,9% на SwitchboardПервое заявление об уровне человека на разговорном бенчмарке
2017Microsoft 5,1%, IBM 5,5%, Google 4,9%; опубликован TransformerГонка за уровень человека завершена, приходит новая архитектура
2020wav2vec 2.0 и ConformerСамообучение снижает потребность в размеченных данных
2022OpenAI выпускает Whisper680 000 часов обучения, почти 100 языков, открытые веса

В 2010-е глубокое обучение сократило долю ошибок более чем вдвое

С 2011 по 2017 год пословная ошибка на разговорной телефонной речи упала с уровня чуть выше 10 процентов до примерно 5 процентов, а голосовые помощники поселились в домах.

Siri и голосовые помощники

В октябре 2011 года Apple выпустила Siri вместе с iPhone 4S, и впервые массовый телефон получил голосового помощника за кнопкой «Домой». В 2014 году Amazon ответила Alexa на колонке Echo, а Google в 2016 году выпустила Google Home. Помощники были важны не столько распознаванием, которое, как и в Google Voice Search, работало в облаке, сколько привычкой, которую они сформировали: сотни миллионов людей стали ежедневно разговаривать с машинами, и каждая реплика превращалась в обучающие данные.

Шаг к нейросетям

В 2012 году исследователи из Microsoft, Google, IBM и Университета Торонто, среди них Джеффри Хинтон, опубликовали совместную статью, показавшую, что глубокие нейросети, обученные на акустической части задачи, снижают долю ошибок почти на треть по сравнению со смесями гауссовых распределений, которыми системы на HMM пользовались 25 лет. Система Deep Speech от Baidu в 2014 году пошла дальше и обучила одну рекуррентную сеть сквозным образом, от аудио до символов, без словаря произношений и без собранного вручную конвейера. Распознавание стало задачей глубокого обучения, и вперед вырвались лаборатории с наибольшим числом GPU и данных.

Гонка за уровнем человека

Табло этой гонки стал бенчмарк Switchboard, набор записанных телефонных разговоров. В октябре 2016 года Microsoft сообщила о пословной ошибке 5,9 процента, такой же, как у профессиональных транскрибаторов, нанятых расшифровать те же звонки, и назвала это уровнем человека. В марте 2017 года IBM ответила результатом 5,5 процента, в мае Google объявила о 4,9 процента на собственных тестовых наборах, а в августе 2017 года Microsoft достигла 5,1 процента при более тщательном измерении человеческой планки. График ниже, из отчета Мэри Микер Internet Trends за 2017 год, показывает, как точность распознавания слов у Google пересекает отметку 95 процентов, которую отрасль считала человеческим порогом. В том же году была опубликована архитектура Transformer для машинного перевода, и за три года она захватила и речь.

График точности распознавания слов Google, преодолевающей 95 процентов, из отчета Мэри Микер Internet Trends за 2017 год

Whisper и Transformer сделали транскрибацию общедоступной

Самообучение на неразмеченных данных и одна открытая модель превратили точную многоязычную транскрибацию из привилегии технологических гигантов в то, что может предложить любой продукт.

Обучение на неразмеченном аудио

Узким местом 2010-х были размеченные данные: на каждый час обучения требовалась расшифровка, сделанная человеком. В 2020 году модель wav2vec 2.0 от Facebook AI сначала выучила представления речи на сыром, нерасшифрованном аудио, а для дообучения пригодного распознавателя ей хватало всего десяти минут размеченной речи. Conformer от Google, опубликованный в том же году, соединил свертки с вниманием из Transformer и поставил новые рекорды на стандартных бенчмарках. Вместе они сделали Transformer архитектурой по умолчанию для речи и удешевили добавление нового языка.

Whisper

В сентябре 2022 года OpenAI выпустила Whisper: модель обучена на 680 000 часов аудио, собранного в интернете, охватывает почти 100 языков, а ее веса опубликованы, чтобы запустить ее мог кто угодно. Она не была самой точной на каждом бенчмарке, но устойчиво справлялась с акцентами, фоновым шумом и технической лексикой, чего прежние академические модели не умели, и была бесплатной. За считанные месяцы она оказалась внутри тысяч продуктов, и вопрос для компаний, занимающихся транскрибацией, сместился с того, умеют ли они распознавать речь, к тому, что они строят вокруг расшифровки.

Что это значит для вас сегодня

Часовая запись, загруженная в Sonix, возвращается расшифровкой примерно за 5-6 минут, с разметкой по спикерам, таймкодами и точностью 99% на чистом аудио, на любом из 54+ языков. Sonix основан в 2017 году, в год гонки за уровнем человека, и с тех пор прошел каждый шаг этого пути: модели улучшаются каждый год, а усилия теперь уходят в редактор, конспекты, переводы и экспорт, которые и делают расшифровку полезной. Семь описанных выше десятилетий и есть причина, по которой первая расшифровка сегодня не стоит ничего: ваши первые 30 минут бесплатны.

У автоматического определения языка своя история

Понять, на каком языке говорят, и понять, какие именно слова сказаны, это две разные задачи, и на решение первой ушли свои 50 лет.

От статистики фонем до i-векторов

Первые эксперименты по определению языка в 1970-е пытались различать языки по статистике их звуков, исходя из того, что каждый язык использует свой набор фонем с разной частотой. В 1990-е это переросло в фонотактический подход: запустить распознаватель фонем, а затем спросить, какому языку лучше всего соответствуют полученные цепочки фонем. В 1996 году Национальный институт стандартов и технологий начал официальные оценки Language Recognition Evaluation, и культура бенчмарков, двигавшая вперед распознавание речи, подтолкнула и определение языка. В 2010-е i-вектор, компактное представление записи фиксированной длины, позаимствованное из распознавания диктора, дал системы, способные назвать язык по нескольким секундам аудио.

Встроено в модель

Современные многоязычные распознаватели сводят обе задачи в одну. Whisper и ее наследники предсказывают язык первым токеном расшифровки, так что определение языка становится побочным продуктом распознавания, а не отдельным шагом. Именно это позволяет одному продукту работать с 54+ языками без отдельного распознавателя для каждого, и именно поэтому язык, на котором вы говорите, перестал ограничивать то, что вы можете расшифровать.

Что дальше: голос становится интерфейсом

Технология для голосовых приложений стала дешевой и точной, и вопрос сместился с того, могут ли машины слышать, к тому, что им делать с услышанным.

Голос как основа продукта

Устройства, где голос главный способ управления, от умных колонок до наушников и автомобилей, сделали разговор с машиной обыденностью, а точность, к которой шли 70 лет, теперь воспринимается как данность, а не как функция. Язык остается единственным интерфейсом, который уже есть почти у каждого человека, поэтому небольшое улучшение распознавания доходит до большего числа людей, чем любой новый экран. Компании, которые рано делают ставку на голос, как правило, удерживают эту позицию, как удержали ее компании эпохи mobile-first в 2010-е.

За пределами расшифровки

Сама расшифровка стала сырьем. Большие языковые модели конспектируют встречи, отвечают на вопросы об интервью, переводят лекцию и составляют по ней письмо с итогами, и справляются с этим хорошо только потому, что расшифровка под ними точна. В Sonix именно в этом и заключается работа: распознавание служит фундаментом, заложенным всеми, кто назван выше, а продукт заключается в том, что вы можете сделать со словами, когда они уже есть.

Частые вопросы

История распознавания речи:
ответы на вопросы

Когда и где изобрели распознавание речи?

В 1952 году. Система Audrey из Bell Labs, построенная K. H. Davis, R. Biddulph и S. Balashek, распознавала произнесенные цифры от 0 до 9 от одного диктора. В 1962 году за ней последовала Shoebox от IBM с 16 словами, а первый продукт, который можно было купить, Dragon Dictate, появился в 1990 году.

Кто изобрел распознавание речи?

Не один человек. Первый распознаватель, Audrey, в 1952 году построили три инженера Bell Labs. В 1970-е Джеймс Бейкер и Фредерик Елинек сделали распознавание статистическим с помощью скрытых марковских моделей, в 1988 году Sphinx Кай-Фу Ли научила его слитной речи и независимости от диктора, а в 2012 году соавторы Джеффри Хинтона принесли в него глубокое обучение.

Какая программа распознавания речи была первой?

Dragon Dictate, выпущенная Dragon Systems в 1990 году по цене около 9000 долларов, стала первой программой распознавания речи в открытой продаже. Она требовала паузы между словами. Dragon NaturallySpeaking, вышедшая в 1997 году, стала первым продуктом для диктовки слитной речи на домашних компьютерах.

Распознавание речи и распознавание голоса: в чем разница?

Распознавание речи определяет, какие слова были сказаны. Распознавание голоса определяет, кто их сказал, по характеристикам голоса: так телефон разблокируется для своего владельца. В обиходе эти термины часто путают. Эта статья о распознавании слов, технологии, которая стоит за транскрибацией, диктовкой и голосовыми помощниками.

Относится ли распознавание речи к ИИ?

Да. С 2012 года каждый конкурентоспособный распознаватель речи представляет собой глубокую нейросеть, обученную на больших объемах аудио, то же семейство методов, что стоит за большими языковыми моделями. До этого скрытые марковские модели тоже были формой машинного обучения: они выучивали вероятности из записанной речи, а не следовали написанным вручную правилам.

Насколько точно распознавание речи сегодня?

На чистых разговорных записях лучшие системы не уступают профессиональным транскрибаторам: в 2017 году Microsoft зафиксировала пословную ошибку 5,1% на бенчмарке Switchboard, и с тех пор модели стали лучше. Sonix достигает точности 99% на хорошем аудио. Сильный акцент, наложение голосов и фоновый шум по-прежнему повышают долю ошибок, поэтому к каждой расшифровке прилагается редактор.

Начните работу

Попробуйте Sonix бесплатно

Sonix транскрибирует, расставляет временные метки и систематизирует ваши аудио- и видеофайлы, чтобы вы могли искать, редактировать и делиться своим контентом.

Включает 30 minutes минут бесплатной транскрипции

Продолжить чтение

Точность 99%. Каждое слово имеет значение.

AI-транскрипция и перевод на 54+ языках.

30 minutes бесплатно
Без кредитной карты
Отмена в любое время