- Вы сказали
- Не подписывай этот договор сегодня
- Машина написала
Неподписывай этот договор сегодня
Одно пропущенное слово — и совсем другой день у юридического отдела.
1 пропуск ÷ 5 слов = 20% WER — и 100% смысла
Число, которое стоит за каждым заявлением о точности транскрипции, — как оно рассчитывается, что скрывает и как измерить его на собственном аудио.
Коэффициент словесных ошибок — WER (word error rate) — это стандартный способ оценить работу системы автоматического распознавания речи (ASR). Он сравнивает машинную расшифровку с тщательно подготовленной эталонной расшифровкой, сделанной человеком, и считает три типа ошибок: замены, пропуски и вставки. Измерить это сложнее, чем кажется, потому что результат ASR может отличаться по длине от произнесённого текста.
Вот простой способ понять, как рассчитывается WER:

WER в 5% означает примерно одну ошибку на каждые двадцать слов — если сформулировать наоборот, точность 95%. Впрочем, цифры абстрактны. Вот как каждый тип ошибки наносит реальный ущерб:
Одно пропущенное слово — и совсем другой день у юридического отдела.
1 пропуск ÷ 5 слов = 20% WER — и 100% смысла
То же короткое словечко, явившееся без приглашения. Инвесторы на миг в отчаянии.
1 вставка ÷ 4 слова = 25% WER
Одна буква между сплавом по реке и корзиной фруктов.
1 замена ÷ 6 слов = 17% WER
Теперь, когда вы знаете, что считается ошибкой, посчитайте сами. Задайте длину эталонной расшифровки, перетащите найденные ошибки и следите, как меняется коэффициент словесных ошибок, — это ровно та арифметика, что стоит за каждым заявлением о точности, которое вам когда-либо встретится.
≈ одна ошибка на каждые 50 слов
Территория чистого аудио — быстро просмотреть, и можно публиковать.
Расчёт вживую: (6 + 3 + 1) ÷ 500 = 2.0%
Распознавание речи прошло долгий путь с 1950-х годов — наша краткая история распознавания речи описывает эту дорогу. К 2017 году крупнейшие технологические компании открыто соревновались друг с другом по WER, измеряя его на стандартном эталоне из записанных телефонных разговоров:
Март 2017: IBM заявляет о 5.5% Word Error Rate
Май 2017: Google заявляет о 4.9% Word Error Rate
Август 2017: Microsoft заявляет о 5.1% Word Error Rate
Эти анонсы имели значение, потому что они приблизились к уровню ошибок профессиональных расшифровщиков на том же эталоне — момент, который отрасль назвала «человеческим паритетом». Но гонка на чистых эталонах фактически завершилась толпой похожих цифр. На тщательно записанных тестовых наборах из одной предметной области любой серьёзный современный движок показывает отличный результат — именно поэтому эталонный WER перестал быть интересным вопросом.
Реальные различия между системами транскрипции теперь проявляются в другом: на аудио с совещаний, записанном издалека, при накладывающихся друг на друга голосах, сильном акценте, узкоспециальной лексике и шумных записях из реальной жизни. Два движка с почти одинаковыми эталонными показателями могут вести себя совершенно по-разному на вашем обычном вторничном созвоне — вот почему единственное значимое сравнение то, которое вы проводите на собственном аудио.
WER считает ошибки в словах и ничего больше — а многое из того, что делает расшифровку пригодной, для него невидимо. Пунктуация и заглавные буквы не оцениваются: стена идеально распознанных, но лишённых знаков препинания слов может показать превосходный WER и при этом быть мучительной для чтения. Атрибуция говорящих тоже не оценивается — вложить правильные слова в уста не того человека для WER совершенно бесплатно. Числа, даты и имена оцениваются так же, как любое другое слово, хотя ошибка в «MRSA» или «выручке за Q3» обычно обходится куда дороже, чем пропущенное «the».
Вот почему расшифровка с чуть более высоким уровнем ошибок, но с аккуратной пунктуацией, абзацами и метками говорящих часто полезнее, чем формально «более точная», но лишённая структуры. Оценивая качество транскрипции, читайте результат как документ, а не только как подсчёт слов — и взвешивайте ошибки по тому, во что они вам обойдутся, а не по их количеству.
Игнорируйте маркетинговые цифры любого поставщика, включая наши, — тест, который действительно важен, занимает около часа. Возьмите десять минут аудио, которое по-настоящему представляет вашу работу: ваши переговорные, ваших собеседников, ваш жаргон. Подготовьте тщательную эталонную расшифровку (это самая медленная часть — эталон должен быть точным). Затем прогоните тот же фрагмент через каждый оцениваемый сервис и подсчитайте замены, пропуски и вставки относительно вашего эталона.
Два практических предупреждения. Во-первых, нормализуйте перед подсчётом: заранее решите, считать ли ошибками «ОК» и «окей», цифры и записанные словами числа или слова-паразиты, и применяйте одни и те же правила к каждому движку — большинство самостоятельных сравнений ломается именно здесь, а не в подсчёте. Во-вторых, не останавливайтесь на уровне ошибок: отметьте, какого рода слова упустил каждый движок и сколько правки на самом деле потребовал результат. Работающий почти так же хорошо короткий путь: расшифруйте фрагмент везде, доведите каждую расшифровку до качества публикации и засеките время правки. Точный движок тот, что обходится вам наименьшим числом исправлений на вашем аудио, что бы ни говорили эталоны.
Когда Sonix говорит «точность до 99%», это число описывает чистое, хорошо записанное аудио — близкие микрофоны, минимум фонового шума, один говорящий за раз. Это честное число при таких условиях, и заголовочная цифра любого поставщика несёт ту же оговорку мелким шрифтом, заявляют её или нет. Точность падает от шума, расстояния, перекрёстных разговоров и сильного сжатия; ни один движок не исключение, потому что потолок задаёт сама физика аудио.
Поэтому относитесь к любому заявлению о точности как к заявлению об идеальных условиях, а к собственным записям — как к эталону, который действительно важен. Улучшение аудио — микрофон поближе, комната потише, один голос за раз — сделает для вашего коэффициента словесных ошибок больше, чем переключение между любыми двумя современными движками. А с тем, что остаётся после этого, справляется синхронизированный редактор, позволяющий кликнуть по подозрительному слову и услышать стоящее за ним аудио, — именно он закрывает разрыв между измеренной точностью и расшифровкой, которую можно публиковать.
Sonix транскрибирует, расставляет временные метки и систематизирует ваши аудио- и видеофайлы, чтобы вы могли искать, редактировать и делиться своим контентом.
Включает 30 minutes минут бесплатной транскрипции
AI-транскрипция и перевод на 54+ языках.