Что такое Word Error Rate?

Число, которое стоит за каждым заявлением о точности транскрипции, — как оно рассчитывается, что скрывает и как измерить его на собственном аудио.

Формула Word Error Rate

Коэффициент словесных ошибок — WER (word error rate) — это стандартный способ оценить работу системы автоматического распознавания речи (ASR). Он сравнивает машинную расшифровку с тщательно подготовленной эталонной расшифровкой, сделанной человеком, и считает три типа ошибок: замены, пропуски и вставки. Измерить это сложнее, чем кажется, потому что результат ASR может отличаться по длине от произнесённого текста.

Вот простой способ понять, как рассчитывается WER:

Sonix - Формула Word Error Rate

WER в 5% означает примерно одну ошибку на каждые двадцать слов — если сформулировать наоборот, точность 95%. Впрочем, цифры абстрактны. Вот как каждый тип ошибки наносит реальный ущерб:

Пропускпотеряно 1 слово
Вы сказали
Не подписывай этот договор сегодня
Машина написала
Не подписывай этот договор сегодня

Одно пропущенное слово — и совсем другой день у юридического отдела.

1 пропуск ÷ 5 слов = 20% WER — и 100% смысла

Вставкадобавлено 1 слово
Вы сказали
Первые результаты были многообещающими
Машина написала
Первые результаты были не многообещающими

То же короткое словечко, явившееся без приглашения. Инвесторы на миг в отчаянии.

1 вставка ÷ 4 слова = 25% WER

Заменазаменено 1 слово
Вы сказали
Не забудь взять на реку плот
Машина написала
Не забудь взять на реку плот плод

Одна буква между сплавом по реке и корзиной фруктов.

1 замена ÷ 6 слов = 17% WER

Калькулятор WER: попробуйте формулу сами

Теперь, когда вы знаете, что считается ошибкой, посчитайте сами. Задайте длину эталонной расшифровки, перетащите найденные ошибки и следите, как меняется коэффициент словесных ошибок, — это ровно та арифметика, что стоит за каждым заявлением о точности, которое вам когда-либо встретится.

2.0%коэффициент словесных ошибок
98.0%точность

≈ одна ошибка на каждые 50 слов

Территория чистого аудио — быстро просмотреть, и можно публиковать.

Расчёт вживую: (6 + 3 + 1) ÷ 500 = 2.0%

Гонка за точностью и чем она закончилась

Распознавание речи прошло долгий путь с 1950-х годов — наша краткая история распознавания речи описывает эту дорогу. К 2017 году крупнейшие технологические компании открыто соревновались друг с другом по WER, измеряя его на стандартном эталоне из записанных телефонных разговоров:

Март 2017: IBM заявляет о 5.5% Word Error Rate
Май 2017: Google заявляет о 4.9% Word Error Rate
Август 2017: Microsoft заявляет о 5.1% Word Error Rate

Эти анонсы имели значение, потому что они приблизились к уровню ошибок профессиональных расшифровщиков на том же эталоне — момент, который отрасль назвала «человеческим паритетом». Но гонка на чистых эталонах фактически завершилась толпой похожих цифр. На тщательно записанных тестовых наборах из одной предметной области любой серьёзный современный движок показывает отличный результат — именно поэтому эталонный WER перестал быть интересным вопросом.

Реальные различия между системами транскрипции теперь проявляются в другом: на аудио с совещаний, записанном издалека, при накладывающихся друг на друга голосах, сильном акценте, узкоспециальной лексике и шумных записях из реальной жизни. Два движка с почти одинаковыми эталонными показателями могут вести себя совершенно по-разному на вашем обычном вторничном созвоне — вот почему единственное значимое сравнение то, которое вы проводите на собственном аудио.

Что WER не измеряет

WER считает ошибки в словах и ничего больше — а многое из того, что делает расшифровку пригодной, для него невидимо. Пунктуация и заглавные буквы не оцениваются: стена идеально распознанных, но лишённых знаков препинания слов может показать превосходный WER и при этом быть мучительной для чтения. Атрибуция говорящих тоже не оценивается — вложить правильные слова в уста не того человека для WER совершенно бесплатно. Числа, даты и имена оцениваются так же, как любое другое слово, хотя ошибка в «MRSA» или «выручке за Q3» обычно обходится куда дороже, чем пропущенное «the».

Вот почему расшифровка с чуть более высоким уровнем ошибок, но с аккуратной пунктуацией, абзацами и метками говорящих часто полезнее, чем формально «более точная», но лишённая структуры. Оценивая качество транскрипции, читайте результат как документ, а не только как подсчёт слов — и взвешивайте ошибки по тому, во что они вам обойдутся, а не по их количеству.

Как провести собственный тест WER

Игнорируйте маркетинговые цифры любого поставщика, включая наши, — тест, который действительно важен, занимает около часа. Возьмите десять минут аудио, которое по-настоящему представляет вашу работу: ваши переговорные, ваших собеседников, ваш жаргон. Подготовьте тщательную эталонную расшифровку (это самая медленная часть — эталон должен быть точным). Затем прогоните тот же фрагмент через каждый оцениваемый сервис и подсчитайте замены, пропуски и вставки относительно вашего эталона.

Два практических предупреждения. Во-первых, нормализуйте перед подсчётом: заранее решите, считать ли ошибками «ОК» и «окей», цифры и записанные словами числа или слова-паразиты, и применяйте одни и те же правила к каждому движку — большинство самостоятельных сравнений ломается именно здесь, а не в подсчёте. Во-вторых, не останавливайтесь на уровне ошибок: отметьте, какого рода слова упустил каждый движок и сколько правки на самом деле потребовал результат. Работающий почти так же хорошо короткий путь: расшифруйте фрагмент везде, доведите каждую расшифровку до качества публикации и засеките время правки. Точный движок тот, что обходится вам наименьшим числом исправлений на вашем аудио, что бы ни говорили эталоны.

Как читать заявления поставщиков о точности (включая наши)

Когда Sonix говорит «точность до 99%», это число описывает чистое, хорошо записанное аудио — близкие микрофоны, минимум фонового шума, один говорящий за раз. Это честное число при таких условиях, и заголовочная цифра любого поставщика несёт ту же оговорку мелким шрифтом, заявляют её или нет. Точность падает от шума, расстояния, перекрёстных разговоров и сильного сжатия; ни один движок не исключение, потому что потолок задаёт сама физика аудио.

Поэтому относитесь к любому заявлению о точности как к заявлению об идеальных условиях, а к собственным записям — как к эталону, который действительно важен. Улучшение аудио — микрофон поближе, комната потише, один голос за раз — сделает для вашего коэффициента словесных ошибок больше, чем переключение между любыми двумя современными движками. А с тем, что остаётся после этого, справляется синхронизированный редактор, позволяющий кликнуть по подозрительному слову и услышать стоящее за ним аудио, — именно он закрывает разрыв между измеренной точностью и расшифровкой, которую можно публиковать.

Начните работу

Попробуйте Sonix бесплатно

Sonix транскрибирует, расставляет временные метки и систематизирует ваши аудио- и видеофайлы, чтобы вы могли искать, редактировать и делиться своим контентом.

Включает 30 minutes минут бесплатной транскрипции

Продолжить чтение

Точность 99%. Каждое слово имеет значение.

AI-транскрипция и перевод на 54+ языках.

30 minutes бесплатно
Без кредитной карты
Отмена в любое время