Вы только что расшифровали важную консультацию с пациентом, показания в суде или многочасовые исследовательские интервью — и вдруг обнаружили, что инструмент транскрипции на базе ИИ вставил слова, фразы или целые предложения, которые на самом деле не произносились. Это задокументированный режим failure, известный как «транскрипционные галлюцинации», который может привести к серьезным проблемам, если стенограммы используются без проверки.
В одном из исследований 2024 года, в ходе которого был проанализирован 13 140 коротких аудиофрагментов на английском языке, ученые выявили галлюцинаторные фразы или предложения в 1.4% из сегментов, обработанных в условиях тестирования в рамках данного исследования. Этот показатель не следует рассматривать как универсальный: результаты могут существенно варьироваться в зависимости от версии модели, аудиоматериала, языка, группы говорящих, параметров сегментации и декодирования. Тем не менее, исследование демонстрирует, почему команды, полагающиеся на автоматическая транскрипция Для работы, от которой зависит многое, необходимы надежные процедуры проверки и доступ к исходной записи.
Последствия выходят за рамки обычных ошибок при транскрипции. Исследователи обнаружили примеры, связанные с использованием оскорбительных выражений, неверными расовыми ассоциациями, вымышленными личными данными и несуществующими методами лечения.
Основные выводы
- В одном из исследований программа Whisper генерировала галлюцинированные фразы или предложения в 1,41 TP5T из 13 140 протестированы короткие аудиофрагменты
- Исследователи отнесли 38% выявленных галлюцинаций к категории, contai сопряженных с явным вредом, включая агрессивные высказывания, неверные ассоциации, вымышленные личные данные или ложное представление о властных полномочиях
- В ходе последующего сравнения было установлено, что пять других сервисов преобразования речи в текст не воспроизводили аналогичных «галлюцинированных» фрагментов в 187 протестированных образцах, хотя этот результат не доказывает, что эти сервисы никогда не допускают «галлюцинаций»
- Тишина, длительные паузы, фоновые звуки и другие интервалы, не связанные с речью, часто ассоциируются с галлюцинациями типа «Шёпот»
- В наборе данных исследования галлюцинации встречались чаще в сегментах, произнесенных носителями афазии, чем в контрольных сегментах; это связано с проблемами доступности rai и fairness
- Обнаружение голосовой активности и другие методы фильтрации неречевых сигналов могут снизить количество галлюцинаций в некоторых рабочих процессах Whisper, однако их эффективность зависит от модели, аудиозаписи и настроек
- Оригинальные записи должны оставаться доступными до тех пор, пока стенограммы, имеющие важное значение, не будут проверены и утверждены
- Не следует считать, что какая-либо система автоматической транскрипции абсолютно безошибочна, особенно в сфере здравоохранения, права, трудовых отношений или научных исследований
Что такое транскрипция с помощью ИИ: как речь превращается в текст
Современная транскрипция с использованием искусственного интеллекта основана на нейронных сетях, обученных на обширных наборах аудиоданных, и позволяет преобразовывать устную речь в письменный текст. Эта технология кардинально изменила подход специалистов к работе с аудиоконтентом, позволяя преобразовывать записи в текст с возможностью поиска гораздо быстрее, чем при ручной транскрипции.
Различные системы используют разные архитектуры, однако этот процесс, как правило, состоит из нескольких этапов:
- Обработка аудиосигналов: Исходные аудиоданные преобразуются в такое представление, как спектрограмма
- Распознавание речи: Модель выявляет закономерности в аудиосигнале и сопоставляет их с текстовыми токенами
- Декодирование последовательности: Система выбирает вероятную последовательность слов на основе как аудиоданных, так и шаблонов, выученных в ходе обучения
- Постобработка: Могут быть добавлены знаки препинания, временные метки, обозначения говорящих и форматирование
Эти системы могут демонстрировать хорошие результаты при работе с четким аудиосигналом, однако точность зависит от качества записи, акцентов, перекрывающейся речи, технической терминологии, фоновых шумов, а также от того, насколько аудиосигнал соответствует данным, использованным при обучении модели.
Что такое «галлюцинации ИИ» при транскрипции?
Галлюцинации ИИ при транскрипции возникают, когда система преобразования речи в текст генерирует текст, не имеющий никакого смыслового обоснования в исходном аудиозаписи. Это отличается от обычной замены, например, когда слово “cat” транскрибируется как “hat”. Галлюцинация может привести к появлению целой фразы или предложения, которые никогда не произносились.
Исследователи, проанализировавшие 13 140 аудиофрагментов, выявили 187 случаев галлюцинаций. Они классифицировали 38% из этих галлюцинаторных отрывков как содержащие явные угрозы причинения вреда, в том числе:
- Нецензурная лексика: Вставка агрессивных высказываний в иначе безобидную речь
- Неверные ассоциации: Добавление таких характеристик, как раса, о которых говорящий никогда не упоминал
- Медицинские изобретения: Придумывание несуществующих методов лечения или названий лекарств
- Ложное авторитетное мнение: Добавление текста, напоминающего цитату, подпись к изображению или авторитетное утверждение
Эти примеры вызывают беспокойство, поскольку сфабрикованный текст может выглядеть плавным и достоверным, из-за чего его трудно распознать без сравнения транскрипта с исходным аудиозаписью.
В отдельном исследовании 2025 года в модель Whisper намеренно подавали неречевые звуки, чтобы выяснить, в каких случаях модель генерирует текст без речевого ввода. Исследователи заметили повторяющиеся фразы, такие как “спасибо” и “спасибо за просмотр”. Они предположили, что эти паттерны могут отражать типичный язык интернет-медиа, использованных при обучении модели. Поскольку эксперименты были сосредоточены на неречевых файлах, их процентные показатели не следует интерпретировать как ожидаемые показатели галлюцинаций для обычных разговоров или интервью.
Почему модели транскрипции на базе ИИ, такие как Whisper, дают неверные результаты
OpenAI описывает Whisper как трансформер типа «кодер-декодер». Аудиосигнал преобразуется в логарифмическую спектрограмму по шкале Мела и обрабатывается аудиокодером, а декодер генерирует соответствующие текстовые токены.
Поскольку модель генерирует текст последовательно, она иногда может выдавать беглый текст, который недостаточно обоснован акустическим входным сигналом. Исследователи и разработчики заметили, что такое поведение особенно часто наблюдается в следующих случаях:
- Молчание и длинные паузы: Длительные интервалы без голоса могут привести к тому, что у декодера останется мало акустических ориентиров
- Аудио, не связанное с речью: Музыка, фоновые звуки и окружающий шум иногда могут вызывать генерацию текста
- Низкое качество записи: Искажения, низкая громкость, клиппинг или сильный фоновый шум затрудняют восприятие речевого сигнала
- Нарушения плавности речи: Заикание, нерешительность, прерывистая речь и длительные паузы могут затруднять распознавание
- Настройки сегментации и декодирования: Длина блока, пороговые значения, подсказки и другие параметры реализации могут повлиять на результат
OpenAI сообщила, что исходная система Whisper была обучена на 680 000 часов многоязычного и многозадачного аудиоматериала с контролируемым обучением, собранного из Интернета. Обширный набор данных способствует гибкости модели, однако обучающий материал, полученный из Интернета, может также подвергнуть систему воздействию повторяющихся шаблонов субтитров и речевых паттернов в видео.
Исследователи не установили единой причины возникновения всех галлюцинаций. Имеющиеся данные свидетельствуют о том, что галлюцинации возникают в результате взаимодействия звуковых условий, архитектуры модели, обучающих данных и параметров декодирования.
Влияние галлюцинаций на точность транскрипции
Для специалистов в сфере здравоохранения, юридических услуг, научных исследований и СМИ выдуманная фраза может иметь более серьезные последствия, чем обычная орфографическая ошибка.
Последствия для здоровья
В октябре 2024 года агентство Associated Press сообщило, что продукт компании Nabla для ведения медицинской документации на базе платформы Whisper используется более чем 30 000 врачей в 40 системах здравоохранения. Компания Nabla также сообщила, что с помощью этого продукта было обработано, по оценкам, семь миллионов посещений врача.
Агентство AP сообщило, что компания Nabla удаляла исходные аудиозаписи после их обработки из соображений безопасности данных. Клиницисты Nabla said должны были проверять и утверждать сгенерированные записи. Этот пример иллюстрирует важное противоречие: удаление записей может снизить некоторые риски, связанные с хранением данных, но в то же время может помешать последующему сравнению с исходным разговором.
Компания OpenAI предупредила, что использование результатов распознавания речи в процессах принятия решений, где неточности могут привести к серьезным последствиям, может быть рискованным. Поэтому медицинские организации должны вводить обязательную проверку результатов врачами, разработать четкие правила хранения и проверки данных, а также использовать услуги, на которые распространяются надлежащие меры защиты конфиденциальности и договорные гарантии.
Правовые и научно-исследовательские аспекты
В юридической практике сфабрикованное содержание стенограммы может повлиять на подготовку к даче показаний, анализ дела или рассмотрение доказательств. Автоматически сгенерированный черновой вариант не должен рассматриваться в качестве официального документа без проверки и заверения, требуемых соответствующим судом, юрисдикцией или профессиональными правилами.
Исследовательские группы сталкиваются с связанным с этим риском. Если вымышленная цитата попадает в этап качественного кодирования или тематического анализа, это может повлиять на результаты и подорвать достоверность исследования. Исследователи должны сохранять исходные записи, документировать процесс их транскрибирования и проверять цитаты, используемые в отчетах или публикациях.
В ходе исследования, проводимого под руководством Корнельского университета, также было выявлено несоответствие между наборами данных по пациентам с афазией и контрольной группой. Галлюцинации наблюдались у 1,71 TP5T сегментов из речи людей с афазией и 1,2% контрольных сегментов. Исследователи связали эту разницу с более длительными периодами отсутствия речи. Это не означает, что каждый человек с нарушением речи будет сталкиваться с таким же несоответствием, но поднимает вопросы доступности и справедливости для организаций, использующих автоматические транскрипты в ситуациях, имеющих серьезные последствия.
Передовые методы минимизации «галлюцинаций» при транскрипции с использованием ИИ
Ни один метод снижения рисков не гарантирует идеальную стенограмму. Однако существуют некоторые приемы, которые позволяют снизить риск и облегчить выявление ошибок.
Технические меры по снижению рисков
- Предварительная обработка с использованием алгоритма обнаружения голосовой активности: Удаление или выделение интервалов, не содержащих речи, перед транскрипцией может снизить вероятность того, что модель сгенерирует текст во время пауз
- Тщательная сегментация: Обрабатывайте аудио по сегментам, соответствующим выбранной модели, а не применяйте произвольные правила, определяющие продолжительность
- Консервативные настройки декодирования: Ознакомьтесь с документацией по конкретной реализации Whisper и протестируйте настройки на типичном аудиофайле against
- Проверка повторений и аномалий: Отмечайте повторяющиеся фразы, резкие смены темы, заключительные фразы в стиле видеороликов или необычно плавный текст во время пауз
- Оценка с использованием системы контроля версий: Повторно тестируйте рабочие процессы при изменении моделей, языковых настроек, подсказок, методов предварительной обработки или библиотек декодирования
В исследовании 2025 года также был протестирован метод постобработки под названием “мешок галлюцинаций”, который фильтрует повторяющиеся результаты, полученные в ходе экспериментов, не связанных с речью. Этот метод позволил снизить количество ошибок в данных контролируемых условиях, однако его не следует рассматривать в качестве универсальной альтернативы проверке исходного аудиоматериала.
Передовой опыт организации рабочих процессов
- Исходный аудиосигнал Maintain: Храните записи до тех пор, пока стенограмма не будет проверена, с учетом требований в отношении согласия, конфиденциальности, сроков хранения и законодательных норм
- Внедрить проверку специалистом: Требуется экспертная оценка до того, как результаты анализов, имеющие большое значение, повлияют на медицинскую помощь, судебные решения, прием на работу, результаты исследований или публикации
- Уделите особое внимание участкам с повышенной опасностью: Разделы для проверки: номера, названия лекарств, имена, даты, цитаты, юридические термины или длительные паузы
- Команды Train, занимающиеся предупреждающими знаками: Обращайте внимание на повторяющиеся фразы, неожиданные моменты в содержании, резкие изменения стиля или слова, произносимые во время пауз
- Ответственность за документ: Чётко определите, кто должен проверять, утверждать, исправлять и retain каждую академическую справку
Выбор надежного программного обеспечения для транскрипции с помощью ИИ
Результаты исследования, проведённого под руководством Корнельского университета, свидетельствуют о том, что выявленные в ходе работы галлюцинации не воспроизводились одинаково всеми сервисами преобразования речи в текст. Когда исследователи протестировали 187 образцов «Whisper-галлюцинаций» с помощью сервисов Google Cloud Speech-to-Text, Microsoft Azure Speech-to-Text, Amazon Transcribe, AssemblyAI и Rev AI, эти системы не генерировали сопоставимых галлюцинаторных фрагментов в ходе данного эксперимента.
Это полезный вывод, но он не является доказательством того, что какой-либо сервис не способен к галлюцинациям. Сравнение ограничивалось конкретными выборками, версиями сервисов и конфигурациями.
При оценке программное обеспечение для транскрипции, обратите внимание на следующее:
- Доступ к исходному аудиофайлу: Могут ли рецензенты прослушивать запись одновременно с чтением стенограммы?
- Оценка эффективности: Связаны ли слова с временными метками для быстрой проверки?
- Инструменты для докладчиков: Могут ли пользователи выявлять и исправлять метки говорящих?
- Контроль терминологии: Могут ли команды добавлять имена, аббревиатуры и техническую терминологию?
- Документация по безопасности: Обеспечивает ли поставщик четкое документирование мер шифрования, средств контроля доступа, аудита, местонахождения данных и сроков их хранения?
- Соответствие условиям договора: Существуют ли соответствующие соглашения в отношении регулируемых или конфиденциальных данных?
- Параметры экспорта и аудита: Могут ли команды сохранять исправленные версии и фиксировать утверждения?
- Репрезентативное тестирование: Был ли сервис протестирован с использованием реальных языков, акцентов, микрофонов и условий эксплуатации, характерных для данной организации?
Одна только цена не определяет, будет ли система давать сбои. Важную роль играют архитектура, реализация, качество звука, функции прослушивания и элементы управления.
Использование расширенных функций для повышения качества транскрипции
Функции, связанные с моделью транскрипции, могут облегчить выявление и исправление ошибок.
Инструменты для редактирования и проверки
- Временные коды на уровне слов: Привязать текст транскрипта к соответствующему моменту в записи
- Синхронизированное воспроизведение: Дайте рецензентам возможность прослушивать текст во время чтения или редактирования
- Идентификация спикера: Разделить динамики и разрешить исправление меток
- Редактирование в браузере: Включить исправления без перемещения контента в отдельное приложение
- Пользовательские словари: Позволить пользователям добавлять имена собственные, техническую терминологию, аббревиатуры и предпочтительные варианты написания
Анализ и выводы
Инструменты для анализа ИИ могут извлекать темы, резюме, разделы, ключевые вопросы, тональность или ключевые моменты из стенограмм. Эти результаты зависят от исходной стенограммы. Команды должны исправлять значительные ошибки в транскрипции, прежде чем полагаться на результаты последующего анализа, особенно если эти результаты используются для научных исследований, подготовки отчетов или принятия бизнес-решений.
Особенности совместной работы
Общие рабочие пространства, права доступа, возможность оставлять комментарии и рабочие процессы рецензирования помогают командам распределять ответственность и избегать путаницы с версиями. Функции совместной работы особенно ценны в тех случаях, когда в организации также определено, кто несет ответственность за утверждение окончательного текста.
Безопасная и соответствующая нормативным требованиям транскрипция с использованием ИИ для конфиденциальных данных
Безопасность и соблюдение нормативных требований — это нечто большее, чем просто логотип сертификата. Организациям следует тщательно оценить сервис, выбранный тарифный план, условия договора, настройки и предполагаемое использование.
Процедура регистрации поставщиков систем распознавания речи, применяемых в условиях окружающей среды, установленная NHS England, требует от участвующих поставщиков предоставления подтверждения статуса медицинского устройства класса I, а также результатов актуальной оценки в соответствии с «Критериями оценки цифровых технологий». Это свидетельствует о все более тщательном контроле за инструментами ведения клинической документации, однако не следует интерпретировать это как универсальное правило, одинаково применимое ко всем продуктам для транскрипции в любых учреждениях NHS.
К средствам обеспечения безопасности, которые необходимо проанализировать, относятся:
- Независимые аудиты систем контроля, такие как SOC 2 Type II
- Шифрование данных при передаче и хранении
- Контроль доступа на основе ролей
- Многофакторная аутентификация и варианты управления идентификацией в корпоративной среде
- Информация о хранении и сроках хранения данных
- Управление удалением и экспортом
- Соглашения о деловом партнерстве или иные надлежащие договорные гарантии, если это необходимо
Организации должны уточнить точный объем каждой сертификации и определить, распространяется ли она на ту услугу, тот план и тот сценарий использования, которые они намерены внедрить.
Почему Sonix поддерживает рабочие процессы транскрипции с использованием проверяемого ИИ
Для команд, которым необходимо эффективно просматривать и управлять стенограммами, Sonix сочетает автоматическую транскрипцию с инструментами для проверки результата по исходной записи.
В настоящее время Sonix предлагает следующие возможности:
- Браузерный редактор с функциями синхронизированного воспроизведения, поиска, навигации по словам и маркировки говорящих
- Пользовательские словари, позволяющие добавлять имена, техническую терминологию, аббревиатуры и предпочтительные варианты написания
- Сертификация SOC 2 Type II, шифрование TLS при передаче данных и шифрование AES-256 при хранении данных
- Меры безопасности в соответствии с требованиями закона HIPAA, реализуемые с помощью Medical Sonix, включая соглашения о деловом партнерстве для соответствующих медицинских организаций
- Поддержка транскрипции для более чем 54 языков
- Анализ на основе искусственного интеллекта для кратких изложений, глав, тем, тональности и других выводов, основанных на стенограммах
- Средства управления совместной работой в команде, включая рабочие пространства, права доступа и функции совместного использования
Эти средства контроля помогают пользователям выявлять и исправлять ошибки, но не избавляют от необходимости проверки. Не следует считать, что любая автоматически сгенерированная стенограмма идеально отражает каждое произнесенное слово без проверки.
Независимо от того, являетесь ли вы исследовательская компания анализ интервью, а новостная редакция работа в соответствии со сроками against или предприятие Для команды, работающей с большими объемами записей, наиболее надежным рабочим процессом является тот, при котором стенограмма привязана к исходному аудиофайлу и четко распределена ответственность за утверждение.
Окончательный вывод: как выбрать подходящее решение для транскрипции с учетом ваших потребностей
Выбор между самостоятельно управляемым рабочим процессом Whisper и хостинговой платформой для транскрипции зависит от технических ресурсов, требований к данным, потребностей в проверке и уровня допустимого риска.
Использование самостоятельно управляемого рабочего процесса Whisper может быть целесообразно в следующих случаях:
- Содержание не представляет высокого риска, и допустимы единичные ошибки
- Организация может тестировать версии моделей, а также настройки предварительной обработки, сегментации и декодирования
- Технический персонал может осуществлять мониторинг и принимать меры по снижению рисков
- Исходные записи remain и available для проверки
- Перед использованием важные результаты проверяются квалифицированным специалистом
Платформа с управляемой транскрипцией может оказаться предпочтительным вариантом, если вам необходимо:
- Синхронизированный редактор для сравнения текста с исходным аудио
- Диктор, временные метки, терминология и инструменты корректировки
- Общие рабочие пространства и права доступа
- Документированные меры обеспечения безопасности и конфиденциальности
- Поддержка нескольких языков и форматов экспорта
- Рабочий процесс, позволяющий рецензентам без технической подготовки эффективно утверждать стенограммы
В таких сферах, как здравоохранение, право, научные исследования, журналистика и других областях, где ошибки могут иметь серьезные последствия, ключевой вопрос заключается не в том, обещает ли поставщик идеальную точность. Важно то, обеспечивает ли система визуализацию ошибок, сохраняет ли доказательства, необходимые для их исправления, и поддерживает ли процесс проверки, соответствующий серьезности последствий возможных неточностей в стенограмме.
Часто задаваемые вопросы
Что такое «галлюцинации ИИ» при транскрипции?
Галлюцинация ИИ при транскрипции возникает, когда система преобразования речи в текст генерирует слово, фразу или предложение, не имеющее смыслового обоснования в исходной записи. В отличие от обычной замены, галлюцинация может вводить совершенно новое содержание. В одном из исследований, в котором были проанализированы 13 140 коротких аудиофрагментов, исследователи выявили 187 галлюцинаций и классифицировали 38% из них как содержащие явные вредные элементы, такие как язык насилия, неточные ассоциации, вымышленная информация или ложное авторитетное утверждение.
Почему Whisper AI иногда придумывает слова или фразы?
Whisper — это трансформер типа «кодер-декодер», который генерирует текстовые токены на основе аудиосигнала. Когда акустическая информация недостаточна — например, во время тишины, длительных пауз, при наличии фонового шума, музыки или прерывистой речи — декодер иногда может генерировать беглый текст, который не в полной мере соответствует записи. На результат также могут влиять данные обучения, сегментация, подсказки, версия модели и настройки декодирования.
Как можно уменьшить количество ошибок в транскриптах, сгенерированных ИИ?
При необходимости используйте функцию обнаружения голосовой активности (Voice Activity Detection) или другие методы фильтрации неречевых сигналов, проверьте настройки сегментации и декодирования на репрезентативных записях, отметьте подозрительные повторения или текст, появляющийся во время пауз, обработайте исходный аудиофайл с помощью алгоритма retain и обеспечьте проверку контента, имеющего серьезные последствия, специалистом. Меры по снижению рисков могут уменьшить риск, однако ни один метод предварительной обработки не гарантирует безошибочную транскрипцию.
Более ли бесплатные инструменты транскрипции на основе ИИ склонны к «галлюцинациям»?
Не обязательно. Риск возникновения искажений не определяется исключительно ценой. Он зависит от модели, архитектуры, реализации, условий звукозаписи и мер контроля качества, связанных с системой. Платформы Paid могут обеспечивать более качественные функции проверки, безопасности, совместной работы и аудита, однако пользователям следует самостоятельно оценивать эти возможности, а не исходить из того, что цена гарантирует точность.
Решает ли Sonix проблему «галлюцинаций» при транскрипции с помощью ИИ?
Sonix предоставляет браузерный редактор, синхронизированный с исходной записью, с возможностью навигации на уровне отдельных слов, инструментами для работы с говорящими, пользовательскими словарями и средствами управления совместной проверкой. Эти функции помогают пользователям выявлять и исправлять ошибки в транскрипции. Их следует рассматривать как меры обеспечения достоверности, а не как доказательство того, что автоматическая транскрипция не может давать ложных результатов, особенно в тех случаях, когда содержание влияет на принятие решений в сфере здравоохранения, права, научных исследований или других областях, где ставки высоки.
Получите точную транскрипцию за считанные минуты
Начните транскрибировать умнее. Попробуйте Sonix бесплатно или изучите наши цены, чтобы подобрать подходящий тарифный план.