教育

Whisper 会产生幻觉式转录吗?为什么 AI 转录会编造内容

作者:LoudSpeaker Marketing 13 分钟阅读
在本文中

你刚刚转录了一段危重病人的会诊记录、法律证词,或是长达数小时的研究访谈——却发现人工智能转录工具插入了从未被说出的词语、短语甚至整句话。这是一种有据可查的failure模式,被称为“转录幻觉”,如果在未经核实的情况下直接使用转录文本,可能会引发严重问题。.

在2024年的一项针对13,140段短篇英语音频片段的研究中,研究人员在其中识别出了幻听短语或句子, 1.4% 在该研究的测试条件下处理的音频片段中。该比率不应被视为放之四海皆准:结果可能会因模型版本、音频、语言、说话人群、分段和解码设置的不同而存在显著差异。不过,该研究说明了为何依赖 自动转录 对于高风险的工作,需要可靠的审核流程,并能访问原始录音。.

其影响远不止于普通的转录错误。研究人员发现了一些涉及暴力言论、不准确的种族关联、捏造的个人信息以及子虚乌有的医疗治疗方法的案例。.

主要收获

  • 在一项研究中,Whisper生成了幻觉短语或句子,这些内容出现在 1.4%,共计13,140 已测试的短音频片段
  • 研究人员将已识别的38%种幻觉归类为包含明确危害的类型,包括暴力言语、不准确的联想、虚构的个人信息或虚假权威。
  • 后续对比研究发现,在测试的187个样本中,另外五家语音转文本服务并未生成类似的“幻觉”内容,尽管这一结果并不能证明这些服务绝不会产生“幻觉”
  • 沉默、长时间的停顿、背景声音以及其他非言语间隔,通常与“耳语”幻觉相关
  • 在研究数据集中,与对照组音段相比,失语症患者发音的音段中幻听现象出现得更频繁,这涉及rai的可及性及fai的自然度问题。
  • 语音活动检测和其他非语音过滤方法可以在某些 Whisper 工作流中减少幻听现象,但其有效性取决于模型、音频和配置
  • 在重要记录的转录稿经审核批准之前,原始录音应保持可访问状态
  • 不应认为任何自动转录系统都是零错误的,特别是在医疗、法律、就业或研究领域。

了解人工智能转录:语音如何转化为文本

现代人工智能转录技术依赖于基于大型音频数据集训练的神经网络,将口语转换为书面文本。该技术通过将录音转换为可搜索的文本,其速度远快于人工转录,从而彻底改变了专业人士处理音频内容的方式。.

不同的系统采用不同的架构,但该过程通常包括以下几个阶段:

  • 音频处理: 原始音频被转换为频谱图等形式
  • 语音识别: 模型会识别音频中的模式,并将它们映射到文本令牌上
  • 序列解码: 系统会根据音频以及训练期间学到的模式,选择一个可能的词序
  • 后处理: 可能会添加标点符号、时间戳、发言者标签和格式设置

这些系统在音质清晰的语音上表现良好,但识别准确率取决于录音质量、口音、交谈重叠、专业术语、背景噪音,以及语音与模型训练数据的相似程度。.

转录中的AI幻觉是什么?

转录中的AI“幻觉”是指语音转文本系统生成的文本在源音频中没有任何实质依据的情况。这与普通的替换(例如将“cat”转录为“hat”)不同。“幻觉”可能会引入一个从未被说出的完整短语或句子。.

研究人员在分析了13,140段音频片段后,共识别出187起幻觉。他们将其中38%段幻觉内容归类为包含明确伤害的内容,包括:

  • 暴力语言: 在原本无害的言论中夹带暴力言论
  • 不准确的关联: 添加说话者从未提及的特征,例如种族等
  • 医疗造假: 编造不存在的疗法或药物名称
  • 虚假权威: 添加类似引语、图注或权威性陈述的措辞

这些例子令人担忧,因为伪造的文本可能显得行云流水且可信度高,如果不将文字记录与原始音频进行对比,就很难察觉其中的破绽。.

2025年另一项研究故意向Whisper输入非语音声音,以考察该模型在没有语音输入的情况下何时会生成文本。研究人员观察到“谢谢”和“感谢观看”等反复出现的短语。 他们认为,这些模式可能反映了模型训练期间所使用的网络媒体中的常见语言。由于实验侧重于非语音文件,因此其百分比不应被解读为普通对话或访谈中预期的幻觉率。.

为什么Whisper等AI转录模型会出现“幻听”现象

OpenAI 将 Whisper 描述为一种编码器-解码器式 Transformer。音频会被转换为对数梅尔频谱图,并由音频编码器进行处理,而解码器则生成相应的文本令牌。.

由于该模型是按顺序生成文本的,因此有时会产生行云流水的输出,但这些输出与音频输入之间的关联性不足。研究人员和开发人员观察到,这种现象在以下情况中尤为常见:

  • 沉默与漫长的停顿: 较长的无声间隔可能会导致解码器获得的声学证据较弱
  • 非语音音频: 音乐、背景声音和环境噪音有时会触发文本生成
  • 录音质量差: 失真、音量过低、削波或强烈的背景噪声会使语音信号更难理解
  • 言语不流畅: 口吃、语塞、语无伦次以及长时间停顿都会增加识别难度
  • 分段和解码设置: 块长度、阈值、提示词以及其他实现选项都会影响输出结果

OpenAI 报告称,最初的 Whisper 系统是在利用从网络上收集的 68 万小时多语言、多任务监督式音频数据进行训练的基础上开发的。 这一广泛的数据集有助于提升模型的灵活性,但源自网络的训练素材也可能使系统暴露于重复的字幕和视频语言模式之中。.

研究人员尚未确定导致所有幻觉的单一原因。现有证据表明,幻觉源于音频条件、模型架构、训练数据以及解码策略之间的相互作用。.

幻觉对转录准确性的影响

对于医疗保健、法律服务、研究和媒体领域的专业人士而言,一个杜撰的短语可能比普通的拼写错误更具影响。.

对健康的影响

2024年10月,美联社报道称,Nabla的基于Whisper的临床文档产品已被40个医疗体系中的超过3万名临床医生采用。Nabla还表示,该产品已处理了约700万次就诊记录。.

美联社报道称,出于数据安全考虑,Nabla在处理后删除了原始音频。Nabla said项目的临床医生必须审核并批准生成的记录。这一案例凸显了一个重要的矛盾:删除录音虽然可以降低某些数据保留风险,但也可能导致无法在后期与原始对话进行比对。.

OpenAI 已警告称,在决策场景中依赖语音识别结果可能导致严重后果。因此,医疗机构应要求临床医生进行审核,制定明确的数据保留和验证政策,并使用具备适当隐私和合同保障措施的服务。.

在法律工作中,伪造的笔录内容可能会影响证人陈述的准备、案件分析或证据审查。未经相关法院、司法管辖区或职业规则要求的审查和认证,不应将自动生成的草稿视为正式记录。.

研究团队面临着一个相关风险。如果虚构的引语被纳入定性编码或主题分析中,可能会影响研究结果,并损害研究的可靠性。研究人员应保留原始录音,记录转录过程,并核实报告或出版物中使用的引语。.

这项由康奈尔大学主导的研究还发现,其失语症数据集与对照组数据集之间存在差异。幻觉出现在 1.7% 个区段 来自失语症患者的语音片段以及1.2%个对照语音片段。 研究人员将这一差异归因于非发声时段的持续时间更长。这虽不能证明每位言语障碍者都会出现同样的差异,但它突显了在关键场景中使用自动转录功能的组织所面临的无障碍性和准确性问题。.

减少AI转录“幻觉”的最佳实践

没有任何一种缓解措施能保证生成完美的转录文本。不过,采取一些措施可以降低风险,并使错误更容易被发现。.

技术缓解措施

  • 语音活动检测预处理: 在转录前移除或分离非语音间隔,可以减少模型在静默期间生成文本的可能性
  • 细致的细分: 应根据所选模型将音频划分为适当的片段进行处理,而不是应用任意的时长规则
  • 保守的解码设置: 查阅特定 Whisper 实现的文档,并使用 against 代表性音频进行测试
  • 重复项和异常检查: 标记重复的短语、话题的突然转换、视频风格的结尾语,或是在静默间隙中异常流畅的文本
  • 受版本控制的评估: 在更改模型、语言设置、提示词、预处理或解码库时,请重新测试工作流

2025年的一项研究还测试了一种名为“幻觉袋”(bag of hallucinations)的后处理方法,该方法能够过滤非语音实验中产生的重复输出。该方法在这些受控条件下降低了错误率,但不应将其视为审查源音频的通用替代方案。.

工作流最佳实践

  • Maintain 源音频: 在核实笔录之前,应保留录音文件,但须符合相关同意、隐私、保存期限及法律要求
  • 实施人工审核: 在涉及重大后果的病历记录影响医疗护理、法律裁决、招聘、研究结果或论文发表之前,须经审核
  • 优先处理高风险段落: 复习部分:连续的数字、药物名称、人名、日期、引文、法律术语或长时间的停顿
  • Train 团队关注警示标志: 注意重复出现的短语、出人意料的内容、风格的突变,或者在沉默中出现的词语
  • 文件责任: 明确规定谁必须审核、批准、更正和retain每份成绩单

如何选择可靠的人工智能转录软件

这项由康奈尔大学主导的研究表明,其所识别出的“幻听”现象并非在所有语音转文本服务中都能一致地重现。 当研究人员使用谷歌云语音转文本、微软Azure语音转文本、亚马逊Transcribe、AssemblyAI和Rev AI对187个“Whisper”幻觉样本进行测试时,这些系统在该实验中并未产生类似的幻觉内容。.

这是一个有用的发现,但并不能证明任何服务都不会产生幻觉。该比较仅限于特定的样本、服务版本和配置。.

在评估时 转录软件, 请考虑:

  • 源音频访问: 审稿人能否一边播放录音,一边对照文字记录?
  • 审查效率: 词条是否与时间戳相关联,以便快速核验?
  • 演讲者工具: 用户能否识别并更正发言者标签?
  • 术语控制: 团队可以添加名称、首字母缩写词和技术术语吗?
  • 安全文档: 服务提供商是否对加密、访问控制、审计、数据位置和保留期限进行了明确的记录?
  • 合同适用性: 对于受监管或机密数据,是否可制定相应的协议?
  • 导出和审核选项: 团队能否保存修改后的版本并记录审批情况?
  • 代表性测试: 该服务是否已在该组织的实际语言、口音、麦克风和环境中进行了测试?

仅凭价格并不能决定一个系统是否会出现失真。架构、实现方式、音质、评测功能以及操作控制都至关重要。.

利用高级功能提升转录质量

转录模型的相关功能可以使错误更容易被识别和纠正。.

编辑和审阅工具

  • 词级时间码: 将文字记录与录音中的相应时刻关联起来
  • 同步播放: 让审稿人在阅读或编辑时能够同步收听
  • 发言人身份: 将扬声器分开,并允许更正标签
  • 浏览器内编辑: 启用校对功能,而无需将内容移至另一个应用程序中
  • 自定义词典: 允许用户添加专有名词、技术术语、首字母缩写词以及首选拼写方式

分析与见解

人工智能分析工具 可以从转录文本中提取主题、摘要、章节、议题、情感倾向或关键时刻。这些输出结果取决于底层转录文本的质量。各团队在依赖下游分析之前,应先更正重要的转录错误,特别是在分析结果用于支持研究、报告或商业决策时。.

协作功能

共享工作区、权限设置、评论功能和审阅工作流有助于团队明确责任归属,避免版本混淆。当组织同时明确由谁负责审批最终文本时,这些协作功能才能发挥最大价值。.

针对敏感数据的安全且符合合规要求的人工智能转录服务

安全与合规不仅仅需要一个认证标志。组织应评估服务、所选方案、合同条款、配置以及预期用途。.

英格兰国民医疗服务体系(NHS England)的环境语音供应商注册流程要求参与的供应商提供一类医疗器械资格证明以及最新的《数字技术评估标准》评估报告。这表明对临床文档工具的审查日益严格,但不应将其解读为一项适用于所有NHS环境下所有转录产品的通用规则。.

需要审查的安全功能包括:

  • 独立控制审计,例如 SOC 2 II 类
  • 传输中和静止状态下的加密
  • 基于角色的访问控制
  • 多因素身份验证和企业身份验证方案
  • 数据存储位置和保留信息
  • 删除和出口管制
  • 必要时签订业务合作伙伴协议或其他适当的合同保障措施

组织应核实每项认证的确切范围,并确定其是否适用于其计划部署的服务、方案和用例。.

Sonix 为何支持可验证的 AI 转录工作流

对于需要高效审核和管理成绩单的团队来说,, Sonix 该功能将自动转录与用于根据原始录音核对结果的工具相结合。.

Sonix 当前的功能包括:

  • 一款基于浏览器的编辑器,支持同步播放、搜索、单词级导航和发言者标注
  • 自定义词典,允许用户添加人名、技术术语、首字母缩写词以及首选拼写方式
  • SOC 2 II 类认证、传输过程中的 TLS 加密以及静止状态下的 AES-256 加密
  • 通过 Medical Sonix 实施符合 HIPAA 要求的保障措施,包括为符合条件的医疗机构提供业务伙伴协议
  • 支持54种以上语言的转写功能
  • 人工智能驱动的分析 用于摘要、章节、主题、情感分析以及其他基于文字记录的洞察
  • 团队协作控制功能,包括工作区、权限和共享功能

这些控制功能有助于用户发现并更正错误,但并不能取代人工审核。未经核实,不应认为任何自动生成的文字记录都能完美地反映每一句口头表达。.

无论您是 调研公司 分析访谈,a 新闻中心 在against的截止日期内工作,或者一个 企业 对于需要处理大量录音的团队而言,最稳妥的工作流程是确保文字记录与原始音频保持关联,并明确审批责任。.

最终结论:根据您的需求选择合适的转录解决方案

是选择自主管理的Whisper工作流还是托管式转录平台,取决于技术资源、数据要求、审核需求以及风险承受能力。.

在以下情况下,采用自主管理的Whisper工作流可能是合适的选择:

  • 该内容风险较低,偶尔出现错误是可以接受的
  • 该组织可以测试模型版本、预处理、分割和解码设置
  • 技术人员可以实施监控和缓解措施
  • 源录音 remain available,供核验使用
  • 重要产出在使用前须由合格人员进行审核

当您有以下需求时,托管式转录平台可能是更佳的选择:

  • 一款用于将文本与源音频进行对比的同步编辑器
  • 说话者、时间戳、术语和校对工具
  • 共享工作区和权限
  • 已记录的安全和隐私控制措施
  • 支持多种语言和导出格式
  • 一种让非技术背景的审阅人员能够高效审批文字记录的工作流程

对于医疗、法律、科研、新闻及其他后果重大的领域而言,关键问题并不在于供应商是否承诺实现完美准确率,而在于该系统能否使错误显而易见、保留纠正错误所需的证据,并支持与转录错误可能造成的后果相适应的复核流程。.

常见问题

转录中的AI幻觉是什么?

转录中的AI幻觉是指语音转文本系统生成的某个词、短语或句子在源录音中没有任何实质依据的情况。与普通的替换不同,幻觉可能会引入完全新的内容。 在一项针对13,140段短音频片段的研究中,研究人员识别出187处幻觉,并将其中38%归类为包含明确危害的内容,例如暴力语言、不准确的关联、虚构信息或虚假权威。.

为什么Whisper AI有时会编造单词或短语?

Whisper 是一个基于音频生成文本令牌的编码器-解码器 Transformer 模型。 当声学证据较弱时——例如在静默、长时间停顿、背景噪音、音乐或断续语音期间——解码器有时会生成流畅的文本,但这些文本可能与录音内容不够契合。训练数据、分段、提示词、模型版本以及解码设置也可能影响结果。.

如何减少AI生成的转录文本中的幻觉?

在适当情况下使用语音活动检测或其他非语音过滤技术,在具有代表性的录音上测试分段和解码设置,标记可疑的重复内容或在静默期间出现的文本,对原始音频进行retain处理,并要求对可能产生重大影响的内容进行人工审核。风险缓解措施可以降低风险,但没有任何预处理方法能保证转录结果完全无误。.

免费的AI转录工具是否更容易出现“幻觉”?

未必如此。产生幻听的风险并非仅由价格决定,它还取决于系统的型号、架构、实现方式、音频环境以及相关质量控制措施。Paid 平台或许能提供更出色的审查、安全、协作和审计功能,但用户应直接评估这些功能,而非认为价格就能保证准确性。.

Sonix 是否解决了 AI 转录中的“幻觉”问题?

Sonix 提供了一个与源录音同步的基于浏览器的编辑器,支持单词级导航、发言人工具、自定义词典以及协作审阅控制功能。 这些功能有助于用户识别并更正转录错误。应将它们视为验证保障措施,而非证明自动转录结果不会出现“幻觉”的依据,特别是在内容将影响医疗保健、法律、研究或其他高风险决策的情况下。.

在几分钟内获得准确的转录

开始更智能的转录。免费试用 Sonix 或了解我们的定价,找到适合您的计划。