康奈尔大学的研究人员发现,说话时如果有点断断续续或者停顿时间太长,语音转文本的转录器可能会把有害的、暴力的话语放到你的嘴里。

研究人员表示,OpenAI的Whisper(一种人工智能语音识别系统)偶尔会编造或“幻化”整个短语和句子,有时会让人联想到暴力语言、虚构的个人信息和虚假网站,这些都可能被用于网络钓鱼。研究人员发现,与其他广泛使用的语音转文本工具不同,Whisper在分析单词间停顿较长的人(例如有语言障碍的人)的语音时更容易产生幻觉。
康奈尔大学安·S·鲍尔斯计算机与信息科学学院信息科学助理教授Allison Koenecke表示:“通过幻觉,人工智能可以凭空捏造一些东西。”“如果这些转录内容用于基于人工智能的招聘、法庭审判或医疗环境中的患者笔记,可能会导致巨大的后续后果。”
OpenAI的Whisper于2022年发布,经过了68万小时音频数据的训练,据OpenAI称,它可以以接近人类水平的准确度转录音频数据。Koenecke表示,自研究人员去年开展这项工作以来,OpenAI改进了Whisper背后的模型,幻觉率有所下降。
研究人员在分析中发现,大约1%的Whisper音频转录包含完整的幻觉短语,包括对真实和虚假网站的引用,这些短语可能会被用于网络攻击。例如,在一个声音片段中,Whisper正确地转录了一个简单的句子,但随后又幻觉出了另外五个句子,其中包含单词“恐怖”、“刀”和“杀戮”,而这些单词在原始音频中都没有。
在其他幻觉转录的例子中,Whisper会变出随机的名字、地址片段和不相关的网站(有时甚至是完全虚假的)。YouTuber行话的幻觉痕迹,如“感谢收看和Electric Unicorn”,也潜入转录中。
研究人员将超过13,000个语音片段放入Whisper。音频数据来自AphasiaBank,这是一个专门用于研究的失语症患者音频记录库。失语症是一种限制或完全损害说话能力的疾病。该库还包括没有言语障碍的人的片段。根据他们的分析,研究人员推测,单词之间较长的停顿和沉默更有可能引发有害的幻觉。
Koenecke表示:“看起来底层的大型语言模型技术正在将沉默作为某种词语来表达”,并补充说,Whisper在分析了一份无声音频文件后产生了幻觉,说出了“谢谢”。
Koenecke警告说,即使是一小部分有害幻觉也可能造成真正的伤害。
她说:“平均而言,你的转录结果会很棒,但在边缘上,对于其中很小一部分,你可能会遭受巨大的潜在危害。”
Koenecke表示,使用来自不同说话者的音频数据来训练Whisper底层的大型语言模型 (LLM) 是一个好的开始,但更好的解决方案是让OpenAI调整其模型,以适应人们不同的说话方式,特别是那些有言语障碍的人。
“问题不在于数据量,而在于实际使用的建模选择,”Koenecke说。“我们希望能做更多的事情来改善这些幻觉,特别是对于那些说话时非发声时间较长的人。”


原文链接:
https://news.cornell.edu/stories/2024/06/ai-speech-text-can-hallucinate-violent-language