微软的 VALL-E 2 可以完美模仿人类声音,但道德问题推迟了其发布。

得益于微软在人工智能领域的进步,人类和机器声音之间的界限已变得模糊不清。人工智能工具 VALL-E 2是一款能够以惊人精度克隆人类声音的AI工具。然而,这项突破性技术也带来了警示。
可能性似乎是无限的。想象一下,只需几秒钟的音频片段就能重现任何人的声音。VALL-E 2 正是能做到这一点的AI。微软研究人员声称,他们的创造可以产生如此逼真和自然的声音模仿,以至于与原始说话者的声音无法区分。
研究人员在论文中指出:“VALL-E 2 是神经编解码器语言模型的最新进展,标志着零样本文本到语音合成 (TTS) 的里程碑,首次实现了与人类相当的水平。”尽管技术取得了惊人的飞跃,但公众短期内不会体验到它。由于伦理问题,微软决定暂不将VALL-E 2公之于众。
语音克隆在科技界并不是什么新鲜事,但 VALL-E 2 却将这一技术提升到了前所未有的水平。
以前版本的文本转语音生成器经常在自然度和恐怖谷效应方面遇到困难——生成的声音听起来很像人类,但又不完全像人类。VALL-E 2 显然已经克服了这一难题。利用“重复感知采样”和“分组代码建模”,人工智能可以确保将文本无缝转换为流畅、自然的语音,即使是复杂的句子也能产生高质量的输出。
研究人员不遗余力地对 VALL-E 2 进行了测试。使用 LibriSpeech 和 VCTK 等庞大的数据集,VALL-E 2 在语音稳健性、自然度和说话人相似度方面超越了之前的 TTS 系统。
简而言之,这款AI能够处理更具动态性和多样性的语音任务,达到了以前无法实现的精湛水平。它不仅可以产生类似人类的语音输出,还可以保留原始说话人独特的声音特征,这是实现与人类同等水平的标志。
尽管取得了这些成就,但这样一款强大工具的潜在滥用问题让微软踩了刹车。
近年来,人工智能的伦理和深度伪造技术的危险性一直是热门话题。深度伪造视频和音频可以令人信服地冒充真实的人,为身份盗窃、散布虚假信息和侵犯隐私创造了潜在的严重滥用风险。
研究人员明确表示,VALL-E 2目前纯粹是一个研究项目,没有立即向公众发布的计划。他们在博客文章中解释说:“它可能存在滥用模型的潜在风险,例如欺骗声音识别或冒充特定说话者。”
尽管如此,AI语音技术的未来并非完全黯淡。VALL-E 2背后的团队设想了可以彻底改变各个行业应用的应用场景。
从教育辅助工具、个性化娱乐到改善残疾人的无障碍功能,AI驱动的语音合成充满希望。研究人员建议,如果模型推广到现实世界中未见过的说话者,应该包括一个协议,确保说话者批准使用他们的声音,并包括一个合成语音检测模型,以希望减轻潜在的伦理问题。
但人们的担忧不仅仅是技术层面的。回想一个警示故事:Photoshop 的推出从根本上改变了我们与图像交互的方式,导致人们对照片的真实性普遍担忧。同样,在没有足够保障措施的情况下发布 VALL-E 2 可能会打开潘多拉魔盒。想象一个世界,听到你的朋友或最喜欢的名人说了什么并不一定意味着他们曾经说过。现实与技术之间的界限可能会变得模糊,从而带来新的社会挑战。
此外,其他科技公司也在创新与谨慎之间摇摆不定。作为人工智能领域的主要参与者, OpenAI 也采取了严格的措施来遏制其语音技术的潜在滥用。他们尚未广泛推广其先进的系统,理由与微软对 VALL-E 2 的立场一致。
尽管目前的气氛谨慎,但语音克隆人工智能的蓬勃发展表明了人类对创造能够复制人类能力的机器的好奇心和追求。
今天,VALL-E 2 能够发出与人类几乎完全相同的声音。明天,人工智能可能会模仿我们的情绪、个性等,进一步缩小人机交互之间的差距。
目前,世界在等待中。
对这项技术能做什么和将会做什么既着迷又警惕。微软的 VALL-E 2 仍在实验室中,这是人类智慧的证明,同时也体现了人类愿意直面道德问题的决心。
在我们前进的过程中,必须考虑这些技术对我们生活的更广泛影响,并确保创新不会以牺牲我们的价值观和道德为代价,这至关重要。
信息源于:evrimagaci