语音克隆在科技界并不是什么新鲜事,但 VALL-E 2 却将这一技术提升到了前所未有的水平。以前版本的文本转语音生成器经常在自然度和恐怖谷效应方面遇到困难——生成的声音听起来很像人类,但又不完全像人类。VALL-E 2 显然已经克服了这一难题。利用“重复感知采样”和“分组代码建模”,人工智能可以确保将文本无缝转换为流畅、自然的语音,即使是复杂的句子也能产生高质量的输出。研究人员不遗余力地对 VALL-E 2 进行了测试。使用 LibriSpeech 和 VCTK 等庞大的数据集,VALL-E 2 在语音稳健性、自然度和说话人相似度方面超越了之前的 TTS 系统。简而言之,这款AI能够处理更具动态性和多样性的语音任务,达到了以前无法实现的精湛水平。它不仅可以产生类似人类的语音输出,还可以保留原始说话人独特的声音特征,这是实现与人类同等水平的标志。尽管取得了这些成就,但这样一款强大工具的潜在滥用问题让微软踩了刹车。近年来,人工智能的伦理和深度伪造技术的危险性一直是热门话题。深度伪造视频和音频可以令人信服地冒充真实的人,为身份盗窃、散布虚假信息和侵犯隐私创造了潜在的严重滥用风险。研究人员明确表示,VALL-E 2目前纯粹是一个研究项目,没有立即向公众发布的计划。他们在博客文章中解释说:“它可能存在滥用模型的潜在风险,例如欺骗声音识别或冒充特定说话者。”
但人们的担忧不仅仅是技术层面的。回想一个警示故事:Photoshop 的推出从根本上改变了我们与图像交互的方式,导致人们对照片的真实性普遍担忧。同样,在没有足够保障措施的情况下发布 VALL-E 2 可能会打开潘多拉魔盒。想象一个世界,听到你的朋友或最喜欢的名人说了什么并不一定意味着他们曾经说过。现实与技术之间的界限可能会变得模糊,从而带来新的社会挑战。此外,其他科技公司也在创新与谨慎之间摇摆不定。作为人工智能领域的主要参与者, OpenAI 也采取了严格的措施来遏制其语音技术的潜在滥用。他们尚未广泛推广其先进的系统,理由与微软对 VALL-E 2 的立场一致。尽管目前的气氛谨慎,但语音克隆人工智能的蓬勃发展表明了人类对创造能够复制人类能力的机器的好奇心和追求。今天,VALL-E 2 能够发出与人类几乎完全相同的声音。明天,人工智能可能会模仿我们的情绪、个性等,进一步缩小人机交互之间的差距。目前,世界在等待中。对这项技术能做什么和将会做什么既着迷又警惕。微软的 VALL-E 2 仍在实验室中,这是人类智慧的证明,同时也体现了人类愿意直面道德问题的决心。在我们前进的过程中,必须考虑这些技术对我们生活的更广泛影响,并确保创新不会以牺牲我们的价值观和道德为代价,这至关重要。信息源于:evrimagaci