随着AI语音技术的发展和在产业内的不断渗透,声纹识别的市场占比也逐年上升,但目前声纹识别需要解决的关键问题还有很多。包含声纹识别技术容易遭受录音重放、语音合成、语音生成、语音转换等技术的攻击,导致识别系统将非真实说话人的语音判断为说话人的语音,从而导致应用系统被非法入侵,而带来无法预期的损失。与之对应的语音鉴伪技术已受到国内外众多机构的密切关注。
2022年1月12日,由国家工业信息安全发展研究中心为指导,中国语音产业联盟、国家语音及图像识别产品质量检验检测中心主办,声纹圈、语音之家承办的中国语音产业联盟•2022年系列线上活动——语音鉴伪主题沙龙成功举办,直播间吸引了850多人观看。
本期沙龙由国家工业信息安全发展研究中心、人工智能所、检验检测中心主任李美桃老师主持。邀请了AI语音技术领域的专家学者,结合自身多年研究,与观众共同探讨语音鉴伪技术创新,分享语音鉴伪技术应用实践成果,为行业发展带来了诸多思考和见解。
下面让我们一起来回顾技术分享中的精彩细节。
洪青阳老师首先介绍了说话人分割聚类(说话人日志)竞赛和数据集等相关内容,探讨了模块化的说话人表征架构和端到端架构,并对聚类算法做了汇总梳理。然后,在第二部分阐述了基于Subtools的前沿研究,包括xi-vector、快慢语速对抗学习及Subtools的Runtime实现。最后,洪老师描述了在线电话声纹识别、声纹唤醒、家庭成员识别等声纹识别的一些落地应用。
昆山杜克大学电子与计算机工程副教授
《面向复杂场景的高可靠性声纹识别及其关联任务研究》
李明老师从特征提取、建立模型、鲁棒性处理、分类器设计等多方面技术介绍传统声纹实现方法,引申出基于端到端的深度学习的声纹识别网络设计,结合ASVspoof 2021录音回放检测任务,详细介绍了基于声码器重建信号差分的信道特征提取与建模方法,并分别在WORLD、MelGAN、HifiGAN三种声码器进行对比实验,得到真实语音和录音的分布差异符合预期的结果,据此设计了GMM和VAE两种后端分类器。
博士,清华大学语音语言中心博士后、助理研究员
《录音重放攻击检测》
李蓝天老师概述了语音鉴伪、录音重放等基本概念,解释了针对真实语音和重放语音的数据分布有何不同、不同因子在两类语音上有哪些特性、如何设计鲁棒泛化的特征与模型实现高效检测三个研究问题。
基于PRAD数据集进行统计分析并得到结论:1、重放语音模型区分性差、泛化性弱,其作用适得其反。2、二类模型存在严重的过拟合问题,神经网络模型尤为明显;3、学到的并非二类语音的本质差异,而是人为数据设计的偏差。
同时,李老师也提供了对应的解决思路,如:单分类模型替代二分类模型、结合声纹确认任务、引入设备限制条件等,并结合具体的方案,得出相比于二分类模型,单分类模型表现出极强的准确率和稳定性,单分类模型具有巨大的发展潜力的结论。
博士,教授,博士生导师
总结点评
郑方老师在会议总结点评中表示:自央行发布声纹识别安全应用技术标准后,声纹识别的应用及研究备受业界关注,但声纹识别在应用和研究上存在很大的差异,主要在于两方面:一方面是说话人识别属于开集问题,语音识别属于闭集问题,当闭集到开集变化的时候,它们性能的差异是非常大的;另一方面在于我们所用的环境与相关设备,在设备未知的情况下,也存在很大差异。所以在很多时候测试测评和应用的结果差距很大。
今天洪青阳老师分享了噪音远场、短语音、领域不匹配等问题,李明老师分享了复杂场景的高可靠性的声纹识别问题,李蓝天老师分享了从应用方面的需求出发去如何解决鉴别伪造的问题。这些都可以解决我们实际中遇到的问题。
声纹识别研究面临着鲁棒性要求的挑战,这和张钹院士提到的第三代人工智能有一定的关系。我们现在做的很多模型和识别,更多是从数据出发,通过Kaldi、ASV-Subtools等开源工具利用数据建立模型,这个数据在某种意义上来讲属于闭集问题,在闭集的数据里面,在理论上能达到很好的效果,但在实际中还存在很多差异。这就需要解决我们如何利用知识的问题,所以李蓝天老师分享的音频鉴伪中提到的把知识和数据驱动相结合,就可以解决第三代人工智能所要做的解决可解释性和鲁棒性问题,进而推动声纹识别应用落地。
至此,中国语音产业联盟•2022年系列线上活动——语音鉴伪主题沙龙圆满结束。接下来,语音之家还将持续为大家带来干货满满的技术分享,帮助大家收获知识与惊喜,结识志同道合的伙伴。
