文章来源于音频语音与语言处理研究组,作者张丽

说话人识别技术是根据语音辨别说话人身份的技术。随着深度学习技术的应用,说话人识别的性能取得了巨大的提升。然而说话人识别系统也面临着各种仿冒欺骗(spoofing)的威胁,如何构建具有欺骗感知能力的说话人识别系统成为研究热点。

本文介绍西工大音频语音与语言处理研究组提交到2022年欺骗感知说话人验证挑战赛(Spoofing Aware Speaker Verification Challenge 2022,SASV) [1] 的系统描述。主要从三个方面研究了说话人确认系统与反欺骗对策系统的后端融合。首先,除了简单的说话人表征与反欺骗对抗表征的拼接之外,我们提出了用于说话人表征和反欺骗对抗表征的循环矩阵变换和堆叠。其次,我们尝试使用不同的卷积神经网络选择性地将说话人表征和反欺骗对抗表征的显著区域融合到卷积核的通道中。最后,我们在一维卷积神经网络中设计并行注意力机制,以学习通道维度的全局相关性以及特征维度的重要部分。同时,我们在二维卷积神经网络中嵌入了squeeze-and-excitation(SE)注意力[2],以学习说话人表征和反欺骗对抗表征之间的全局依赖性。实验验证了上述方法的有效性。通过上述方法增强的四个的模型进行融合后,我们在比赛评估集上实现的最佳 SASV-EER、SPF-EER 和 SV-EER 分别为 0.559%、0.354% 和 0.857%。基于上述贡献,我们的提交系统在本次挑战赛中获得了第五名。



论文题目:Backend Ensemble for Speaker Verification and Spoofing Countermeasure
作者列表:张丽, 李越, 赵欢, 王晴, 谢磊
论文原文:https://arxiv.org/abs/2207.01802


图1 发表论文截图


图2 扫码直接看论文


背景动机

随着深度神经网络的发展和开源数据的推广,说话人确认系统在低噪且没有域的不匹配的情况下能够达到很高的识别准确率。但是,该系统非常容易受到各种恶意的欺骗攻击,即攻击者可以通过对语音进行加工处理,欺骗攻击现有的说话人识别系统。其中攻击方式主要包括:逻辑攻击 (使用语音合成、语音转换和切片拼接等方式产生攻击语音) ,物理攻击 (使用真实场景语音录制或者模拟回放等方式产生攻击语音)和深度欺骗攻击(深度欺骗语音的产生和逻辑攻击语音产生方式基本相同,但是深度欺骗攻击语音的传输需要使用不同的音频编解码器处理音频数据的压缩-解压缩过程) [3]。由上述任意一种攻击方法产生的欺骗语音,如果拿来攻击现有说话人确认系统,都会给社会造成安全威胁。因此,很多学者开始探索如何对抗虚假语音攻击。目前已有的对抗攻击方案基本都是只考虑虚假语音的检测率,忽略了说话人确认系统的准确率。SASV就是基于此举办的一次欺骗感知说话人验证挑战赛 [1],该竞赛的宗旨是在让说话人模型能够感知到攻击语音同时保证说话人确认系统性能不下降。我们在此次竞赛中主要从三个方面研究了说话人确认系统与反欺骗对策系统的后端融合。首先,我们提出了用于说话人表征和反欺骗对抗表征的循环矩阵变换和堆叠,以此来替代简单的两个系统表征的拼接操作。其次,我们使用不同的卷积神经网络选择性地将说话人表征和反欺骗对抗表征的显著区域融合到卷积核的通道中。最后,我们在一维卷积神经网络中设计了并行注意力机制,以学习通道维度的全局相关性以及特征维度的重要部分。经过实验验证,对比竞赛给出的基线系统,我们提出的方法都有不同程度的提升。


方案介绍
方法概述:我们提出的后端融合(backend ensenble)系统如图3所示。它主要由三个模块组成:表征提取器(ECAPA-TDNN:说话人表征提取器;ASSIST: 反欺骗对抗表征提取器), 表征融合和集成模型。整个融合系统的监督信息是注册语音和测试语音是否属于同一说话人。我们的主要创新点在于探索不同的表征融合方案、集成模型架构以及注意力机制在集成模型中的应用。整个系统架构的目的在于通过集成模型模块从说话人确认系统(ECAPA-TDNN) [4] 和反欺骗对抗模型 (AASIST) [5] 中学习共享的的说话人和对抗攻击检测信息,从而实现欺骗感知的说话人验证系统。


图3 后端融合系统概述


在表征融合模块中,我们使用了直接拼接、循环矩阵变换和堆叠这三种表征融合方法。

在集成模型模块,我们除了将基线DNN加深之外,我们还引入了另外两个基于卷积神经网络 (CNN) 的后端框架,其架构如图4所示。首先,我们加深了基线模型DNN [1],但是随着模型的加深,系统性能会饱和。然后我们堆叠说话人和对抗欺骗表征,并使用 1D 卷积神经网络替换基线中的DNN网络。同时,我们在卷积块之后加入了并行注意机制,以学习通道维度的全局关系以及学习特征维度的重要区域。最后,我们提出了说话人和对抗欺骗表征进行循环矩阵变换并堆叠新定义的表征,然后将它们输入到具有squeeze-and-excitation (SE) 注意力的 2D卷积神经网络中。


图4 不同的后端集成模块:(a) 加深的基线模型 (DNN),(b) 具有并行注意力的 1D_CNN,(c) 具有循环矩阵变换和SE 注意力的2D_CNN


1D卷积注意力机制:在图4的(a)网络架构中,我们采用1D卷积来处理堆叠的说话人和对抗欺骗表征,旨在使用卷积核选择性地将不同的表征区域融合到卷积的通道中。然后,我们引入了一个并行注意力(PA) 模块来学习不同表征之间的全局交互,并关注特征维度中的重要区域,如图 5 所示。PA 模块分别沿着通道维度和特征维度学习注意力掩码。


图五 1D 卷积中的并行注意力(PA)


假设从一维卷积块生成的输入张量是 T,其中 B、C、F 分别是批量大小、通道维度和特征维度。我们将其拆分两条路径来同时计算通道和特征注意力。并行注意力在特征维度和通道维度上的平均池化计算为:


然后我们使用线性连接层来并行学习通道方面和特征方面的注意力,其式如下:


sigmoid的方程ρ将注意力权重进行的归一化。最后我们得到加权的矩阵T为:


2D卷积前的循环矩阵变换:为了进一步使用卷积核选择性地融合嵌入的显着区域,我们采用循环矩阵变换将说话人表征和对抗欺骗表征转换为循环矩阵。循环矩阵是一个方阵,其中所有行向量都由相同的元素组成,并且每个行向量相对于前一个行向量向右旋转一个元素 [6]。假设注册说话人表征、测试说话人表征和测试语音的对抗检测表征是 ei , ti 和 ci,循环矩阵变换公式如下:


随着循环矩阵的每一行移动一个元素,通过新定义的交互操作,我们几乎探索了不同嵌入之间所有可能的交互。之后我们将三个循环矩阵堆叠成一个张量,并将其输入2D卷积中。同时,我们在最后一个卷积层之后嵌入SE注意力机制,以学习不同表征之间的依赖关系。


实验验证
实验配置:本文所有实验都是在 ASVspoof 2019 数据库 [7] 中的逻辑攻击训练集、开发集和评估集上进行的。本文主要训练了八个模型:

  • Extend(512)_DNN 模型:网络模型是4层DNN,每层节点数是[512,256,128,64]。
  • Extend(1024)_DNN模型:网络模型是5层DNN,每层节点数是[1024,512,256,128,64]。
  • 1D_CNN模型:1D_CNN 模型由3 层 1D 卷积、1 层自适应平均池化和 3 层 DNN组成。3层一维卷积的通道和核分别是[256,128,64]和[3,3,3]。每个卷积层后面都有一个归一化层和一个 LeakReLU 激活层。3 层 DNN 的神经节点为 [512, 256, 64]。
  • 1D_CNN_SE模型:SE 注意力层嵌入在 1D_CNN 中的第三个卷积网络层之后。SE 注意力模块的内通道缩减比为8。该模型的其他配置与 1D_CNN 模型中的配置相同。
  • 1D_CNN_PA模型:并行注意力层嵌入在 1D_CNN 中的第三个卷积网络层之后。并行注意力的内通道缩减比为 8。该模型的其他配置与 1D_CNN 模型中的配置相同。
  • 2D_CNN模型:2D_CNN 模型由4 层 2D 卷积、1 层自适应平均池化和 3 层 DNN组成。通道和内核配置为 [32, 64, 128, 256] 和 [5, 3, 3, 3]。自适应平均池的配置是 [16, 16]。DNN中神经节点数是 [256, 128, 64]。
  • 2D_CNN_SE模型: SE 注意力层嵌入在第三个卷积网络层之后。该模型的其他配置与 2D_CNN 模型中的配置相同。
  • 2D_CNN_VSE模型: 除了SE注意力机制,我们还在 2D_CNN 模型中使用了 SE注意力机制的变体。变体 SE 注意(VSE)已被证明在说话人验证中是有效的。该模型的其他配置与 2D_CNN 模型中的配置相同。

    评价指标:经典的等错误率 (EER) [8] 被用作主要指标。具体来说,有三种 EER 指标,即 SASV-EER、SPF-EER 和 SV-EER [9]。SASV-EER 不区分不同的说话者(目标、非目标或冒名顶替者)访问测试和欺骗性访问测试。SPF-EER 是欺骗攻击者和目标说话者测试的指标。SV-EER 是没有欺骗攻击的传统说话人确认系统验证的指标。

    实验结果:表 1 中的实验结果是使用 ASVspoof 2019 训练集训练的模型。我们可以看到,Extend(512)_DNN模型的SASV-EER在评估集上与baseline2模型[6]相比绝对降低了1.529%。在我们堆叠说话人表征和对抗欺骗表征并将它们输入1D_CNN 模型后,评估集上的 SASVEER 大幅降低到 1.361%。性能的提高要归功于 SV-EER 的下降。但 1D_CNN 在评估集上的 SPF-EER 略有上升。当我们将 SE注意力机制嵌入到 1D_CNN 模型中时,SPF-EER 得到了更多的降低。同时,评估集的 SASV-EER 与 1D_CNN的结果相比降低了 0.244%。将 SE注意力机制替换为并行注意力机制(PA)后,评估集上的 SASV-EER 进一步降低了 0.093%。借助循环矩阵变换,2D_CNN 模型的 SASV-EER 在评估集上优于 1D_CNN 模型。在 2D_CNN 中加入SE注意力机制后,2D_CNN_SE 模型的 SASV-EER 在评估集上甚至达到了 0.998%,与表 1 中的其他模型相比,2D_CNN_SE 模型得到了最低的 SPF-EER 和 SV-EER。此外,当我们将VSE注意力嵌入到2D CNN模型中,评估集的SASV-EER比2D_CNN模型降低了0.134%。


    表1 SASV 2022 开发和评估集的 EER (%) 结果(使用训练集训练)


    为了进一步提高所提出系统的性能,我们添加了 ASVspoof 2019 开发集来训练表 1 中的上述模型。结果如表 2 所示。借助训练中的额外数据,Extend( 512) DNN 模型绝对下降 1.815%。此外,除Extend(512)_DNN模型外,所有模型的SASV-EER在评估集上均小于0.998%。同时,我们发现 SPF-EER 和 SV-EER 都有进一步的降低。论文中最好的单个模型是2D_CNN_VSE,用ASVspoof 2019的训练和开发集训练获得。最优模型的SASV-EER、SPF-EER和SV-EER分别为0.734%、0.416%和1.104 %。结果表明,所提出的表征融合方法、集成模型结构和注意力机制对说话人验证和欺骗对抗系统的后端集成有显著贡献。


    表 2:SASV 2022 开发和评估集的 EER (%) 结果(使用训练集和开发集训练)


    最后,我们将使用 ASVspoof 2019 训练和开发集训练的上述模型进行融合。我们采用两种融合方法,即 Bosaris 工具包 [31] 中的线性回归和分数平均。融合结果如表 3 所示。将表 2 中的 1D CNN 模型和基于 2D CNN 的模型的得分平均后,SASV-EER、SPF-EER 和 SV-EER 分别达到 0.559%、0.354% 和 0.857% 。我们注意到,与分数平均相比,线性回归的融合导致更差的结果。这可能是因为开发集用于训练模型,导致模型过度拟合开发集。同时,表 1 和表 2 在开发集上的实验结果表明,当我们添加开发集来训练模型时,模型对开发集过度拟合。


    表 3:SASV 2022 开发和评估集的 Fusion EER (%) 结果



    结论
    本文针对 SASV 2022挑战赛设计了一个具有欺骗感知的说话人验证系统。在这个挑战中,我们特别专注于从三个方面探索后端集成方案,分别是表征融合方法、不同的集成框架和注意力机制设计。具体来说,我们提出了用于表征融合的循环矩阵变换和堆叠操作。通过融合表征,我们进一步介绍了基于 CNN 的不同后端集成框架。最后,我们在基于 CNN 的框架中引入了并行注意力和 SE 注意力,以捕捉说话人表征和对抗表征之间的全局关系。使用所提出的方法,我们最好的单后端集成系统的 SASV EER 在评估集上达到 0.734%。连同上述贡献,本文对四个训练有素的模型的融合最终使我们在 SASV 挑战赛中获得第五名。


    参考文献
    [1] Jee-weon Jung, Hemlata Tak, Hye-jin Shim, et al. "SASV challenge 2022: A spoofing aware speaker verification challenge evaluation plan." arXiv preprint arXiv:2201.10283 (2022).
    [2] Jie Hu, Li Shen, Gang Sun. "Squeeze-and-excitation networks." Proceedings of the IEEE conference on computer vision and pattern recognition. 2018.
    [3] Junichi Yamagishi, Xin Wang, Massimiliano Todisco, et al. "ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection." ASVspoof 2021 Workshop Automatic Speaker Verification and Spoofing Coutermeasures Challenge, 2021.
    [4] Brecht Desplanques, Jenthe Thienpondt, Kris Demuynck, “ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,” Proc. Interspeech, 2020.
    [5] ] Jee-weon Jung; Hee-Soo Heo; Hemlata Tak, et al. AASIST: Audio anti-spoofing using integrated spectro-temporal graph attention networks[C]//ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2022: 6367-6371.
    [6] Robert M. Gray, “Toeplitz and circulant matrices: A review,”  Foundations and Trends in Communications and Information Theory 2006.
    [7]  Massimiliano Todisco, Xin Wang, Ville Vestman, et al. ASVspoof 2019: Future horizons in spoofed and fake audio detection. arXiv preprint arXiv:1904.05441, 2019.
    [8] Jyh-Min Cheng; Hsiao-Chuan Wang.  A method of estimating the equal error rate for automatic speaker verification[C]//2004 International Symposium on Chinese Spoken Language Processing. IEEE, 2004: 285-288.
    [9] Jee-weon Jung, Hemlata Tak, Hye-jin Shim, et al. SASV 2022: The First Spoofing-Aware Speaker Verification Challenge. arXiv preprint arXiv:2203.14732, 2022.

    相关链接

    ASLPer,公众号:语音之家论文分享丨NPU-ASLP实验室将携14篇论文参加语音旗舰会议INTERSPEECH2022