文章来源于音频语音与语言处理研究组,作者张丽
说话人识别技术是根据语音辨别说话人身份的技术。随着深度学习技术的应用,说话人识别的性能取得了巨大的提升。然而说话人识别系统也面临着各种仿冒欺骗(spoofing)的威胁,如何构建具有欺骗感知能力的说话人识别系统成为研究热点。


图1 发表论文截图

图2 扫码直接看论文
随着深度神经网络的发展和开源数据的推广,说话人确认系统在低噪且没有域的不匹配的情况下能够达到很高的识别准确率。但是,该系统非常容易受到各种恶意的欺骗攻击,即攻击者可以通过对语音进行加工处理,欺骗攻击现有的说话人识别系统。其中攻击方式主要包括:逻辑攻击 (使用语音合成、语音转换和切片拼接等方式产生攻击语音) ,物理攻击 (使用真实场景语音录制或者模拟回放等方式产生攻击语音)和深度欺骗攻击(深度欺骗语音的产生和逻辑攻击语音产生方式基本相同,但是深度欺骗攻击语音的传输需要使用不同的音频编解码器处理音频数据的压缩-解压缩过程) [3]。由上述任意一种攻击方法产生的欺骗语音,如果拿来攻击现有说话人确认系统,都会给社会造成安全威胁。因此,很多学者开始探索如何对抗虚假语音攻击。目前已有的对抗攻击方案基本都是只考虑虚假语音的检测率,忽略了说话人确认系统的准确率。SASV就是基于此举办的一次欺骗感知说话人验证挑战赛 [1],该竞赛的宗旨是在让说话人模型能够感知到攻击语音同时保证说话人确认系统性能不下降。我们在此次竞赛中主要从三个方面研究了说话人确认系统与反欺骗对策系统的后端融合。首先,我们提出了用于说话人表征和反欺骗对抗表征的循环矩阵变换和堆叠,以此来替代简单的两个系统表征的拼接操作。其次,我们使用不同的卷积神经网络选择性地将说话人表征和反欺骗对抗表征的显著区域融合到卷积核的通道中。最后,我们在一维卷积神经网络中设计了并行注意力机制,以学习通道维度的全局相关性以及特征维度的重要部分。经过实验验证,对比竞赛给出的基线系统,我们提出的方法都有不同程度的提升。

图3 后端融合系统概述
在表征融合模块中,我们使用了直接拼接、循环矩阵变换和堆叠这三种表征融合方法。
在集成模型模块,我们除了将基线DNN加深之外,我们还引入了另外两个基于卷积神经网络 (CNN) 的后端框架,其架构如图4所示。首先,我们加深了基线模型DNN [1],但是随着模型的加深,系统性能会饱和。然后我们堆叠说话人和对抗欺骗表征,并使用 1D 卷积神经网络替换基线中的DNN网络。同时,我们在卷积块之后加入了并行注意机制,以学习通道维度的全局关系以及学习特征维度的重要区域。最后,我们提出了说话人和对抗欺骗表征进行循环矩阵变换并堆叠新定义的表征,然后将它们输入到具有squeeze-and-excitation (SE) 注意力的 2D卷积神经网络中。

图4 不同的后端集成模块:(a) 加深的基线模型 (DNN),(b) 具有并行注意力的 1D_CNN,(c) 具有循环矩阵变换和SE 注意力的2D_CNN
1D卷积注意力机制:在图4的(a)网络架构中,我们采用1D卷积来处理堆叠的说话人和对抗欺骗表征,旨在使用卷积核选择性地将不同的表征区域融合到卷积的通道中。然后,我们引入了一个并行注意力(PA) 模块来学习不同表征之间的全局交互,并关注特征维度中的重要区域,如图 5 所示。PA 模块分别沿着通道维度和特征维度学习注意力掩码。

图五 1D 卷积中的并行注意力(PA)



2D卷积前的循环矩阵变换:为了进一步使用卷积核选择性地融合嵌入的显着区域,我们采用循环矩阵变换将说话人表征和对抗欺骗表征转换为循环矩阵。循环矩阵是一个方阵,其中所有行向量都由相同的元素组成,并且每个行向量相对于前一个行向量向右旋转一个元素 [6]。假设注册说话人表征、测试说话人表征和测试语音的对抗检测表征是 ei , ti 和 ci,循环矩阵变换公式如下:

随着循环矩阵的每一行移动一个元素,通过新定义的交互操作,我们几乎探索了不同嵌入之间所有可能的交互。之后我们将三个循环矩阵堆叠成一个张量,并将其输入2D卷积中。同时,我们在最后一个卷积层之后嵌入SE注意力机制,以学习不同表征之间的依赖关系。
Extend(512)_DNN 模型:网络模型是4层DNN,每层节点数是[512,256,128,64]。
Extend(1024)_DNN模型:网络模型是5层DNN,每层节点数是[1024,512,256,128,64]。
1D_CNN模型:1D_CNN 模型由3 层 1D 卷积、1 层自适应平均池化和 3 层 DNN组成。3层一维卷积的通道和核分别是[256,128,64]和[3,3,3]。每个卷积层后面都有一个归一化层和一个 LeakReLU 激活层。3 层 DNN 的神经节点为 [512, 256, 64]。
1D_CNN_SE模型:SE 注意力层嵌入在 1D_CNN 中的第三个卷积网络层之后。SE 注意力模块的内通道缩减比为8。该模型的其他配置与 1D_CNN 模型中的配置相同。
1D_CNN_PA模型:并行注意力层嵌入在 1D_CNN 中的第三个卷积网络层之后。并行注意力的内通道缩减比为 8。该模型的其他配置与 1D_CNN 模型中的配置相同。
2D_CNN模型:2D_CNN 模型由4 层 2D 卷积、1 层自适应平均池化和 3 层 DNN组成。通道和内核配置为 [32, 64, 128, 256] 和 [5, 3, 3, 3]。自适应平均池的配置是 [16, 16]。DNN中神经节点数是 [256, 128, 64]。
2D_CNN_SE模型: SE 注意力层嵌入在第三个卷积网络层之后。该模型的其他配置与 2D_CNN 模型中的配置相同。 2D_CNN_VSE模型: 除了SE注意力机制,我们还在 2D_CNN 模型中使用了 SE注意力机制的变体。变体 SE 注意(VSE)已被证明在说话人验证中是有效的。该模型的其他配置与 2D_CNN 模型中的配置相同。
评价指标:经典的等错误率 (EER) [8] 被用作主要指标。具体来说,有三种 EER 指标,即 SASV-EER、SPF-EER 和 SV-EER [9]。SASV-EER 不区分不同的说话者(目标、非目标或冒名顶替者)访问测试和欺骗性访问测试。SPF-EER 是欺骗攻击者和目标说话者测试的指标。SV-EER 是没有欺骗攻击的传统说话人确认系统验证的指标。
实验结果:表 1 中的实验结果是使用 ASVspoof 2019 训练集训练的模型。我们可以看到,Extend(512)_DNN模型的SASV-EER在评估集上与baseline2模型[6]相比绝对降低了1.529%。在我们堆叠说话人表征和对抗欺骗表征并将它们输入1D_CNN 模型后,评估集上的 SASVEER 大幅降低到 1.361%。性能的提高要归功于 SV-EER 的下降。但 1D_CNN 在评估集上的 SPF-EER 略有上升。当我们将 SE注意力机制嵌入到 1D_CNN 模型中时,SPF-EER 得到了更多的降低。同时,评估集的 SASV-EER 与 1D_CNN的结果相比降低了 0.244%。将 SE注意力机制替换为并行注意力机制(PA)后,评估集上的 SASV-EER 进一步降低了 0.093%。借助循环矩阵变换,2D_CNN 模型的 SASV-EER 在评估集上优于 1D_CNN 模型。在 2D_CNN 中加入SE注意力机制后,2D_CNN_SE 模型的 SASV-EER 在评估集上甚至达到了 0.998%,与表 1 中的其他模型相比,2D_CNN_SE 模型得到了最低的 SPF-EER 和 SV-EER。此外,当我们将VSE注意力嵌入到2D CNN模型中,评估集的SASV-EER比2D_CNN模型降低了0.134%。
表1 SASV 2022 开发和评估集的 EER (%) 结果(使用训练集训练)

表 2:SASV 2022 开发和评估集的 EER (%) 结果(使用训练集和开发集训练)

最后,我们将使用 ASVspoof 2019 训练和开发集训练的上述模型进行融合。我们采用两种融合方法,即 Bosaris 工具包 [31] 中的线性回归和分数平均。融合结果如表 3 所示。将表 2 中的 1D CNN 模型和基于 2D CNN 的模型的得分平均后,SASV-EER、SPF-EER 和 SV-EER 分别达到 0.559%、0.354% 和 0.857% 。我们注意到,与分数平均相比,线性回归的融合导致更差的结果。这可能是因为开发集用于训练模型,导致模型过度拟合开发集。同时,表 1 和表 2 在开发集上的实验结果表明,当我们添加开发集来训练模型时,模型对开发集过度拟合。
表 3:SASV 2022 开发和评估集的 Fusion EER (%) 结果

相关链接
ASLPer,公众号:语音之家论文分享丨NPU-ASLP实验室将携14篇论文参加语音旗舰会议INTERSPEECH2022
