2022年8月12日,由语音之家打造的AI语音技术相关的前沿论文成果分享平台—SH SSS(SH Symposium Series on Speech)第一期成功举办。本期是由覃晓逸进行论文解读:《跨年龄声纹识别:学习年龄不变的说话人特征》。


下面是本次论文解读的回顾:

VIDEO
POSTER


概述
Abstract
近些年说话人识别取得了巨大的发展,但是由于相关数据的缺乏,很少有人关注跨年龄声纹识别。本篇文章基于VoxCeleb数据集挖掘跨年龄测试集并提出一种学习年龄不变的说话人表征(Age-invariant speaker representation, AISR)方法。由于VoxCeleb数据是从YouTube平台上采集下来,因此这个数据天然的就是跨年龄数据的场景。然而数据集提供的原始信息并不包含说话人的年龄信息。因此,我们采用一种人脸估计年龄的方法,通过识别视频数据来预测估计每个音频段的说话人年龄。由此,我们构建了基于VoxCeleb的跨年龄测试集(Vox-CA),其中正样本对有意选择较大年龄跨度的数据。此外,在选择负样本对时参照Vox-H集,考虑国籍和性别的影响。经过测试发现,基线系统性能从Vox-H集上的1.939%EER下降到Vox-CA20集的10.419%,这一结果表明跨年龄场景的困难程度。因此,我们提出了一种年龄解耦对抗学习(ADAL)方法,以缓解年龄差距的负面影响,减少类内方差。我们的方法在Vox-CA20测试集上的相关EER降低超过10%,优于基线系统。相关资源已经在Github上开源。


题 目 Tittle:Cross-Age Speaker Verification: Learning Age-Invariant Speaker Embeddings

期 刊 Journal & Comments:InterSpeech2022

作 者 Authors:覃晓逸,李娜,翁超,苏丹,李明

论文地址 Url:https://arxiv.org/abs/2207.05929

论文代码 Code:https://github.com/qinxiaoyi/Cross-Age_Speaker_Verification


引言/背景
Introduction
近些年由于深度学习的应用,使得说话人识别得到了极大的发展。然而面对跨年龄说话人识别的研究却很少,这是由于采集一个人跨度为几十年的数据时非常耗时耗力的。早期这一方向的研究主要集中在小数据集上[1,2,3,4],不过涵盖的说话人数量非常少。也有一些研究基于NIST SRE的数据探索年龄对说话人的影响[5,6],但是由于NIST SRE数据只提供了说话人录制时的年龄,并没有同一个人十几年跨度的情况,因此验证说话人模型的测试文件正样本对不包含年龄跨度的问题。

本文基于VoxCeleb数据库进行跨年龄声纹识别的研究。VoxCeleb数据是目前说话人识别领域最为常用的一个大规模数据。并且由于其是从YouTube平台上采用人脸识别和语音识别技术采集,这就让VoxCeleb数据天然的成为了一个跨年龄的数据库,因为视频平台上会保留名人长时间跨度的影像数据。然而VoxCeleb本身并没有提供说话人的年龄信息。一些做音频年龄识别的研究人员通过人工标注的方法为VoxCeleb标注了年龄信息[7][8]。不过人工标注仍然是很耗时的并且并不能涵盖全部的数据。因此,受[9]启发,我们基于VoxCeleb的视频数据,通过人脸估计年龄的方法通过识别人脸从而提供估计年龄标签,为VoxCeleb1&2的所有音频数据打上年龄标签。虽然标注的年龄值并不完全准确,但它可以将一个说话人的所有音频按时间顺序排列。于是,我们提出了一个跨年龄的说话人验证任务,并基于VoxCele 1上构建了多个跨年龄的测试集(Vox-CA),其中正样本对特意选择了年龄差距较大音频。此外,正如在Vox-H测试集中提到的,我们构造的负面对也考虑到了国籍和性别的影响。实验结果也证实了跨年龄的情况是非常困难的。

跨年龄声纹识别是具有挑战性的,因为人声老化过程扩大了类内方差。受到人脸识别中对抗年龄老化的方法启发[10,11,12],我们提出一个年龄解耦对抗学习模块(Age Decoupling Adversarial Learning, ADAL)来弱化说话人表征中的年龄信息。提出的ADAL方法使用注意机制从高维特征图中提取年龄相关信息,并将年龄分量与说话人分量解耦。采用ArcFace对解耦后的身份表征进行建模。此外,基于对抗性学习的年龄分类器也对解耦后的身份特征进行建模,以削弱残留的年龄信息影响。最终结果优于目前SOTA的基线系统。


研究方法 & 模型介绍

Methods & Data analysis

2.1 VoxCeleb跨年龄测试集
2.1.1 提取年龄信息
  • 收集VoxCeleb1&2所有视频数据的人脸图片
  • 采用Dex估计所有人脸的年龄
  • 给音频打上年龄标签(通过平均人脸年龄值)
  • 选择年龄跨度大的音频构造正样本对,选择同国籍和同性别的音频构造负样本对
其中,估计完音频年龄后,由于每个说话人的音频文件是从一个长视频中截取出来,因此最后的标注的年龄信息是整个视频段的年龄,来自同一视频的音频文件的年龄标签都是一致的。

2.1.2 构造跨年龄测试集
我们在构造样本对时遵循以下几个原则:
正样本构造:首先,正样本对一定是跨年龄情况。换句话说,同一个视频内的两段音频不会被选择成为正样本对。我们统计了每个说话人的最大年龄跨度,如图1所示。可以观察到大部分人的年龄跨度在0-20年之间。其次,由于随着最大年龄跨度的增加,满足条件规定年龄跨度的人数越来越少,因此我们要求测试集至少涵盖80人以防止模型对测试集的过拟合。
负样本构造:对于负样本对,我们参照Vox-H设计原则,负样本对的两个说话人一定是同一国籍和同性别的。

图1  VoxCeleb数据的年龄跨度分布

最终我们构造了以下4个跨年龄测试集:
Vox-CA5: 正样本的跨度在5年以上,备选说话人必须包含跨度在7年以上的数据。
Vox-CA10: 正样本的跨度在10年以上,备选说话人必须包含跨度在12年以上的数据。
Vox-CA15: 正样本的跨度在15年以上,备选说话人必须包含跨度在17年以上的数据。
Vox-CA20: 正样本的跨度在20年以上,备选说话人必须包含跨度在22年以上的数据。
我们选择VoxCeleb1数据构造跨年龄测试集。


2.1.3 Vox-CA 与Vox-E,Vox-H 的比较
首先,对于段内(Intra-segment)的正样本对:即正样本对的音频来自同一个视频段。其中Vox-E和Vox-H并不严格区分这一情况,而Vox-CA是跨年龄测试集,因此不存在这种情况。由于段内的正样本的音频涵盖的变量非常少会导致说话人识别模型性能虚高。我们基于这一考虑剔除段内正样本对并重新评测Vox测试集,结果如表1所示。可以明显观察到,剔除了段内正样本对后,模型性能会变差。


表1考虑有无段内正样本对的基线系统在VoxCeleb1测试集上的表现
图片
其次,对于跨年龄(Cross-age)的正样本对:正如表2统计信息所示,Vox-E和Vox-H并没有考虑年龄跨度这一情况,正样本对的年龄跨度在3年左右。而Vox-CA测试集则是有意选择一定的年龄跨度。同时也可以观察到,随着年龄跨度的增加,满足条件的说话人类数越来越少。


表2 Vox测试集和Vox-CA测试集的统计信息

最后,对于同国籍和同性别的负样本对:Vox-CA根据Vox-H设计原则,在挑选负样本对时严格选择同性别和同国籍说话人,而Vox-E则是随机挑选负样本对。

2.2 学习年龄不变的说话人embedding
2.2.1 解耦年龄的相关组件
前期实验我们发现,已经训练好的说话人embedding仍可以进行年龄分类任务,说明说话人的embedding信息中仍包含年龄信息。这里假设说话人特征向量由身份信息和年龄信息组成,于是我们设计了一个线性模型,将年龄信息与身份特征解耦。首先,假设说话人特征向量是从输入音频中提取的维向量,是身份和年龄信息的总和:


其中和分别表示说话人特征向量中的身份成分和年龄成分。然后,我们设计了一个与年龄相关的提取器模块(ARE),该模块使用注意机制从高维特征映射图中提取与年龄相关的信息。在经过ARE模块后,我们得到了维的年龄相关向量,其公式如下:

其中表示注意机制的模块,和表示池化层和全连接层。通过从减去将年龄相关成分从说话人特征向量中剥离。其中由年龄分类器进行有监督年龄组学习,以控制含有年龄信息。这里我们采用注意力统计池化层(Attentive Statistical Pooling)来实现高维特征图中的年龄相关信息捕捉,从而获得固定长度的年龄信息表征向量。

具体结构如图2所示。


图2 ADAL方法结构框架
2.2.2多任务学习
该模型由三个监督任务组成:说话人身份分类任务、年龄组分类任务和年龄对抗性学习任务:

说话人身份分类任务:我们采用说话人身份分类器来引导表示身份信息。随着时间的推移,说话人的音色会发生很大的变化,跨年龄说话人识别的本质问题是说话人的老化会导致类内方差的增加。因此,我们采用ArcFace作为身份损失函数来减少类内距离。

年龄组分类任务。为了促使年龄信息与说话人信息分离,利用年龄组分类器来监督与年龄相关的表征向量学习。然而,在常用的说话人年龄估计方法中,我们不使用年龄回归学习方法或具体年龄分类作为输出标签。这是由于人的音色不会在几年内发生明显变化,如果强行采用年龄分类和年龄回归任务作为损失函数,会误导年龄分类器从而使系统性能反而变差。因此,我们采用了年龄组分类法,将年龄分为7组:0-20,21-30、31-40、41-50、51-60、61-70和70-100。

年龄对抗性学习。为了确保身份嵌入朝着年龄不变的方向学习,在上本方法通过增加一个带有梯度反转层(GRL)[18]的年龄分类器,以进一步减少解耦后特征向量中的年龄信息。

2.2.3模型框架
最终的模型框架如图2所示。将说话人身份分类任务、年龄组分类任务和年龄对抗性学习任务任务组合并采用ARE模块。因此,本方法被称为基于年龄解耦对抗学习。该方法的最终损失公式如下:

其中和分别是身份和年龄分类任务的输出标签。表示交叉熵损失,和是平衡不同损失函数的标量。

实验结果

Results

3.1 实验设
训练数据采用Vox2dev数据(5994人),测试数据选择VoxCeleb 1数据(1251人)构造测试trial。基线系统模型首先在Vox2dev上进行预训练,然后再采用ADAL模块进行finetune操作,具体训练参数细节见论文。


3.2 基线系统在不同测试集上的结果
表3 基线系统在不同测试集上的性能


我们采用ResNet34-GSP-ArcFace作为基线系统,其在Vox测试集上的性能如表3所示。

首先,我们根据VoxCeleb2论文指导设计对应的测试集(our-E和our-H)来证实我们设计trial文件的正确性。然后我们分别构造了只有考虑一种变量情况的测试集,其中only-N,only-G和only-I分别表示测试集负样本对是同国籍、测试集负样本对是同性别和测试集正样本对是段内音频。不难发现,同国籍和同性别情况下,模型性能有轻微下降。另外,当正样本对是同一段内语音时,说话人识别系统性能非常好。但是需要我们注意的是,这是虚假的性能好,因为在通常的测试场景下,测试语音和注册语音来自不同场景。因此基于ASR数据库构造的声纹识别测试集通常会有较好的结果,但并不能真实的反应说话人识别系统的性能。

当变量只有年龄因素时,不难发现,随着年龄跨度的增加,系统性能下降严重。最后,当我们将集中困难情况集合与一个测试集时,即正样本考虑大年龄跨度音频对,负样本只采用同国籍和同性别的情况(Vox-CA)。模型性能急剧下降,最差的情况在年龄跨度为20年以上时,EER达到了10.419%。


3.3 AISR的实验结果
表4 不同说话人模型在跨年龄测试集上的性能


表4展示了我们提出的放大和相关方法在跨年龄测试集上的性能。首先,我们比较基于Softmax和基于ArcFace的结果。由于跨年龄的说话人识别本质上是减小说话人的类内方差,因此采用了ArcFace的模型远优于采用了Softmax的模型。不论是在Vox测试集还是Vox-CA跨年龄测试集上。

其次我们比较我们提出的方法和常用对抗学习和解耦方法,其中GRL和Age Residual的方法如图3所示。

图3 对比方法模型示意图

其中GRL方法,我们在speaker embedding后增加了一个带有梯度反转的年龄组分类器。而Age Residual方法则是将z向量解耦,通过年龄组分类器有监督的指导并通过相减直接减去年龄信息从而得到年龄残差的说话人信息。结果表明,在保证说话人性能在通用测试集上性能保持不变的情况下,GRL和Age Residual方法并不能有效的减少年龄信息带来的负影响。这两种方法的局限性在于,操作是在embedding层面上进行的。由于embedding是由编码器层产生的紧凑表示向量,导致操作余量有限,因此改进幅度很小。与这些方法相比,ADAL的z_age是从高纬特征图中提取的,年龄信息也可以通过年龄对抗学习分类器进一步消除。与基线系统相比,ADAL在Vox-CA20测试集上取得了10%的相对改进。年龄差距越大,结果越好。此外,结果表明,只安装ARE模块的基线模型仍然比其他方法好。

发展应用

Conclusion & Discussion

本篇文章采用人脸年龄估计的方法挖掘跨年龄声纹识别场景数据并提出跨年龄声纹识别的的新基准Vox-CA。Vox-CA上的结果表明年龄不匹配带来的影响和跨年龄场景的测试难度。另外本篇文章还提出一种年龄解耦的对抗学习方法来学习年龄不变的说话人表征以降低年龄跨度带来的不利影响。但是跨年龄声纹识别依旧是一个非常具有挑战性的任务,需要进一步的探索和研究。


参考

References

[1]W. Mistretta and K. Farrell, “Model adaptation methods for speaker verification,” in Proc. ICASSP, 1998, pp. 113–116.
[2] F. Kelly, A. Drygajlo, and N. Harte, “Speaker verification with long-term ageing data,” in Proc. IAPR International Conference on Biometrics, 2012, pp. 478–483.
[3] F. Kelly and N. Harte, “Effects of Long-Term Ageing on Speaker Verification,” in Biometrics and ID Management, 2011, pp. 113124.
[4] Y. Matveev, “The problem of voice template aging in speaker recognition systems,” in International Conference on Speech and Computer, 2013, pp. 345–353.
[5] Y. Lei and J. H. Hansen, “The role of age in factor analysis for speaker identification,” in Tenth Annual Conference of the International Speech Communication Association, 2009.
[6] S. S. Xu, M.-W. Mak, K. H. Wong, H. Meng, and T. C. Y. Kwok, “Age-Invariant Speaker Embedding for Diarization of Cognitive Assessments,” in Proc. ISCSLP, 2021, pp. 1–5.
[7] N. Tawara, A. Ogawa, Y. Kitagishi, and H. Kamiyama, “AgeVOX-Celeb: Multi-Modal Corpus for Facial and Speech Estimation,” in Proc. ICASSP, 2021, pp. 6963–6967.
[8] K. Hechmi, T. N. Trong, V. Hautamki, and T. Kinnunen, “Voxceleb Enrichment for Age and Gender Recognition,” in ASRU, 2021, pp. 687–693.
[9] T. Zheng, W. Deng, and J. Hu, “Cross-Age LFW: A Database for Studying Cross-age Face Recognition in Unconstrained Environments,” arXiv preprint arXiv:1708.08197, 2017.
[10] H. Wang, D. Gong, Z. Li, and W. Liu, “Decorrelated Adversarial learning for age-invariant face recognition,” in Proc. CVPR, 2019, pp. 3527–3536.
[11] Y. Wang, D. Gong, Z. Zhou, X. Ji, H. Wang, Z. Li, W. Liu, and T. Zhang, “Orthogonal Deep Features Decomposition for Ageinvariant Face Recognition,” in Proc. ECCV, 2018, pp. 738–753.
[12] Z. Huang, J. Zhang, and H. Shan, “When age-invariant face recognition meets face age synthesis: A multi-task learning framework,” in Proc. CVPR, 2021, pp. 7282–7291.