作者:琚雨恺

个性化语音增强(personalized speech enhancement, PSE)也称为目标说话人提取(target speaker extraction,TSE),其主要目的是通过目标说话人的注册语音从复杂的受干扰的语音(如带噪、带混响、干扰说话人等)中提取该目标说话人的语音。说话人声纹信息可以作为重要的先验特征,用于语音增强任务,一方面是可以提升主观听感;另一方面也可辅助后端语音识别等下游任务,提升下游任务的效果。


由微软发起的深度噪声抑制(Deep Noise Suppression Challenge)已经连续举办了四届,在ICASSP 2022上举办的最新一届竞赛[1]旨在促进全频带(48 kHz)实时语音增强研究(竞赛官网如图1),推出了(非个性化)语音增强和个性化语音增强两个赛道。竞赛一方面采用ITU-T P.835[2]框架对增强后的音频进行主观打分,另一方面也采用了词准确率(WAcc)作为对后端语音识别系统的评价指标,即语音增强系统要同时兼顾听感和语音识别性能,同时竞赛严格要求系统延时要小于40ms且处理一帧的时间要小于帧移。


在此次竞赛上,由西工大音频语音与语言处理研究组(ASLP@NPU)和腾讯天籁实验室(Tencent TEA Lab)合作提交的系统获得个性化语音增强赛道第一名的优异成绩(如图2所示),相关系统描述论文“TEA-PSE: TENCENT-ETHEREAL-AUDIO-LAB PERSONALIZED SPEECH ENHANCEMENT SYSTEM FOR ICASSP 2022 DNS CHALLENGE”被ICASSP2022同时接收,将在竞赛session进行展示。


本次腾讯天籁实验室-西工大联队提交的是一个两阶段神经网络语音增强方案,结合了dual-stage语音增强网络[3]和ECAPA-TDNN声纹网络[4]的优势,详细验证了二级网络在个性化语音增强任务中的可行性和优势,同时采用非对称损失函数[5]来缓解目标说话人过度抑制现象,并探究了谱压缩[6]对个性化增强的用处。该系统最终取得了3.97总体音质打分(OVR MOS)和0.69的字准确率(WAcc),获得个性化语音增强赛道第一名。现对该论文进行简要的解读和分享。


图1 ICASSP DNS竞赛微软官方网站


图2 ICASSP 2022 DNS Challenge Track2 最终成绩


论文题目:TEA-PSE: TENCENT-ETHEREAL-AUDIO-LAB PERSONALIZED SPEECH ENHANCEMENT SYSTEM FOR ICASSP 2022 DNS CHALLENGE

作者列表:琚雨恺、饶为、闫晓鹏、付艺辉、吕术博、程路遥、王燕南、谢磊、商世东

论文原文:https://ieeexplore.ieee.org/document/9747765


图3 发表论文截图


个性化语音增强

个性化语音增强(personalized speech enhancement, PSE)也称为目标说话人提取(target speaker extraction,TSE),其主要目的是通过目标说话人的注册语音从复杂的受干扰的语音(如带噪、带混响、干扰说话人等)中提取该目标说话人的语音。下面的视频展示的就是PSE做的事情:根据特朗普的声纹注册音频,从他和其他说话人混合的语音中提取出他的语音。视频播放了两遍,第一遍是原始音频,第二遍是提取后只保留特朗普语音的音频。

【戳我看视频】



两阶段模型方案

图5展示了两阶段方案的架构。如图 5(b) 所示,在第1阶段,我们使用观测信号的幅度作为输入,目标幅度作为训练目标。 此阶段旨在粗略地抑制噪声和干扰讲话人。 从阶段 1 产出增强语音的幅度后,我们将其与噪声相位耦合在一起,并将它们转换为实部和虚部频谱作为第 2 阶段的输入。我们还采用观察到的噪声复频谱作为阶段 2 的输入以进一步去除残留噪声和干扰语音,以及修复目标说话人语音的相位信息。同时,残差连接应用于第2阶段的输入和输出之间避免梯度消失。 简而言之,过程如下


这里|A|是时域注册信号的频谱,E是提取的说话人embedding。下标“r”和“i”表示复频谱的实部和虚部。 |Yp| 表示压缩的观测语谱,p表示压缩参数。S1 和 S2 表示阶段1和2的增强结果。


图5 TEA-PSE 网络结构


阶段1和阶段2都采用相似的网络拓扑,其中包括门控卷积编码器、解码器和堆叠的时域卷积模块(称为 TCM)。特别地,第1阶段网络只有一个解码器来估计幅度,而第2阶段网络有两个解码器来分别估计实部和虚部。关于说话人embedding和增强网络的融合,我们仅在图5(a)中每个TCM组中的第一个TCM处沿通道轴连接隐特征和说话人embedding,这样可以高效、渐进地将说话人信息与中间特征相结合。


损失函数

损失函数主要由以下四个部分构成,其中幅度和复数MSE Loss用于衡量增强后的语音和干净语音在幅度域和复频域的相似性,SISNR Loss用于衡量时域的相似性。非对称损失函数用于对幅度域上的目标说话人语音过度抑制现象进行额外的惩罚。

sisnr损失函数


非对称mse损失函数


幅度mse损失函数


复数mse损失函数


一级模型损失函数


二级模型损失函数


L1和L2分别是阶段1和阶段2的损失函数,我们先用L1训练一级模型,之后固定第一模型参数,用L2训练。


实验验证

本届DNS 竞赛向参与者发布了 48kHz 训练和开发集。训练集包括大约750小时的干净语音和181小时的噪声片段。具体来说,干净语音数据集包括六种语言,即英语、法语、德语、意大利语、俄语和西班牙语。英语部分由语音和歌唱组成,而其余语言只有语音数据,数据总共来自 3,230 个说话人。噪声数据主要来自Audioset、Freesound 和 DEMAND。

训练数据均为动态随机混合生成,信噪比(snr)和信干比(sir)均为-5至20dB。测试集分为两个部分,第一部分为我们用KING-ASR-215数据集生成的集外仿真测试集;另一部分为竞赛官方的开发集和盲测集。


表1 仿真数据集结果


首先在KING-ASR-215仿真测试集上测试各个模型解码结果的PESQ、STOI、ESTOI、以及SISNR等指标。从表1可以看到,我们的带有谱压缩和非对称损失函数的两阶段网络在所有指标上都超过了其他对比方法。同时,与第1阶段相比,引入第2阶段后各项指标均有提高。谱压缩带来少量的性能提升。我们发现,对于单阶段模型,非对称损失函数会使性能恶化;然而对于两阶段模型,非对称损失函数会带来性能提升。


表2 DNS开发集结果


我们进而在DNS开发集上测试各个模型解码结果的SIG、BAK以及OVRL等指标[7]。从表2中可以看到,带有谱压缩和非对称损失函数的两阶段网络在OVRL指标上超过了其他对比方法。同时,应用阶段 2 网络时,SIG会降低,BAK会提升。如果我们不使用非对称损失函数,两阶段模型的OVRL略低于单阶段模型。


表3 DNS盲测集结果


最后我们在DNS竞赛盲测集上测试各个模型解码结果的SIG、BAK、OVRL以及WAcc等指标。从表中可以看到,带有谱压缩和非对称损失函数的两阶段网络(即TEA-PSE)在OVRL指标上超过了其他对比方法,比竞赛基线系统提升了0.57。与原始的输入语音相比,提交系统的WAcc略有下降,但仍好于基线系统。最终提交的两阶段方案在个性化语音增强赛道获得第一名的优异成绩。


样例展示

第一组(Neighbor & Baby Crying)

带噪语音:Neighbor_BabyCrying_Noisy


一阶段模型输出:Neighbor_BabyCrying_Stage1


二阶段模型输出:Neighbor_BabyCrying_Stage2


第二组(Fan)

带噪语音:Fan_Noisy


一阶段模型输出:Fan_Stage1


二阶段模型输出:Fan_Stage2


第三组(Neighbor)

带噪语音:Neighbor_Noisy


一阶段模型输出:Neighbor_Stage1


二阶段模型输出:Neighbor_Stage2



参考文献
[1] H. Dubey, V. Gopal, R. Cutler, A. Aazami, S. Matusevych, S. Braun, S. E. Eskimez, M. Thakker, T. Yoshioka, H. Gamper, et al., “ICASSP 2022 deep noise suppression challenge,” .
[2] B. Naderi and R. Cutler, “Subjective evaluation of noise suppression algorithms in crowdsourcing,” arXiv preprint arXiv:2010.13200, 2020.
[3] A. Li, W. Liu, X. Luo, C. Zheng, and X. Li, “ICASSP 2021 deep noise suppression challenge: Decoupling magnitude and phase optimization with a two-stage deep network,” in ICASSP. IEEE, 2021, pp. 6628–6632.
[4] B. Desplanques, J. Thienpondt, and K. Demuynck, “ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,” in Interspeech, 2020, pp. 3830–3834.
[5] S. E. Eskimez, T. Yoshioka, H. Wang, X. Wang, Z. Chen, and X. Huang, “Personalized speech enhancement: New models and comprehensive evaluation,” arXiv preprint arXiv:2110.09625, 2021.
[6] A. Li, C. Zheng, R. Peng, and X. Li, “On the importance of power compression and phase estimation in monaural speech dereverberation,” JASA Express Letters, vol. 1, no. 1, pp. 014802, 2021.
[7]  C. K. Reddy, V. Gopal, and R. Cutler, “DNSMOS P. 835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,” arXiv preprint arXiv:2110.01763, 2021.