文章来源于音频语音与语言处理研究组,作者邵琪杰
人类的语音中除了包含语言信息外,还蕴含着丰富的副语言信息,包括情感、口音等。口音识别(Accent Recognition, AR)旨在通过说话人的语音识别其口音的任务。此外,对于带口音的语音识别(ASR)任务,口音识别也是一个重要的前置任务。

论文题目:Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition
作者列表:邵琪杰,颜京豪,康健,郭鹏程,石宪,胡鹏飞,谢磊

图1 发表论文截图

图2 扫码直接看论文
口音是一种受地域、教育程度等因素影响而产生的发音变异。例如大家常常听到的国内各具特色的中文地方口音,以及英语中受地域影响的不同发音习惯。西工大音频语音与语言处理研究组曾在2021年联合数据堂、上海交通大学举办了口音英语识别挑战赛——AESRC2020[1],涉及了多国英语人群的口音识别和语音识别任务。口音识别任务可以应用于用户画像等任务,也可辅助语音识别模型更好的识别带口音的语音,从而提升不同人群语音的识别准确率。 目前常见的口音识别模型[2,3,4]与说话人识别模型结构类似,例如ResNet或x-vector等。但不同于说话人信息可以直接从低级别的Fbank或MFCC声学特征中提取,口音是一种与语言相关的信息,直接使用声学特征作为输入会导致模型过拟合到说话人或者信道上[5],难以获得满意的识别性能。 实际上,口音可以被视为相对标准发音的一系列偏移[6,7],如果有相同内容的标准发音的语音作为基准,则区分不同口音会容易得多。但是,这种成对(parallel)的语音数据却极难获取,因此口音偏移的评估面临困难。 针对这一问题,本文提出了基于语言-声学相似度的口音偏移(LASAS)度量方法,并将其用于口音分类任务。对于一个带口音的语句,在映射其相应文本向量到口音相关空间作为基准后,本文通过评估声学嵌入和该基准的相似度,实现对口音偏移的度量。然后,本文将口音偏移和文本向量拼在一起,以获得语言-声学双模态表征。相比于纯声学嵌入,这种双模态表征充分利用了语言和声学信息,物理意义更加丰富和清晰,从而显著改善了口音分类性能。在口音英语识别挑战赛(AESRC)数据集[1]上的相关实验证明了本文方法的有效性。在测试集上实现了77.42%的分类正确率,相比于一个有竞争力的基线获得了6.94%的相对提升。
Input模块,它以声学特征(Fbank或MFCC)和对齐文本作为输入。其中,声学特征进入 Conformer 编码器以提取带口音的声学嵌入,该编码器可以由ASR模型的编码器初始化。考虑到编码器的最深层输出可能大部分是语言信息,本文将编码器层的某些中间层输出拼接在一起作为声学嵌入。
LASAS模块,以对齐文本和声学嵌入来计算口音偏移,并输出语言-声学双模态的嵌入表示。 AR 模块,将语言-声学双模态表示作为输入,先通过轻量级 Transformer编码器提取上下文相关的口音信息,然后,在 DNN 和池化层之后获得话语级口音预测结果。

图3 口音识别模型的系统结构示意图
LASAS模块:通过比较相同内容的标准发音和口音发音,我们可以度量带口音发音相对标准发音的偏移。但对于 AR 任务场景,这种偏移在缺少成对数据的情况下难以获取。但是,如果我们能建立一种虚拟口音偏移,使之可以在同一个发音单元上针对不同的口音显示出不同偏移距离和方向,那么这样的偏移对于后续的AR模型也很有意义。




实验:在表1中,采用本文LASAS方案的系统3明显优于系统2和系统1。在没有LASAS模块的情况下,即使系统2比系统1复杂,但其性能并没有明显的提高。这些实验充分证明LASAS是有效的。
表1 LASAS有效性实验的口音分类准确率


图4 “The”的T-SNE变换图

图5 “The”和“I”的PCA变换图。其中圆圈为高斯云图。直线连接该子词的所有口音的平均质心和各个口音的平均质心,用于显示口音偏移距离
表2 LASAS 和 AESRC 挑战赛获奖方案的口音分类准确率对比。表中 Real 和 ASR 表示使用真实文本或ASR 生成的文本。

相关链接
ASLPer,公众号:语音之家论文分享丨NPU-ASLP实验室将携14篇论文参加语音旗舰会议INTERSPEECH2022
