近期,由国际顶级语音会议ICASSP(International Conference on Acoustics, Speech, and Signal Processing,国际声学、语音与信号处理会议)和阿里巴巴集团联合举办的ICASSP 2022多通道多方会议转录挑战赛(M2MeT)最终排名结果已发布,同花顺语音团队在本次竞赛的语音识别赛道中脱颖而出,斩获冠军。
论文地址:
https://arxiv.org/pdf/2202.01614.pdf


比赛难点
比赛&论文方案
同花顺团队的整体系统架构如下图所示,系统主要由以下三部分组成:
(1)声学模型训练数据集的构建。
(2)ASR(语音识别)模型架构的选取。
(3)测试集的处理及结果融合。
声学模型训练数据集的构建:在构建训练集的过程中,团队采用各种各样的数据增强方法,主要包括多通道WPE去混响、Beamforming、多通道数据仿真、多说话人重叠音模拟、加混响和噪声、语速扰动、房间冲击响应模拟等。最终通过数据增强,得到了18000小时的有效训练数据。
ASR(语音识别)模型架构的选取:在模型选取的过程中,团队尝试了两种方案,一是基于前端技术与语音识别联合的方案,二是基线系统所采用的基于序列化输出训练SOT的语音识别系统,将前端技术和后端识别分开使用的方案。经过实验对比,最终选择了基于SOT的识别系统方案。为了充分利用不同模型之间的性能互补特性,采用了两种ASR模型,分别是基于传统CTC/Attention联合训练的Conformer模型和在此基础上改进的基于双向decoder的U2++模型,使用Rover语音识别融合工具将两个模型的结果进行融合,进一步提升模型的效果。
测试集的处理及结果融合:为了进一步提升测试集的识别率,团队对测试集进行了不同信号处理,包括WPE去混响+Beamforming、使用扰动因子0.9和1.1对测试集语音进行语速扰动。然后使用上面提到的两种语言识别模型分别对处理后的测试集进行解码,最终使用Rover结果融合工具对得到的6种结果进行融合。这一操作使得评估集的CER相对降低了6.42%;测试集的CER相对降低了6.00%。

比赛&论文结果
本次比赛的实验结果如下表所示。在评估集上的CER(字符错误率)是17.48%,相比于基线系统(29.7%)相对降低了41.14%;在测试集上的CER是18.79%,相比于基线系统(30.9%)相对降低了39.19%。最终同花顺语音团队在测试集上以18.79% CER的优异成绩取得了本次M2MeT国际比赛语音识别赛道的第一名。详细内容可以参考论文。

团队介绍
同花顺语音团队自成立以来,就以构建全栈式语音技术能力作为目标,以语音所具有的交互便利性和自然性持续为产品业务创造新动能。经过多年积累,团队技术能力覆盖了中、英、方言语音识别、语音合成、声纹识别、情感计算、语种识别等基础研究方向,相关语音服务在公司内外部产品和系统中得到了广泛应用,包括同花顺手机炒股、悦录听写、同顺会议、智能电话助理接听宝、智能客服、智能外呼和质检等,服务性能得到充分检验。尤其是在金融领域,得益于长期积累的数据优势,语音识别性能达到了行业领先水平。
同花顺语音团队在推动语音技术产品落地的同时,注重技术研发与创新。多年来,在语音顶级会议ICASSP和INTERSPEECH上发表了多篇论文,紧跟业界语音技术发展趋势与研究热点。在一系列专业挑战赛中多次取得优异成绩。目前,团队正在方言语音识别、端侧语音识别、情感计算、多模态识别、语音情感合成及语音转换、语音翻译等技术领域深耕拓展。此次优异成绩的取得,体现出团队夯实的研发能力和技术创新能力。
团队的研发工作离不开与科研高校的密切交流。同花顺语音团队一直与清华大学、西北工业大学、天津大学等国内外高校保持交流与合作。企业界与学术界之间的交流互动不仅有助于研究成果的产出,同时能够加速前沿科学技术的产品落地,让更多的人能够体验科技,享受科技。
