文章来源于音频语音与语言处理研究组,作者俞帆

说话人相关语音识别(Speaker-Attributed Automatic Speech Recognition,SA-ASR)是多方会议转录的主要目的,旨在解决“谁说了什么”这个问题。与多说话人语音识别相比,SA-ASR不仅需要转录重叠语音段内不同说话人的抄本,同时还需要对识别的抄本分配说话人的标签。针对多方会议场景,其包含了丰富的讲话风格和复杂的声学条件,需要考虑到重叠语音、数量未知的说话人、会议室中的远场拾音、噪音和混响等挑战,是语音技术应用中最有价值、同时也是最具挑战性的场景之一。因此,SA-ASR系统需要更多地考虑相关的多个语音处理模块,如说话人日志模块来统计和识别说话人,语音分离模块来处理重叠语音,ASR模块从分离的信号中识别语音内容。

近期,西工大音频语音与语言处理研究组(ASLP@NPU)和阿里巴巴高校AIR论文“A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings”被语音旗舰会议Interspeech 2022接收。该论文主要对比研究了三种SA-ASR的方法,通过对说话人日志、语音分离和语音识别模块的耦合,在M2MeT竞赛(如下推文)上发布的真实会议场景语料库AliMeeting上进行了相关实验,有效地降低了说话人相关字错误率(SD-CER)。现对该论文进行简要的解读和分享。

多通道多方会议转录M2MeT挑战赛与AliMeeting数据集

达摩院语音实验室,公众号:阿里语音AIICASSP 2022 Grand Challenge -- 多通道多方会议转录挑战赛 (M2MeT)正式开启


论文题目:A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings
作者列表:俞帆,杜志浩,张仕良,林宇箫,谢磊
论文原文:https://arxiv.org/abs/2203.16834


图1 发表论文截图


图2 扫码直接看论文


1. 背景动机
说话人相关语音识别(SA-ASR)是多方会议转录的主要目的,旨在解决“谁说了什么”这个问题。与多说话人语音识别相比,SA-ASR不仅需要转录重叠语音段内不同说话人的抄本,同时还需要对识别的抄本分配说话人的标签。多方会议场景包含了丰富的讲话风格和复杂的声学条件,需要考虑到重叠语音、数量未知的说话人、会议室中的远场拾音、噪音和混响等挑战,是语音技术应用中最有价值、同时也是最具挑战性的场景之一。因此,SA-ASR系统需要更多地考虑相关的多个语音处理模块,如说话人日志模块来统计和识别说话人,语音分离模块来处理重叠语音,ASR模块从分离的信号中识别语音内容。
SA-ASR的准确性受到语音识别模型和说话人日志模型共同的影响。近年来,学术界致力于设计一种端到端直接输出多说话人识别结果的系统。串行输出训练(Serialized Output Training,SOT)策略[1]是目前主流的多说话人语音识别方案之一。该策略在不改变模型结构的基础上,仅修改了训练数据的抄本格式,通过引入一个特殊的分隔符,串行地输出重叠音频中多个说话人的预测文本。并且SOT对于说话人数量没有限制,理论上可以处理任意数量参会人的会议多人讨论场景。在最近的M2MeT挑战赛中[2,3],SOT得到了很好的应用,并取得了显著的成绩。因此,我们探讨了第一种方法,也就是帧级别的说话人日志结合基于SOT的语音识别模型(FD-SOT),它由一个用于确定说话人身份的帧级说话人日志模型和一个用于识别语句的多说话人ASR模型组成。FD-SOT是通过对齐说话人日志模型的预测结果和ASR模型的预测文本来获取带有说话人标签的预测文本。
但是在FD-SOT方案中,由于各个模块是独立的,这种对齐策略很容易因为错误的时间戳影响模型的识别性能。因此,为了消除模型对于时间戳对齐的过度依赖性,本文提出了第二种方法——字级别的说话人日志结合基于SOT的语音识别模型(WD-SOT)。该方法引入了字级别的说话人日志模型,基于SOT的预测文本来确认对应语句的说话人身份,从而有效解决错误对齐的问题。同时,本文采用自注意机制的方法来获取更多的上下文信息,进一步提高了说话人日志模型的效果。
FD-SOT和WD-SOT都依赖于SOT模型的输出,而SOT的误差会严重影响整个框架的性能。因此,我们转向SA-ASR的另一种解决方案,即使用分离模型处理重叠语音,从而摆脱对多说话人ASR模型输出的依赖。本文进而提出了第三种方法——目标说话人分离和ASR模型的联合优化(TS-ASR),也就是前端目标说话人分离模块根据相应的说话人表征提取对应说话人的高维表示来给后端的单说话人ASR模型识别解码。
在真实会议场景语料库AliMeeting上,本文对上述三种SA-ASR方法进行了对比。实验结果表明WD-SOT方法相比FD-SOT方法在说话人相关字符错误率(SD-CER)上相对降低了10.7%;TS-ASR方法相比FD-SOT方法在SD-CER上也相对降低了16.5%。


2. 三种SA-ASR方案
SOT方法[1]能够同时对不同说话人的输出进行建模,并且对最大说话人的数量不进行限制,可以处理任意数量的说话人语句。为了识别多个重叠的语句,SOT在不同的语句之间引入了一个特殊的分隔符,该分隔符用于连接不同语句的转录文本。为了避免对所有可能的连接方式进行复杂的全排列计算,SOT按每个句子的开始时间进行排序,也就是采用“先进先出”(First-In  First-Out, FIFO)的方法。


图1 FD-SOT、WD-SOT和TS-ASR方法流程图对比

FD-SOT方法

M2MeT挑战赛前三名团队都使用了TS-VAD模型[4]来预测重叠音频部分的说话人标签。我们也同样复现了该方案,并在AliMeeting Eval和Test集上分别实现了4.20%和5.42%的DER。为了进一步获得SA-ASR的结果,我们通过时间戳的对齐将TS-VAD和SOT的结果结合起来。这种方法被称为带有SOT的帧级别的说话人日志方法(FD-SOT)。
FD-SOT的详细流程如下:
  1. 使用TS-VAD模型对预分割后的句子预测每一帧的说话人标签,定义当前预分割句子中包含了N1个语句。
  2. 定义SOT ASR模型输出的语句数量为N2。如果N1等于N2,则不需要进行额外的操作,可以直接按照时间顺序对齐即可。
  3. 如果N1大于N2,则从TS-VAD得到的N1个预测语句中选择持续时间最长的N2个语句,丢弃其他的短话语。
  4. 如果N1小于N2,我们从SOT ASR模型输出中选择文本长度最长的N1个语句文本,并丢弃其他的短语句文本。
  5. 最后,我们将TS-VAD和SOT之间的语句按时间顺序进行对齐匹配。

WD-SOT方法

本文提出的字级别的说话人日志模型结构如图2所示,首先使用三个单独的编码器对多说话人预测抄本、语音特征和说话人特征进行编码。对于多说话人预测抄本和语音特征的编码表征,使用多头注意力机制生成每个字的聚合特征表示:

该聚合表征是声学和语言信息的一个融合。
接下来,通过说话人特征的编码表征和聚合表征的点积得到上下文无关(CI)分数:

CI分数只考虑当前说话人相关特征,而不同说话人的上下文信息对于当前当前说话人的判断也是有帮助的。因此,我们进一步设计了上下文相关(CD)分数,其定义如下:

其中f是上下文感知函数,例如,自注意力机制(self-attention)。最后,将CI和CD分数结合起来,输入到后处理网络,预测每个字符对应的说话人。


图2 本文提出的字级别说话人日志方法结构图

TS-ASR方法

目标说话人分离模块通过提前处理得到的说话人特征,从多说话人信号中提取目标说话人的表征给后端的ASR模型进行识别。前端分离模块和后端ASR模块如果分别优化会导致性能没办法达到最优的状态,因此本文采用联合优化的方式,使用ASR的损失函数更新整个前后端模型框架。同时,我们采用上文所述的TS-VAD说话人日志模型[4]和d-vector提取网络来获得每个说话人的特征。
在网络结构方面,前端分别尝试了Conformer[5]和CRN[6]。说话人特征和音频特征的结合采用FILM的方式来进一步提升模型的性能。同时为了使TS-ASR模型参数和之前的ASR模型保持一致,我们采用了减少了该方法中ASR模块encoder的层数。
3. 实验验证
实验数据
本文使用AliMeeting语料库评估各种SA-ASR系统。AliMeeting语料库收集于真实多人会议中,包含104.75小时的训练数据(Train), 4小时的评估数据(Eval)和10小时的测试数据(Test)。其中每场会议由多个说话人进行15到30分钟的讨论,并且参会的男女比例人数均衡。每场会议不仅采用了8麦环阵录制远场数据(Ali-far),同时也使用头戴麦克风记录了每个说话人的近场音频信号(Ali-near),并确保只转录对应说话人自己的语音。同时对于阵列采集的多通道远场信号,我们还采用了CDDMA Beamforer[7]产生了相应的单通道增强数据(Ali-far-bf)。同时,为了提高本文所使用的语音分离模块的性能,我们使用Train-Ali-near模拟了50小时的带有说话人重叠的音频Train-Ali-simu。
SOT ASR模型是直接使用Train-Ali-far-bf、Train-Ali-near和Train-Ali-simu训练。对于前端和后端联合优化模型,我们分别用Train-Ali-simu和Train-Ali-near预训练分离模块和ASR模块,然后使用Train-Ali-far-bf数据进行微调,并使用ASR损失函数更新整个模型的参数进行联合训练。
评价指标
我们在实验中使用了两个评价指标,即说话人无关字符错误率(SI-CER)和说话人相关字符错误率(SD-CER)。SI-CER被设计用来计算多说话人ASR任务的性能,忽略说话人标签。而SD-CER不仅需要识别多个说话人对应的文本,同时还需要确定每个文本属于具体的哪个说话人。
不同SA-ASR方法的对比
如表1所示,我们在AliMeeting的Eval和Test集上评估了三种SA-ASR方法。我们将第一行SOT模型基于SI-CER评测的结果作为下面基于SOT的SA-ASR方法的SD-CER评测结果的topline,也就是假设SOT的每个输出token都与正确的说话人匹配。从表1中我们可以看到,我们提出的WD-SOT方法优于FD-SOT方法,在Eval和Test集上分别实现12.2%(41.0% -> 36.0%)和9.6%(41.2% -> 37.1%)的相对SD-CER降低。与基于SOT的SA-ASR模型相比,我们提出的TS-ASR模型实现了最低的SD-CER。TS-ASR(CRN)方法在Eval和Test集上的SD-CER分别为32.5%和35.1%。


表1  各种模块化的SA-ASR方法在Eval和Test集上的结果(%)



针对WD-SOT方法的各种策略对比
如表2所示,我们进一步比较了各种策略对于WD-SOT方法的效果。WD-SOT的第一行结果是只使用了Train-Ali-far-bf的真实抄本进行训练。为了提高模型的鲁棒性,我们在训练集中加入了SOT的预测输文本,该方法使得模型的SD-CER从39.1%降到37.9%,显著提升了模型的性能。当WD-SOT使用自注意机制获取更多的上下文信息时,平均SD-CER相对降低2.9% (37.9% -> 36.8%),性能得到了显著提升。我们的WD-SOT方法是基于SOT的输出结果,所以SOT的识别结果会严重影响整个方法的性能。考虑到SOT中的分隔符可能存在位置偏移的问题,我们研究了分隔符预测精度对模型性能的影响。使用oracle真实标签的分隔符之后,整体性能从36.8%提高到36.3%,主要是测试集上SD-CER相对降低了2.5%(37.1% -> 36.2%)。


表2 WD-SOT方法的各种策略在Eval和Test集上的比较结果(%)



说话人日志结果对TS-ASR方法的影响
在TS-ASR方法中,我们需要确定当前预分割的句子中包含了哪几个说话人。我们可以通过两种方法得到这个信息,一种是直接利用真实标签中每个人的时间戳,第二种方法是利用说话人日志模型预测的结果。令人惊讶的是,我们使用第二种说话人日志模型预测的结果来获取每个句子包含的说话人信息,反而比使用真实标签获得的结果更好,Conformer和CRN两种前端的TS-ASR方法在Eval和Test集上SD-CER分别相对减少7.0%/8.2%(37.4%/35.3% -> 34.3%/31.9%)和2.5%/3.4%(35.6%/36.3% -> 34.2%/34.3%),如表3所示。通过对解码结果的分析,我们发现当目标说话人的语音时长较短的时候,比如就是简单的”嗯“”啊“的附和,目标说话人分离模块并不能很好的提取出对应说话人的表征,从而导致后端的ASR模块识别出其他人的干扰语音,进而导致大量的插入错误。与该误识别导致的大量插入错误相比,忽略说话人日志模型预测的短时语句导致的删除错误反而更少。基于这一发现,本文进一步研究了删除说话人日志结果中不同长度的最短语句对于TS-ASR方法的影响。从表3中我们可以看出,两种不同前端结构的TS-ASR模型在删除持续时间小于0.5秒的说话人日志预测语句时都达到了最佳效果。


表3 TS-ASR方法删除不同长度的最短语句在Eval和Test集上的比较结果(%)


联合训练对TS-ASR方法的影响
不同优化策略下Conformer和CRN两种不同前端的TS-ASR方法的比较结果如表4所示。其中前端分离模块使用Train-Ali-simu数据进行预训练,后端ASR模块使用Train-Ali-near数据进行预训练。单独优化策略和联合优化策略的区别在于使用Train-Ali-far-bf数据对整个模型进行微调时,是否使用ASR损失函数更新前端分离模块。根据表4的结果, Conformer和CRN两种不同前端的TS-ASR方法采用了联合优化策略之后,相比单独优化策略在在Eval和Test集上平均SD-CER分别相对降低了26.8%(47.4% -> 34.7%)和23.9%(45.1% -> 34.3%)。因而,我们可以得出结论,联合优化策略可以使前端模块更适合于后端ASR,减少目标说话人分离带来的失真对于后端ASR的损伤。


表4 TS-ASR方法的单独和联合优化策略在Eval和Test集上的比较结果(%)



4. 参考文献
[1] N. Kanda, Y. Gaur, X. Wang, Z. Meng, and T. Yoshioka, “Serialized output training for end-to-end overlapped speech recognition,” in Proc. INTERSPEECH. ISCA, 2020, pp. 2797–2801.
[2] F. Yu, S. Zhang, Y. Fu, L. Xie, S. Zheng, Z. Du et al., “M2MeT:The ICASSP 2022 multi-channel multi-party meeting transcription challenge,” in Proc. ICASSP. IEEE, 2022.
[3] F. Yu, S. Zhang, P. Guo, Y. Fu, Z. Du, S. Zheng, L. Xie et al.,“Summary on the ICASSP 2022 multi-channel multi-party meeting transcription grand challenge,” in Proc. ICASSP. IEEE, 2022.
[4] I. Medennikov, M. Korenevsky, T. Prisyach, Y. Khokhlov, M. Korenevskaya et al., “Target-speaker voice activity detection: a novel approach for multi-speaker diarization in a dinner party scenario,” in Proc. INTERSPEECH. ISCA, 2020, pp. 274–278.
[5] A. Gulati, J. Qin, C.-C. Chiu, N. Parmar et al., “Conformer: Convolution-augmented transformer for speech recognition,” in Proc. INTERSPEECH. ISCA, 2020, pp. 5036–5040.
[6] K. Tan and D. Wang, “A convolutional recurrent neural network for real-time speech enhancement,” in Proc. INTERSPEECH. ISCA, 2018, pp. 3229–3233.
[7] W. Huang and J. Feng, “Differential beamforming for uniform circular array with directional microphones.” in Proc. INTERSPEECH. ISCA, 2020, pp. 71–75.


相关链接

ASLPer,公众号:语音之家论文分享丨NPU-ASLP实验室将携14篇论文参加语音旗舰会议INTERSPEECH2022