文章来源于音频语音与语言处理研究组,作者魏坤

对话场景是语音识别(ASR)应用中出现频率很高的一种场景,比如智能客服、客服质检等。在对话语音识别(Conversational ASR)中,如何将语音或识别抄本的有用上下文信息引入进来,是一个值得关注的研究工作[1]。

对话语音识别是西工大音频语音与语言处理研究组(ASLP@NPU)的重点研究方向之一,前期针对对话语音特点有效利用的论文已发表在ICASSP2022[2]和Interspeech2022[3]上(如下推文)。近期,实验室和马上金融合作的论文 “Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism” 被语音研究顶级会议Interspeech2022接收。文章提出在一个基于Transformer的使用注意力机制进行显式建模的端到端对话语音识别框架。在编码器中,我们保留了之前对话中的上文信息,并通过上下文感知残差注意力机制将这些历史信息融入到当前的输入中。之后,我们使用一个融合历史文本信息的条件解码器进行语音识别的解码,从而在解码器端利用对话中的历史信息。实验结果表明,在多个中英文对话/演讲数据集上,该方法均能带来有效收益。


基于对话特征建模的对话语音识别

魏坤,公众号:语音之家论文推介:基于对话特征建模的对话语音识别

对话语音识别中基于文本-语音跨模态方法学习长语音表征

魏坤,公众号:语音之家论文推介:对话语音识别中基于文本-语音跨模态方法学习长语音表征



论文题目:Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism
作者列表:魏坤,郭鹏程,蒋宁
论文网址:https://arxiv.org/abs/2207.00883


图1 发表论文截图



图2 扫码直接看论文

1、背景动机
上下文(Context)信息在长语音ASR中起着重要的作用,特别是在主题集中的对话等场景中,语义相关的词或短语经常会重复出现[4]。传统的声学-语言混合ASR模型通常依赖于丰富的语言模型来建模上下文信息[5],同时,也有将上下文拼接后作为长语音输入输出的工作[6]。Transformer及其变种作为当前最为流行的基于注意力机制的端到端模型,在包括ASR等众多任务上表现出优异的性能。然而由于自注意的计算和存储代价是输入序列长度的二次多项式级别,Transformer难以处理长序列,例如上下文拼接后的输入。
本文提出了一个新的基于Transformer的端到端语音识别框架。我们利用跨句信息来增强对话语音识别系统的性能,参照[7],我们在编码器中加入了一个残差注意力模块,能够加快模型收敛速度,并很好地模拟每个输入序列中的长时序的全局依赖性。此外,为了进一步传递前一句的context信息,我们还提出了一种新的context感知的残差注意力机制,该模块通过注意力分数来传递句间context信息。对于解码器部分,我们使用一个额外的注意力模块来学习更多的句间信息。通过使用上述方法,我们在Transformer ASR模型中引入了句间上下文信息。在两个对话标准数据集HKUST和Switchboard、一个演讲的标准数据集TEDLIUM2和一个内部对话数据集DATATANG-dialog上证明了我们的方法的优越性。在实验中字错误率(CER)明显降低,而同时计算成本和模型复杂度的增加几乎可以忽略。


2、方案介绍
残差注意力机制
残差多头注意力(ResMHA)使用Post LN策略,将每个MHA或FFN模块末端的输出归一化。ResMHA通过注意打分连接相邻层的MHA,如图3 (a)所示。形式上,它以前一层的注意分数Prev作为条件输入,计算当前层MHA的注意分数。其中,Prev是Softmax操作之前的注意评分:

其中,headi表示第i个注意力头。和headi一样,Previ是Prev的一部分。然后这些与MHA头部对应的残差注意力分数,将通过残差注意力(ResAttn)模块加入到当前的注意力计算中:

我们将其应用于基于Transformer的语音识别上,加快了模型在训练中的收敛速度,并提高了最终的语音识别准确率。


图3 残差注意力机制结构图


基于语境信息的残差注意力机制
上下文感知的残差注意力机制是在残差注意力的基础上设计的,它增加了一个跳转来连接如图3 (a)所示的多头注意力(multi-headed attention, MHA)模块的相邻层。为了捕捉不同连续话语的上下文信息,直观的思路是简单地将之前的输入与当前的输入连接到编码器。虽然这种方法可以带来轻微的性能提升,但它也会面临较大的内存开销增量和计算复杂度。因此,我们提出了一种上下文残差注意力机制,它将前一句的注意隐藏状态按时间顺序转移到当前句中,在训练过程中直接包含更多的上下文信息。图3 (b)显示了我们方法的细节。当识别第m个句子时,我们将在对话中使用Xm和前面的句子Xm−1的注意力信息,上下文感知的残差注意力机制(CtxResAttn)可以表述为:

条件解码器
Transformer的解码器包含大量的语言相关的信息。在这一部分,我们将描述本文提出的条件解码器,它通过迭代的注意力模块将文本embedding添加到当前的输入向量。如图4所示,我们递归地得到前一个文本的词嵌入向量信息,然后将其与当前文本的嵌入向量合并。假设我们在识别对话中的第k个句子时回顾n个历史句子,则对应的目标文本Ym-n和Ym-n+1将由如下公式计算:

然后,历史信息将通过一个线性层传递到当前句子中来:

最终,通过递归计算如下公式,我们可以得到基于前n句历史信息的识别结果:

通过条件解码器,我们将前n句的文本信息以不同的权重加入到当前句子中。


图4 条件解码器架构



3、实验验证
数据集
如表所示,我们使用了HKUST、Switchboard、DATATANG和TED-LIUM2四个数据集进行实验验证,数据集详情如表1所示。


表1 数据集详情



结果与分析
结果如表2所示。对于每个数据集,该方法的使用较基线降低了错误率,相对错误率降低达14%,DATATANG和TED-LIUM2数据集上的效果更为明显。我们分析认为,这两个数据集具有更强的主题一致性,从而增强了模型对特定领域对应关键词的学习能力。


表2 提出方法的实验结果



I-vector对实验结果的影响
先前的研究表明,简单地将与说话人相关的特征(如i-vector)与声学特征连接起来,有利于会话ASR。i-vector可以引入额外的说话人信息,减少训练集和测试集之间的说话人不匹配现象。我们在DATATANG数据集上进一步进行了研究,发现当引入i-vector时,性能可以得到进一步的提升。


表3 说话人信息对识别结果的影响




4、总结
本文基于Transformer,设计了有效利用历史信息的对话语音识别框架。首先设计了上下文感知的残差注意力编码器,在增加较少参数量的前提下获得了上文信息。此外,本文设计的条件解码器从之前的语音中提取文本信息,提高了模型捕捉长上下文信息的能力。在四个长语音数据集上的实验证明了该方法在对话ASR任务上的可以有效提高语音识别的性能。

5、参考文献
[1] Xiong, Wayne, Jasha Droppo, Xuedong Huang, Frank Seide, Michael L. Seltzer, Andreas Stolcke, Dong Yu, and Geoffrey Zweig. "Toward human parity in conversational speech recognition." IEEE/ACM Transactions on Audio, Speech, and Language Processing 25.12 (2017): 2410-2423.
[2] Wei, Kun, Yike Zhang, Sining Sun, Lei Xie, and Long Ma. "Conversational Speech Recognition by Learning Conversation-Level Characteristics." ICASSP. IEEE, 2022.
[3] Wei, Kun, Yike Zhang, Sining Sun, Lei Xie, and Long Ma. "Leveraging Acoustic Contextual Representation by Audio-textual Cross-modal Learning for Conversational ASR." INTERSPEECH. 2022.
[4] Kim, Suyoun, Siddharth Dalmia, and Florian Metze. "Cross-Attention End-to-End ASR for Two-Party Conversations." INTERSPEECH. 2019.
[5] Xiong, Wayne, Wu Lingfeng, Zhang Jun and Stolcke Andreas. "Session-level language modeling for conversational speech." EMNLP. 2018.
[6] Masumura R, Makishima N, Ihori M, et al. "Hierarchical transformer-based large-context end-to-end asr with large-context knowledge distillation." ICASSP. IEEE, 2021.
[7] He, Ruining, Ravula Anirudh, Kanagal Bhargav and Ainslie  Joshua . "RealFormer: Transformer Likes Residual Attention." ACL-IJCNLP 2021. 2021.