文章来源于音频语音与语言处理研究组,作者魏坤
语音识别(ASR)任务被广泛应用在车载、家居、会议等场景。对话语音识别(Conversational ASR)是ASR领域的一项重要工作,旨在将自然产生的对话语音转录成文本[1],这种场景在语音识别任务中出现频率较高,比如客服质检场景。优化对话语音识别的性能是语音识别任务的一个重要的研究方向,而利用上下文即语境(Context)信息是优化包括对话在内的长语音识别性能的一种有效方法[2]。
对话语音识别是西工大音频语音与语言处理研究组(ASLP@NPU)的重点研究方向之一,近期针对对话语音特点有效利用的论文已发表在ICASSP2022上[1]。近期,西工大音频语音与语言处理研究组(ASLP@NPU)和腾讯CSIG智能平台产品部最新合作的论文 “Leveraging Acoustic Contextual Representation by Audio-textual Cross-modal Learning for Conversational ASR” 被语音研究顶级会议Interspeech 2022接收。在文章中,我们引入了一个跨模态的表征提取器,它有效地利用了基于预训练的语音和语言模型来进行跨模态的特征提取,通过直接提取和利用历史语音的文本表征信息,避免了直接利用历史解码结果导致的误差传递。具体而言,系统由两个模态级的编码器和一个跨模态的编码器组成,前者用于分别提取语音和文本的特征表征,后者则用于学习语音和文本之间的相互依赖关系。在训练时,我们随机mask每个模态输入序列的部分token,并在跨模态编码器上对被mask的模态或者token进行预测。通过该方法使模型学习到每个模态内部以及不同模态之间的相互关系。最后,我们将对话中的历史语音送入跨模态表征提取器,并将生成的特征表示送入语音识别的解码器中,以融入历史的语音信息到当前的解码任务中来。我们在多个数据集上验证了该方法的有效性;在MagicData数据集上,本文方法获得了16%的相对CER下降。

论文题目:Leveraging Acoustic Contextual Representation by Audio-textual Cross-modal Learning for Conversational ASR
论文原文:https://arxiv.org/abs/2207.01039
图1 发表论文截图

图2 扫码直接看论文
对话语音识别(Conversational Speech Recognition)是语音识别(ASR)领域的一项重要工作,它旨在将自发的对话语音转录成文本[1],服务于智能客服、客服质检、信息挖掘等任务。利用对话语境(context)是优化对话ASR[2]性能的一种有效方法。以往的研究多从对话的识别结果获取语境信息,比如利用长上下文语言模型[3]、重打分模型[4]、以及其他方案[5]。对话语音识别是西工大音频语音与语言处理研究组(ASLP@NPU)的重点研究方向之一,近期针对对话语音特点有效利用的论文已发表在ICASSP2022上[1],具体如下推文。
在真实的语音识别的过程中,我们无法获取到真实的上文文本,而只能使用之前的识别结果当作历史信息的输入。这样一来,在利用历史信息的同时,我们也会将上文的识别错误引入到当前的句的解码过程中来。直接利用前文的语音来作为前文的历史信息输入是一个比较直观的想法,但直接增加输入语音的长度或者简单利用注意力机制的方法,提取出的特征反而会对当前句的识别结果带来太多的干扰信息,如说话人和噪音等。因此,本文利用跨模态表征学习从语音中提取出语言表征并剔除对语音识别没有帮助的干扰信息,而后将提取出的表征用到基于语境的语音识别任务中。同时,大规模的无标注数据的利用有效地提升了预训练模型的表征能力。本文提出了一种更有效的方法利用语境信息,服务于对话语音识别。我们引入了一个跨模态的表征提取器,它有效地利用了预训练的语音和语言模型,提取出的表征作为利用语境的对话ASR的一个输入。这个跨模态的表征提取器由预训练好的Wav2Vec2.0、RoBERTa-wwm和一个更高级别的跨模态编码器组成,预训练模型提取各个模态的高维隐层表示,跨模态编码器则学习语音和文本特征间的表征关系,建立模态间互相表示的能力。我们随机mask输入序列的某部分或者整个模态的输入序列,通过预测被掩蔽部分的内容,来学习模态信息间的相互依赖。之后,我们使用额外的src attention layer将语境表征信息引入到语音识别Conformer模型的解码器中,从而使语境的表征信息能够在当前句的识别过程中得到利用。
图3展示了整体架构。本文使用跨模态表征提取器从语音中提取语境表征信息。该对话ASR系统采用两阶段的方式进行训练,在第一阶段,训练如图4所示的表征提取器。在图3中,图4的语境提取器被命名为Acoustic Extractor。音频表征和文本表征分别使用语音编码器和文本编码器从成对的语音和转录文本中生成。然后,我们使用跨模态编码器来获取统一的语境跨模态表征。表示提取器使用多任务学习学习成对语音和文本之间的相关性。在第二阶段,我们舍弃多模态表征提取器中的文本编码器。提取器从语音中学习语境表示。在训练和测试ASR模型时,我们通过注意机制将语境表示集成到ASR模块的解码器中。下面将详细描述每个组件。

图3 整体架构

图4 跨模态特征提取器构
语境表征提取器:语境表征提取器由语音编码器、文本编码器和跨模态编码器组成。语音编码器和文本编码器分别是预训练好的Wav2vec2.0模型和RoBERTa-wwm-ext模型。跨模态编码器(CME)由3层transformer blocks组成。编码预训练模型输出的声学表征A和文本表征T:
我们使用字符级和模态级的loss来训练跨模态编码器。在字符级loss中,我们分别mask30%的语音和文本序列,对于文本,学习mlm loss:对于语音,为了更好地学习语音的连续性表征,我们学习mask前后句子序列之间的偏差,试图让模型学习到被掩蔽的部分内容的信息:与此同时,我们使用了模态级别的CTC loss来学习模态级掩蔽后两个输入序列之间的关系。融合语境信息的解码器模块:得到了上述的跨模态编码器之后,我们将历史的语音信息混合空白文本序列送入编码器,以得到当前句语音和历史语音的语境表征:
然后我们将表征进行拼接,并通过一个额外的注意力层将这些特征送入decoder:解码器最后一层的输出通过softmax函数来预测输出概率。
数据集:我们在三个普通话数据集上验证了本文方案,分别是HKUST(200小时)、Datatang(350小时)和MagicData(160小时)。使用80维对数mel filterbank (fbank)声学特征作为Conformer编码器的输入特征。多模态语境编码器的输入是原始音频序列。我们使用SpecAugment在速度比为0.9、1.0、1.1的情况下进行扰动,从而增强ASR模型的鲁棒性。为了有效地利用Wav2vec2.0模型,我们将采样率为8kHz的语音数据上采样到16KHz,然后送入语境表示提取器进行特征的提取。实验:表1中展示了我们提出的方法的结果。与第1行baseline相比,本文提出的语境相关ASR模型实现了16%的相对CER降低,并优于基本的Conformer模型和CVAE模型。
表1 不同方法的CER比较

为了进一步验证本文方法是否能够从语音中学习文本表征信息,我们与加外部语言模型的方案(ExtLM)进行了比较。从表1第1行和第2行的结果可以看出,Transformer语言模型可以提高基线ASR模型的识别精度。但是,如第3行和第4行所示,Transformer语言模型在采用本文方法(AcousticCur)后没有对ASR系统提供帮助。类似的结果在第5行和第6行也有展示。总体结果表明,我们的编码器已经获得了丰富的文本信息,在引入语境表征后,ASR模型可以减少对外部语言模型的依赖。历史信息长度对模型的影响:用于提取语境表征的历史语音长度和位置通常会影响ASR模型的性能。为此,我们进一步研究了它们对HKUST和MagicData数据集的影响。
表2 历史信息长度和位置的比较

从表2可以发现,越接近当前句子,对提高当前句子的识别准确率越有帮助。但是,同时输入前两句的文本特征并不能获得更好的效果,这可能是由于解码器无法从更长的历史信息中学习到合适的关注点。
本文提出了一种跨模态表征提取器,用于从语音中学习语境信息,并通过注意机制将其用于对话ASR。跨模态表征提取器由两个预训练的单模态编码器Wav2vec2.0和RoBERTa和一个跨模态编码器组成。从当前和历史的语音中提取的文本表征被送入到ASR的解码模块。本文方法在MagicData、DDT和HKUST数据集上最高可获得16%的CER降低。[1] Wei, Kun, Yike Zhang, Sining Sun, Lei Xie, and Long Ma. "Conversational Speech Recognition by Learning Conversation-Level Characteristics." ICASSP. IEEE, 2022.[2] Xiong, Wayne, Jasha Droppo, Xuedong Huang, Frank Seide, Michael L. Seltzer, Andreas Stolcke, Dong Yu, and Geoffrey Zweig. "Toward human parity in conversational speech recognition." IEEE/ACM Transactions on Audio, Speech, and Language Processing 25.12 (2017): 2410-2423.[3] Kim, Suyoun, Siddharth Dalmia, and Florian Metze. "Cross-Attention End-to-End ASR for Two-Party Conversations." INTERSPEECH. 2019.[4]Irie, Kazuki, Albert Zeyer, Ralf Schlüter, and Hermann Ney. "Training language models for long-span cross-sentence evaluation." ASRU. IEEE, 2019.[5] Chiu, Shih-Hsuan, Tien-Hong Lo, Fu-An Chao, and Berlin Chen. "Cross-utterance Reranking Models with BERT and Graph Convolutional Networks for Conversational Speech Recognition." APSIPA ASC. IEEE, 2021.[6] Masumura, Ryo, Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, and Shota Orihashi. "Hierarchical transformer-based large-context end-to-end asr with large-context knowledge distillation." ICASSP. IEEE, 2021.[7] Baevski, Alexei, Yuhao Zhou, Abdelrahman Mohamed, and Michael Auli. "wav2vec 2.0: A framework for self-supervised learning of speech representations." Advances in Neural Information Processing Systems 33 (2020): 12449-12460.[8] Bianchi, Federico, Silvia Terragni, and Dirk Hovy. "Pre-training is a Hot Topic: Contextualized Document Embeddings Improve Topic Coherence." ACL. 2021.