端到端 (End-to-end, E2E) 模型得益于其简洁的模型结构和优异的模型性能,已经成为各种序列到序列任务中的主导模型,如机器翻译 (Neural machine translation, NMT) 、语音识别 (Automatic speech recognition, ASR) 等。然而,这些模型大多遵循自回归 (Autoregressive, AR) 的策略,即利用已经生成的字符和输入序列为条件,进而预测目标字符。这种运算方式使得模型很难进行并行预测,从而带来巨大的推理延迟。相比于 AR 模型,非自回归 (Non-autoregressive, NAR) 模型致力于摆脱这种时序依赖性,从而进行并行预测。NAR 模型的核心想法是在一个恒定的迭代次数内预测整个目标序列,该迭代次数应远小于目标序列的长度。


西工大音频语音与语言处理研究组(ASLP@NPU)一直关注 E2E ASR 、NAR ASR 方面的研究工作,并积极参与到各种开源 E2E ASR 工具包的开发中,例如 ESPnet [1],WeNet [2] 等。


诸如会议的多人说话场景是语音识别的一个重要挑战,因为这种场景中会有多人说话的语音,说话人方式是自由对话式的,且存在多人同时说话的语音交叠情况。语音通常通过和说话人有一定距离的麦克风阵列采集,因此存在语音衰减、房间混响、噪声干扰等情况。如果会议中有扩音和放音设备,同时会议中有远程多方接入,条件会更为复杂。在不考虑语音前端的情况下,传统的多说话人识别分为说话人纪要(speaker diarization)和语音识别两个主要模块,说话人纪要任务提供说话人的时间标签,其中语音识别模块通常只针对默认含有一个说话人的语音进行识别得到文本。




近期,由实验室与卡耐基梅隆大学 (Carnegie Mellon University, CMU) 合作的论文 "Multi-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain" 被语音研究顶级会议INTERSPEECH2021接收 [3]。该论文围绕诸如会议纪要场景的多说话人语音识别(Multi-speaker ASR),即存在说话人同时说话(speaker overlap)语音交叠的情况时,将多人说话场景中不同人的语音转为文字,说话人纪要和语音识别由一个端到端系统统一完成。


该方法将之前提出的条件链模型 (Conditional chain model) [4] 扩展到 NAR 多说话人语音识别任务中,通过利用多说话人混合语音输入和上一步估计得到的说话人条件特征(即上一步的预测结果),对每个说话人的抄本进行依次预测。每一个预测步骤中,使用一个基于 CTC 的 NAR encoder 进行并行运算。总的预测步数为语音中混合说话人的数目。在 WSJ0-Mix 和 LibriMix 两个开源数据集上的实验表明,该方法在略微增加延迟的情况下,优于其他 NAR 模型,分别得到 22.3% 和 24.9% 的词错误率 (Word error rate, WER)。此外,不同于传统 multi-speaker ASR 方法需要提前知道混合说话人的数目,该方法可以使用不同混合说话人数目的数据共同训练。通过引入混合说话人数目不同的数据,该方法在仅有 1/7 延迟的情况下,得到比基于permutation invariant training (PIT) 的 Conformer AR 模型更好的结果,在 WSJ0-2mix 和 WSJ0-3mix 测试集上分别取得 19.9% 和 34.3% 的 WER。


所有的实验代码公开在:

https://github.com/pengchengguo/espnet/tree/conditionalmultispk


现对该论文进行解读和分享:

论文题目:Multi-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain

作者列表:郭鹏程,常烜恺,Shinji Watanabe,谢磊

论文原文:https://arxiv.org/abs/2106.08595



发表论文截图



扫码直接看论文


背 景 动 机

非自回归 (Non-autoregressive, NAR) 模型相比于自回归 (Autoregressive, AR) 模型而言,它在各种序列到序列任务上不仅实现了推理计算的大量减少,并且兼顾了模型性能,实现了和 AR 模型相当的结果。NAR 模型最早是在机器翻译 (Neural machine translation, NMT) 任务上被提出来,它的核心想法是在一个恒定的迭代次数内完成整个目标序列的预测。这个迭代次数不受限于目标序列的长度,并且应该远小于目标序列的长度。受此启发,许多工作尝试将 NAR 模型应用于自动语音识别 (Automatic speech recognition, ASR) 任务,其中典型工作包括基于 connectionist temporal classification (CTC) [5,6] 和基于 masked language model 目标函数 [7,8]。


然而,上述工作主要是针对 ASR 这种序列到序列任务,这些方法很难被直接扩展到序列到多序列任务中,例如多说话人语音识别 (Multi-speaker ASR)。会议自动纪要是多说话人语音识别的一个典型场景。Multi-speaker ASR 旨在从多个说话人混合的语音信号中预测每一个说话人对应的文本。已有的工作大多侧重于 AR 模型而非 NAR 模型,例如基于 permutation invariant training (PIT) 的 Transformer 模型 [9]。




在这个工作中,我们尝试将之前提出的条件链模型 (Conditional chain model) [4] 扩展到 NAR 多说话人语音识别任务中。通过使用条件链模型,我们利用多说话人混合语音输入和上一步估计得到的说话人条件特征(即上一步的预测结果),对每个说话人的抄本进行依次预测。在每一个预测步骤中,使用一个基于 CTC 的 NAR encoder 进行并行运算。总的预测步数为语音中混合说话人的数目。由于 CTC 自身的条件独立性假设可能带来性能损失,我们还探索使用最近提出的 Conformer 模型 [10] 来捕捉局部和全局的声学依赖,并且引入额外的 intermedia CTC 损失函数 [11] 作为正则化函数。此外,相比于原始条件链模型 [4] 中使用 CTC 对齐结果作为 “硬” 说话人条件特征,我们提出使用 encoder 最后一层的隐层特征表示作为 “软” 条件特征,进而提供更多的信息。在 WSJ0-Mix 和 LibriMix 两个开源数据集上的实验表明,该方法在略微增加延迟的情况下,优于其他 NAR 模型,分别得到 22.3% 和 24.9% 的词错误率 (Word error rate, WER)。此外,不同于传统 multi-speaker ASR 方法需要提前知道混合说话人的数目,该方法可以使用不同混合说话人数目的数据共同训练。通过引入混合说话人数目不同的数据,该方法在仅有 1/7 延迟的情况下,得到比 PIT-Conformer AR 模型更好的结果,在 WSJ0-2mix 和 WSJ0-3mix 测试集上分别取得 19.9% 和 34.3% 的 WER。



Multi-speaker  ASR


在论文 [9] 中,Chang 等人提出了一个基于 Transformer 的端到端 multi-speaker ASR 模型。该模型的encoder 包括三部分:一个 mixture encoder,多个 speaker-dependent encoders 和一个 recognition encoder。给定一个混合语音 X = {x_1, ..., x_T} 和其对应的抄本 Y = {Y_1, ... , Y_J},其中 T 代表帧数,J 代表混合说话人的个数。Encoder 的输出可以表示为:


首先,公式 (1) 中的 mixture encoder 将输入特征编码为混合语音的隐藏表示 H。然后,J 个 speaker-dependent encoders 从混合表示中提取每个说话人的语音表示 H_j。接下来,recognition encoder 将每个说话人的语音表示映射到隐层 embedding G_j 中。CTC 目标函数被用来训练 encoder,并通过 PIT 确定最佳的 embedding 排列 π:


其中,Y^j 表示第 j 个真实抄本标签,P 表示所有可能的抄本标签排列。

在 encoder 之后,一个基于注意力机制的 decoder 用于预测所有识别结果:


由公式 (4) 得到的真实标签最优排列将用于计算 decoder 的交叉熵损失函数 (Cross entropy loss)。模型的总损失函数为:



结合 NAR Conformer CTC 模型和条件链的 Multi-speaker  ASR

Conformer encoder

Conformer encoder [10] 是一个多个 block 堆叠的结构,其中每个 block 包括一个多头自注意 (multi-headed self-attention, MHSA) 模块,一个卷积 (convolution, CONV) 模块和一对 Macaron-Net 结构的前向网络 (positionwise feedforward, FNN) 模块。在 MHSA 模块学习声学特征全局依赖的同时,CONV 模块有效的捕获局部相关性。由于 Conformer encoder 在不同端到端语音处理应用中均表现出优异性能,我们期望它能弥补 CTC 的建模能力,并提高系统性能。


Intermediate CTC 损失函数

Intermediate CTC (InterCTC) 损失函数 [11] 是一个简单并且有效的辅助损失函数。它的主要想法是从 encoder 网络中选择一个中间层 m (0< m < L),忽略网络后面的所有层。通过对 m 层计算 CTC 损失函数,可以使模型更依赖于底层而不是高层,进而对模型训练进行正则化约束。最后,我们模型的损失函数为:



条件链模型

下图是我们模型的整体结构:


不同于之前提到的传统 multi-speaker AR 模型,我们将 speaker-dependent encoders 替换为一个说话人条件链 (conditional speaker chain, CondChain) 模块,从而迭代式的预测每一个说话人的输出。CondChain 模块通过结合公式 (1) 得到的混合语音的隐层表示 H 和上一步提取的说话人的语言学表示 G_{j-1} 来预测当前说话人语音隐层表示:


其中,G_{j-1} 是上一步 recogition encoder 的输出。Embed 模块是一个全连接层,用来将 G_{j-1} 映射的声学子空间中。在第一步时,我们初始化一个全零的向量 (Init Cond.) 作为第零个说话人的语言学表示。此外,长短时记忆网络 (long short-term memory, LSTM) 有助于通过流动状态提供所有历史上的说话人语音隐层表示。通过这种设计,我们可以在每个步骤中成功地进行 NAR 计算,并且总的推理步骤是一个恒定的数字,相当于混合说话人的数量。此外,与其他 multi-speaker ASR 方法必须固定混合说话人数目不同,我们的模型可以利用不同混合说话人数目的数据进一步提高性能。下图算法概述了模型的训练过程。



实 验 验 证

我们分别在 WSJ0-Mix [12] 和 LibriMix [13] 两个开源数据集上进行了实验。所有的实验均基于 ESPnet [1] 工具包。

WSJ0-Mix 实验结果

表 1 为具体实验结果。为了与 NAR 方法进行公平的比较,端到端 AR 模型只使用了贪婪搜索进行解码。



对于基于 PIT 的 AR 模型室,PIT-Conformer (5) 显示出最好的性能,在WSJ0-2mix测试集上取得了22.4% 的 WER 结果。当比较 NAR 模型时,仅用 CTC 损失函数训练的 PIT-Transformer-CTC (6) 性能急剧下降 (50.3%)。毫无疑问,一个基于 CTC 的 encoder 网络很难同时对不同说话人的语音进行建模。当应用基于说话人条件链的方法时,模型 (7) 和模型 (8) 都比 PIT 模型好。通过结合单人和多人的混合语音,模型 (8) 进一步提升,其在 WSJ0-2mix 测试集上的 WER 为 29.5%。对于我们的 Conditional-Conformer-CTC模型 (9),我们探索了两种类型的条件特征,包括 “硬” CTC 对齐和 recognition encoder 输出的 “软” 隐层特征。这两种方法的结果都比上述模型好。在只增加了 0.07 秒延迟的情况下,应用 “软” 条件特征的模型取得了 24.4% 的 WER 结果。通过结合 InterCTC 损失函数,我们可以获得和 AR PIT-Conformer 模型 (5) 相近的结果,得到 22.3% 的 WER。然而,在结合了“软” 条件特征和 InterCTC 损失函数后,我们没有得到进一步收益。最后,我们还在混合说话人数目不同的数据上进行了实验,在仅有 AR 模型 (5) 1/7 延迟的情况下,提出的方法获得了比其他模型更好的结果,在 WSJ0-2mix 和 WSJ0-3mix 测试集上分别得到 19.9% 和 34.3% 的 WER。


此外,我们还进一步探究了模型对于不同说话人结果的输出顺序和该说话人语音长短之间的相关性。具体结果见下表。我们发现,在 2mix 数据下,只有 251/3000 个样本不遵循语音越长(相当于能量越大)越先输出的规律。




LibriMix 实验结果

表 2 为LibriMix上的实验结果。在 LibriMix 数据集上,我们可以观察到相同的趋势。Conditoinal-Conformer-CTC 模型在 dev 和 test 集上分别得到 24.5% 和 24.9% 的 WER,均优于其他 NAR 模型。




参 考 文 献

[1] S. Watanabe, T. Hori, S. Karita, T. Hayashi, J. Nishitoba, Y. Unno, N. E. Y. Soplin, J. Heymann, M. Wiesner, N. Chen et al., "ESPnet: End-to-end speech processing toolkit", INTERSPEECH, Hyderabad, India, Sept 2 - Sept 6, 2018, pp. 2207–2211


[2] Z. Yao, D. Wu, X. Wang, B. Zhang, F. Yu, C. Yang, Z. Peng, X. Chen, and L. Xie, "WeNet: Production oriented streaming and non-streaming end-to-end speech recognition toolkit", INTERSPEECH, Brno, Czech Republic, Aug 30 - Sept 3, 2021


[3] P. Guo, X. Chang, S. Watanabe, and L. Xie, "Multi-speaker ASR combining non-autoregressive Conformer CTC and conditional speaker chain", INTERSPEECH, Brno, Czech Republic, Aug 30 - Sept 3, 2021


[4] J. Shi, X. Chang, P. Guo, S. Watanabe, Y. Fujita, J. Xu, B. Xu, and L. Xie, "Sequence to multi-sequence learning via conditional chain mapping for mixture signals", NeurIPS, Vancouver, Canada, Dec 6 - Dec 12, 2020


[5] N. Chen, S. Watanabe, J. Villalba, and N. Dehak, “Listen and fill in the missing letters: Non-autoregressive Transformer for speech recognition”, arXiv preprint arXiv:1911.04908, 2019.


[6] W. Chan, C. Saharia, G. Hinton, M. Norouzi, and N. Jaitly, “Imputer: Sequence modelling via imputation and dynamic programming”, ICML, Vienna, Austria, Jul 12 - Jul 18, 2020, pp. 1403–1413


[7] Y. Higuchi, S. Watanabe, N. Chen, T. Ogawa, and T. Kobayashi, “Mask CTC: Non-autoregressive end-to-end ASR with CTC and mask predict", INTERSPEECH, Shanghai, China, Oct 25 - Oct 29, 2020, pp. 3655–3659


[8] Y. Higuchi, H. Inaguma, S. Watanabe, T. Ogawa, and T. Kobayashi, “Improved Mask-CTC for non-autoregressive end-to-end ASR”, ICASSP, Toronto, Ontario, Canada, Jun 6 - Jun 11, 2021, pp. 8363–8367


[9] X. Chang, W. Zhang, Y. Qian, J. Le Roux, and S. Watanabe, “End-to-end multi-speaker speech recognition with Transformer”, ICASSP, Barcelona, Spain, May 4 - May 8, 2020, pp. 6134–6138


[10] A. Gulati, J. Qin, C.-C. Chiu, N. Parmar et al., “Conformer: Convolution-augmented transformer for speech recognition”, INTERSPEECH, Shanghai, China, Oct 25 - Oct 29, 2020, pp. 5036–5040


[11] J. Lee and S. Watanabe, “Intermediate loss regularization for ctcbased speech recognition”, ICASSP, Toronto, Ontario, Canada, Jun 6 - Jun 11, 2021, pp. 6224–6228.

[12] J. R. Hershey, Z. Chen, J. Le Roux, and S. Watanabe, “Deep clustering: Discriminative embeddings for segmentation and separation”, ICASSP, Shanghai, China, Mar 20 - Mar 25, 2016, pp. 31–35.


[13] J. Cosentino, M. Pariente, S. Cornell, A. Deleforge, and E. Vincent, "LibriMix: An Open-Source Dataset for Generalizable Speech Separation", arXiv preprint arXiv:2005.11262, 2020