
2022年8月19日,由语音之家打造的AI语音技术相关的前沿论文成果分享平台—SH SSS(SH Symposium Series on Speech)第二期成功举办。本期是由安柯宇进行论文解读:《CUSIDE:分块、模拟未来、解码的流式语音识别新框架》。
下面是本次论文解读的回顾:
POSTER
为了在不损失识别精度的前提下实现低延迟语音识别,我们提出了一种基于分块、预测未来、解码(Chunking, Simulating future context and Decoding,CUSIDE)的低延迟语音识别框架。在该模型中,模型使用模拟的未来帧而不是真实未来帧作为未来信息,由此可以免除对未来信息的依赖,减小识别延迟。
题 目 Tittle:CUSIDE:分块、模拟未来、解码的流式语音识别新框架
期 刊 Journal & Comments:InterSpeech2022
作 者 Authors:安柯宇、郑华焕、欧智坚、向鸿雨、丁科、万广鲁
在现有的基于块的低延迟语音模型中,为了获取未来信息,模型必须等到一定数量的未来帧到达后再开始识别,这显著增加了识别延迟。目前已有一些研究对此进行了探索,例如Multi-Mode Transformer Transducer提出在训练时使用随机数量的下文,而在测试时根据时延需求选取特定长度的下文,对延迟比较敏感时选用较少数量的下文,对延迟不敏感时选用较多的下文。然而,Multi-Mode Transformer Transducer没有从根本上解决chunk模型对未来帧的依赖问题,为了达到较高的识别精度,模型仍需等待相当数量的未来帧。
为了在不损失识别精度的前提下实现低延迟语音识别,我们提出了一种基于分块、预测未来、解码(Chunking, Simulating future context and Decoding,CUSIDE)的低延迟语音识别框架。在该模型中,模型使用模拟的未来帧而不是真实未来帧进行识别,由此可以免除对未来信息的依赖,减小识别延迟。模拟帧使用一个合成器以流式的方式生成,该生成器由合成编码器和合成预测器构成,可以以无监督方式进行训练,不需要额外的标注信息。此外,我们还通过流式、非流式模型共享参数和联合训练等方法,减小了流式模型和非流式模型之间的性能差距。
该论文主要在Aishell-1数据集上进行了实验评测。声学模型是一个使用12层Conformer神经网络的CTC-CRF模型,基于CAT工具包实现。解码使用一个3gram WFST。chunk大小设置为400ms,历史帧和预测未来帧长度分别设置为800ms和400ms。CUSIDE与其他流式模型的结果对比见下表。
一般将latency定义为chunk的长度。表格中的Δ是rescoring所用的时间,一般在100ms以内。CUSIDE模型中额外的2ms代表了模拟未来帧所用的时间。可以看到,基于CTC-CRF的CUSIDE模型在低延时下取得了最好的识别准确率,4.79也是目前Aishell-1上流式模型的最好结果。需要说明的是,CUSIDE并不局限于CTC-CRF模型。不难看出,CUSIDE可以方便地用于其他语音识别模型,例如RNN-T和LAS。CUSIDE将于近期在CAT工具包开源发布,敬请关注!将cuside模型用于其他端到端模型,例如rnnt和attention based encoder decoder,将是本工作的一个延伸。
[1]. A. Gulati, C.-C. Chiu, J. Qin, J. Yu, N. Parmar, R. Pang, S. Wang, W. Han, Y. Wu, Y. Zhang, and Z. Zhang, “Conformer: Convolution-augmented transformer for speech recognition,” in Proc. INTERSPEECH, 2020, pp. 5036–5040.[2]. K. Kim, F. Wu, P. Sridhar, K. J. Han, and S. Watanabe, “Multi-Mode Transformer Transducer with Stochastic Future Context, in Proc. INTERSPEECH, 2021, pp. 1827–1831.[3]. J. Yu, W. Han, A. Gulati, C.-C. Chiu, B. Li, T. N. Sainath, Y. Wu, and R. Pang, “Dual-mode ASR: Unify and improve streaming ASR with full-context modeling,” in Proc. ICLR, 2021.[4]. Hongyu Xiang and Zhijian Ou, “CRF-based single-stage acoustic modeling with CTC topology,” in Proc. ICASSP, 2019, pp. 5676–5680.