WenetSpeech 家族发展史,一场前赴后继的饕餮盛宴
WenetSpeech 家族就像是一场前赴后继的饕餮盛宴。前赴后继是指 WeNet 社区的小伙伴们在数据的投入上前赴后继,不断探索新的边界,你方唱罢我登场;而饕餮盛宴,不是一道菜,而是源源不断的菜品,是社区给开发者、公司、研究人员不断的献礼…
45 0 0
WenetSpeech 家族就像是一场前赴后继的饕餮盛宴。前赴后继是指 WeNet 社区的小伙伴们在数据的投入上前赴后继,不断探索新的边界,你方唱罢我登场;而饕餮盛宴,不是一道菜,而是源源不断的菜品,是社区给开发者、公司、研究人员不断的献礼…
本文介绍Wenet中的Cache 标准的forward是整个序列进行计算,但是在流式推断时,需要chunk级别的forward,因此需要引入cache的概念,即当前chunk的进行前向计算时,需要拿到上次前向的一些结果作为输入。 什么是ca…
本文介绍了Wenet模型实现时使用的mask技巧 在Wenet的模型实现时,涉及到一些论文中没有描述细节,比如: 一个batch内的输入帧数不等长,进行padding的部分如何处理。 一个batch内标注文本不等长,进行padding的部分…
本节介绍基本的端到端语音识别涉及的重要概念 语音识别任务中,输入是语音,输出是文本,两个序列不等长,但是时序上有同步性。传统语音识别通过HMM来建模输出和输入不等长和时序同步性,并对音素,词典,语言模型分层次建模。 在传统的HMM框架里,声…
前文介绍了端到端识别的基本概念,本文介绍Wenet中模型的设计与实现。 Wenet的代码借鉴了Espnet等开源实现,比较简洁,但是为了实现基于chunk的流式解码,以及处理batch内不等长序列,引入的一些实现技巧,比如cache和mas…