上一期我们发布了最终版的 Zipformer 模型及其在 LibriSpeech 上表现,为了证明模型不是针对 LibriSpeech 的调优, 本期将更新 Zipformer 在 WenetSpeech 数据集上的结果,本文不涉及任何模型细节的描述,只是更新结果及发布模型,Demo 视频见文末。

模型配置

本文的结果都出自 Zipformer 中等大小的模型(即 Icefall librispeech recipe 下的默认配置),建模单元为单字 (词表为 5537),最终模型参数量约为 76M。
更多代码细节请参考 PR :
https://github.com/k2-fsa/icefall/pull/1130

非流式模型结果

注:模型训练过程中使用了 3 倍扩增,即可以认为这里的 Epoch 为未扩增的 1/3


与现有开源工具结果的比较

注:数据来源为 WenetSpeech 原论文,Zipformer 结果为 epoch=12, beam search 结果。


与 Icefall 中 reworked conformer 模型的比较


关于 blank-penalty

实验中我们发现解码时对 blank 做一些惩罚可以提高识别准确率,这一现象在我们之前的 reworked comformer 模型中并不出现。下表为 epoch=12, greedy search 的结果。

模型下载链接:

https://huggingface.co/pkufool/icefall-asr-zipformer-wenetspeech-20230615

流式模型的结果

最佳结果


其他时延配置的结果

下表为 epoch=12 的 Greedy search 结果,blank-penalty=1.5


跟 reworked conformer 结果的比较

模型下载链接:

https://huggingface.co/pkufool/icefall-asr-zipformer-streaming-wenetspeech-20230615

总结

Zipformer  模型在大数据量 (10000小时)中文数据集上也取得了优异的结果,数据显示 Zipformer 在 WenetSpeech 数据集的识别错误率上优于现有的系统,这表明 Zipformer 是一个完全胜任工业级应用的高效模型。