曾几何时,个人搭建语音识别系统是一件非常复杂的系统工程,需要涉及到语音识别算法、服务端开发、网络通信、前端开发等技术,个人开发者很难全栈掌握,甚至很难熟练的使用这些技术。


wenet python binding
流式和非流式识别:既可支持流式识别,亦可支持非流式识别。 模型库:内置了模型中(wenetspeech)英(gigaspeech)文模型,开箱即用。支持用户使用自己基于 wenet 训练的模型,也支持加载用户训练并编译好的语言模型。 热词功能:支持用户自定义热词。 时间戳功能:支持识别结果中可以返回时间戳信息。 长语音识别功能:支持长语音的识别。 N-best功能:支持返回最好的 N 个识别结果。
gradio
gradio 是一个开源的 python 包,其口号是Build & Share Delightful Machine Learning Apps,支持研究人员快速地为其深度学习模型生成可视化接口。目前 gradio 已经在行业内广泛应用,如 huggingface 中直接内置支持 gradio。关于 gradio 的介绍详见gradio 论文[4]。
一个典型的 gradio 的应用如下图所示,可以看到,用少量的代码我们就可以实现模型输入、输出的可视化。

gradio 有效的解决了服务端开发、网络通信、前端开发等问题,并提供了简单统一的接口。
参考资料
[1]wenet web runtime: https://github.com/wenet-e2e/wenet/tree/main/runtime/web
