请问现在工业上用传统的技术多还是端到端的技术多啊?
问答4 years ago
请问现在工业上用传统的技术多还是端到端的技术多啊?

目前来说这两种都有。但是现在有一种趋势,这种趋势大致是从去年开始的,就是从传统的混合框架迁移到端到端的框架上面去。有一些公司研究的比较快或者说技术迭代的比较快,已经完成迁移了;有一些公司还在验证或者说迁移的过程中,可能再过一两年基本上大部分…

72 0 0
目前WeNet的时间戳方案不太准确(一是静音的判断不准确,二是字与字的时间戳是连着的,无论中间静音有多大),请问有什么方案可以提高时间戳的准确度吗?
问答4 years ago
目前WeNet的时间戳方案不太准确(一是静音的判断不准确,二是字与字的时间戳是连着的,无论中间静音有多大),请问有什么方案可以提高时间戳的准确度吗?

时间戳是根据CTC判断,本身CTC在这方面有一定的滞后性或者漂移,这个是导致时间戳不准确的一个原因。在后处理时,初版WeNet考虑到字与字之间的时间戳是连着的这样的问题,在最新版的WeNet已经修正合并到master的分支中。

75 0 0
热词增强和热词唤醒在实现上的区别是什么?
问答4 years ago
热词增强和热词唤醒在实现上的区别是什么?

热词唤醒即为Hot Word或者Wake-up Word,是一个轻量级的关键词检测,通常部署在端侧的设备上,如音响、手机等。它占用资源很小,网络规模一般在几十k到几百k。 而热词增强是语音识别中的一项技术,它对一些特定场景中特定名词做实时的…

63 0 0
当前最新的比较好的算法好像也就是 conformer了,还有比这更好的吗,如果找不到更好的算法,应该从哪些方面来优化预训练模型呢?
问答4 years ago
当前最新的比较好的算法好像也就是 conformer了,还有比这更好的吗,如果找不到更好的算法,应该从哪些方面来优化预训练模型呢?

Conformer可以认为是Transformer的一个变种,Transformer在全局建模方面有比较好的性能。因为语音识别模型的性能不能只关注WER,还需要关注模型的大小和延迟,如果想要优化模型也可以从这两方面入手,因为对于模型的落地化…

48 0 0