Alexa推出新语音识别系统能使准确率提升9.5%
原创6 years ago
Alexa推出新语音识别系统能使准确率提升9.5%

亚马逊Alexa部门的研究人员最近发布了两篇关于语音识别的论文,远程语音识别的频域多声道声学模型和远程语音识别的多几何空间声学模型,(这两篇论文将于下月在布莱顿举行的第44届ICASSP国际声学、语音与信号处理会议上发表)。论文中他们提出了…

10 0 0
语音识别建模新思路,教你巧用RNN-Transducer
原创6 years ago
语音识别建模新思路,教你巧用RNN-Transducer

导读 基于联结时序分类(CTC)的声学模型不再需要对训练的音频序列和文本序列进行强制对齐,实际上已经初步具备了端到端的声学模型建模能力。 但是CTC模型进行声学建模存在着两个严重的瓶颈,一是缺乏语言模型建模能力,不能整合语言模型进行联合优化…

9 0 0
语音识别大杀器:详解Seq2Seq模型在语音识别中的应用
原创6 years ago
语音识别大杀器:详解Seq2Seq模型在语音识别中的应用

全文导读 对于一些自然语言处理任务,比如聊天机器人,机器翻译,自动文摘等,传统的方法都是从候选集中选出答案,这对素材的完善程度要求很高,随着最近几年深度学习的兴起,国外学者将深度学习技术应用与自然语言的生成和自然语言的理解的方面的研究,并取…

96 0 0
语音合成的速度如何提升400%?
原创6 years ago
语音合成的速度如何提升400%?

全文导读 阿里在曾提出一种语音合成系统因其基于深度前馈序列记忆网络,在达到与基于双向长短时记忆单元的语音合成系统一致的主观听感的同时,合成速度是后者的400%,但是模型大小只有后者的四分之一,这对于内存占用和计算效率非常敏感的端上产品环境是…

22 0 0
使用 TensorFlow Lite 在嵌入式端部
转载6 years ago
使用 TensorFlow Lite 在嵌入式端部

1、背景 热词唤醒 (Keyword Spotting) 往往是用户对语音交互体验的第一印象,要做到准确快速。因此热词检测算法要同时保证高唤醒率和低误唤醒率,能够准确地区分热词和非热词的音频信号。主流的热词检测方法,通常使用深度神经网络来从…

22 0 0
Towards End-to-End Speech Reco
转载6 years ago
Towards End-to-End Speech Reco

这是一篇谷歌语音团队在2018 interspeech上分享。ppt很长,大概180页左右,讲述了谷歌团队如何从CTC、RNN-T、LAS一步一步趟坑过来,然后把LAS做成谷歌线上产品。非常敬佩这个强大的团队,特别感谢他们的分享,这里分享给…

90 0 0