Multi-token Prediction引领语音生成新范式:上海交大、蚂蚁集团联合发布语音交互大模型VocalNet
原创a year ago
Multi-token Prediction引领语音生成新范式:上海交大、蚂蚁集团联合发布语音交互大模型VocalNet

传统级联式语音交互系统通常采用"语音识别-大语言模型-语音合成"的串联处理流程,这种架构存在明显的时延累积和信息损耗问题。相比之下,语音交互大模型通过端到端的处理方式,将语音理解和语音生成能力深度融合到大语言模型中,从而实现高性能、低时延的…

16 0 0
语音合成突破:F5R-TTS首次实现非自回归模型的GRPO优化,零样本克隆性能显著提升
转载a year ago
语音合成突破:F5R-TTS首次实现非自回归模型的GRPO优化,零样本克隆性能显著提升

在人工智能技术日新月异的今天,语音合成(TTS)领域正经历着一场前所未有的技术革命。最新一代文本转语音系统不仅能够生成媲美真人音质的高保真语音,更实现了「只听一次」就能完美复刻目标音色的零样本克隆能力。这一突破性进展的背后,是大规模语音数据…

17 0 0
云知声 | 招聘语音合成算法研究员(北京)
转载a year ago
云知声 | 招聘语音合成算法研究员(北京)

云知声专注于物联网人工智能服务,拥有完全自主知识产权、世界顶尖的智能语音识别和相关AI技术。公司成立于2012年6月29日,总部位于北京,在上海、深圳均设有分公司。 云知声利用机器学习平台,在语音技术、语言技术、知识计算、大数据分析等领域建…

25 0 0