NeurIPS 2025丨上海交通大学跨媒体语言智能实验室5篇录用论文分享
NeurIPS,即神经信息处理系统大会(Conference on Neural Information Processing Systems),是由神经信息处理系统基金会(NeurIPS Foundation)主办的全球机器学习与人工智能…
23 0 0
NeurIPS,即神经信息处理系统大会(Conference on Neural Information Processing Systems),是由神经信息处理系统基金会(NeurIPS Foundation)主办的全球机器学习与人工智能…
语音理解与生成的飞速发展离不开大规模高质量语音数据集的推动。其中,语音识别(ASR)和语音合成(TTS)被公认为最首要的任务。但对于拥有约 1.2亿 母语使用者的川渝方言而言,受限于标注资源匮乏,研究进展缓慢,ASR 与 TTS 的表现始终…
刚刚,小米正式开源首个原生端到端语音模型Xiaomi-MiMo-Audio,该模型参数规模70亿,预训练数据达到超1亿小时,且在开源模型中的语音智能和音频理解基准测试中都实现了SOTA,在多项测试超越同参数量开源模型、谷歌Gemini-2.…
来源丨THUHCSI人机语音交互实验室 本文介绍由清华大学人机语音交互实验室(THUHCSI)与面壁智能联合研发的VoxCPM,一款 0.5B 参数尺寸的中英双语语音生成基座模型 。 VoxCPM在合成语音的自然度、音色相似度及韵律表现力方…