
由名古屋大学、南开大学、 Meta AI、日本国立信息通信技术研究所(NICT)等单位发起的 AudioMOS Challenge 2025 挑战赛将于2025年4月9日正式启动!
赛事官网:https://sites.google.com/view/voicemos-challenge/audiomos-challenge-2025
赛事背景:从VoiceMOS到AudioMOS
近年来,生成式人工智能技术快速发展,不仅可以合成语音,还可以合成歌唱、音乐甚至一般音频。然而,和合成语音一样,这些合成音频样本的最终用户是人类,如何对这些合成音频的质量进行可靠、自动化的评估仍然是一个重要挑战。为了促进音频生成系统自动评估的研究发展,南开大学计算机学院人类语言技术实验室(HLT Lab)联合名古屋大学、Meta AI、日本国立信息通信技术研究所等多家国际研究机构,共同发起AudioMOS Challenge 2025,推动自动化、数据驱动的音频质量评估技术发展。
VoiceMOS挑战赛(VMC)成立于2022年,旨在在语音合成(Text To Speech)、语音转换(Voice Conversion)和语音增强(Speech Enhancement)等领域中使用标准化数据集比较人类语音评级的预测技术。AudioMOS Challenge 2025在往届VoiceMOS Challenge的基础上进一步扩大了任务范围,从传统语音合成扩展至生成式音乐、高采样率语音及多样化音频类型,致力于提升自动MOS评测系统的泛化能力与可靠性,为全球音频生成技术优化提供科学基准。
三大赛道:多维度探索音频质量评估
本次AudioMOS Challenge共设置三个赛道:
- 赛道1:文本转音乐系统(TTM)的MOS预测基于首个带有专家评分的生成式音乐数据集MusicEval,包含31个TTM系统生成的2748个样本及13740组专家评分,聚焦“整体音乐印象”与“文本一致性”两大维度。
- 赛道2:Audiobox美学风格预测基于Meta最新发布的Audiobox Aesthetics数据集,以及提出的四个新的评价维度:制作质量、制作复杂性、内容喜爱度和内容实用性。
- 赛道3:高采样率语音MOS预测参赛者需针对16/24/48kHz等多采样率合成语音样本,预测其在听力测试中的MOS分数,探索不同采样率下的听力测试样本和评估分数间的关联。
参赛方式与时间安排
AudioMOS Challenge 2025 将在 CodaBench 平台(https://www.codabench.org/)上进行,并计划向 ASRU2025 提交一份挑战提案。挑战赛将于4月9日正式开始,注册将一直开放至6月4日,所有研究团队均可免费参与。
赛事时间节点如下:
| 2025.4.09 | 训练数据集开放下载 |
| 2025.5.28 | 测试数据集发布 |
| 2025.6.04 | 参赛队伍提交预测结果 |
| 2025.6.16 | 公布最终评测结果 |
| 2025.6.25 | ASRU 2025会议论文提交截止 |
参赛规则:
- 注册必须使用机构电子邮件地址(例如,大学或公司),而不是个人电子邮件地址。
- 参赛者需要在挑战结束后提交一份系统描述。
- 可以使用任何公共数据集开发预测系统,所使用的数据集必须在系统描述中报告。除非资源是公开的,否则不允许使用专有数据集,包括收集您自己的MOS评级。
结 语
AudioMOS Challenge 2025 的发起,标志着智能语音与音频质量评测迈向更通用、更高效的新阶段。诚邀全球研究者、开发者及企业团队加入,共同定义音频质量评估的未来标准!
(本次赛事最终解释权归组委会)
组织者
主办机构:名古屋大学、南开大学、Meta AI、日本国立信息通信技术研究所(NICT)
核心成员:Wen-Chin Huang(名古屋大学)、Hui Wang(南开大学)、Cheng Liu(南开大学)、Yi-Chiao Wu(Meta AI)、Andros Tjandra(Meta AI)、Wei-Ning Hsu(Meta AI)、Erica Cooper(NICT)、Yong Qin(南开大学)、Tomoki Toda(名古屋大学)等。
