
本挑战赛是2025年第二十届人机语音通讯会议(National Conference on Man-Machine Speech Communication,NCMMSC2025)的特殊议题之一,比赛提交系统描述论文将在 NCMMSC2025 特殊议题中汇报。

会议网址:https://www.ncmmsc.org.cn/
比赛详情:https://vtad2025-challenge.github.io/
本挑战赛以音色属性为对象,关注音色的可解释性,为此构建音色属性检测(Voice Timbre Attribute Detection,vTAD)任务。 该任务旨在辨认两句语音中的话者在音色属性上是否存在特定的强弱差异,其中,音色属性指听者通过听觉感知系统,借助语言对话者音色感知进行描述, 如明亮、粗糙、圆润等。具体地,本任务以一对语音为对象,基于对二者在特定音色属性强度差异假设,通过验证该假设是否成立,实现对音色属性差异的判定。 本挑战赛拟通过该任务加强对语音中话者音色属性的处理和建模研究,加深对音色的理解,进而推动包括可解释话者识别、提示控制的个性化语音合成技术等相关研究领域的发展。
数据集
本挑战赛采用VCTK-RVA数据集,该数据集在VCTK公开数据库的基础上,以同性别为基础,标注了不同话者之间明显的音色属性强弱差异。总共包含18种音色属性:明亮,单薄,粗,细,低沉,干净,厚实,磁性,浑浊,沙哑,圆润,平淡,尖锐,干瘪,沉闷,柔和,通透,干哑。
该数据库共选用VCTK中来自101个发音人的40892句语音,以{话者A,话者B,音色属性v}为一组发音人标注,表示话者B比话者A在属性v上强。共有6038组发音人音色差异标注数据,其中每组发音人在1至3个音色属性上有强弱标注。
赛道任务
本挑战赛以来自两个不同话者的语音对为对象,检测二者在给定的音色属性上的强度差异。在VCTK-RVA数据集上划分训练集和测试集,并依据测试集中话者在训练集中可见与否,定义两个赛道,分别如下:
赛道1:未见赛道
测试集中的话者与训练集中使用的话者互不可见。
赛道2:话者可见赛道
测试集中的单个话者全部出现在训练集中,但在以两个话者组成的话者对为对象的音色属性标注的训练集中,测试集采用的话者对未出现在训练集中。
除不能使用本竞赛发布的训练数据集以外的VCTK数据之外,以上两赛道均不限制参赛者使用的数据及模型。
测评与排名
本挑战赛拟以语音句为对象检测话者属性强弱,采用确认和识别两种测试方式,分别以等错误率和准确率为性能评价指标。主办方提供一对语音之间音色的属性强弱假设,确认测试中,参赛者需给出该假设置信度得分,进而结合标注计算等错误率;识别测试中,参赛者需给出该假设是否成立的判定结果,进而与标注进行对比以计算准确率。等错误率越低、准确率越高,性能越好。本挑战赛拟采取匿名排名方式,依据每组参赛者的等错误率和准确率进行排名。
时间安排
| 2025.5.15 | 挑战赛公布,发布基线系统代码,开放报名注册 |
| 2025.5.17 | 发布训练数据和参考模型 |
| 2025.6.27 | 发布测试数据 |
| 2025.7.4 | 参赛者提交结果 |
| 2025.7.11 | 反馈系统结果 |
| 2025.7.25 | 提交论文,阐述清楚方法和数据集 |
每个团队请使用报名表格进行一次报名。参与者在报名成功后的24小时内会受到一份确认邮件。报名方
组织委员会
陈丽萍 中国科学技术大学副研究员
李功益(Kong Aik Lee) 香港理工大学副教授
凌震华 中国科学技术大学教授
组织单位

联系方式
对本次赛事有任何问题或建议,请发邮件至:vtad2025_org@163.com
