随着语音大模型、语音助手以及多模态交互系统的快速发展,语音技术正不断展现出更自然、更流畅的交互能力。从会议转录到智能终端,从辅助听觉设备到多人实时通信系统,如何在复杂环境中准确“听清目标说话人”,正在成为语音处理迈向真实应用的关键一步。

然而,当前许多目标说话人提取方法仍主要依赖模拟数据构建训练与评测环境。相比之下,真实会议、聚餐、讨论等场景中包含真实的语音重叠、环境噪声与混响,以及更复杂的对话动态。这使得 REAL-TSE 更贴近实际应用场景,对模型的鲁棒性与泛化能力提出了更高要求。

为了推动目标说话人提取技术面向真实场景持续发展,由来自南京大学、香港中文大学(深圳)、西北工业大学、上海交通大学、华为、NTT、布尔诺理工大学等高校与研究机构的研究者联合发起的 REAL-TSE(Real-world Target Speaker Extraction)挑战赛现已正式启动。作为 IEEE SLT 2026 的卫星赛事之一,本次挑战赛聚焦真实多人对话环境中的目标说话人提取问题,旨在构建更贴近实际应用的评测基准,推动研究从模拟混合语音迈向真实会话语音。

竞赛目标

在真实多人对话环境中,目标说话人提取不仅需要从混合语音中“分离出目标”,还需要尽可能保留目标说话人的语音内容、身份特征和可懂度。与模拟数据相比,真实场景中的语音重叠更自然,噪声与混响更复杂,对话过程也更加动态,这些都对系统的鲁棒性和泛化能力提出了更高要求。

本次挑战赛正是面向这一问题设立,旨在构建更贴近实际应用的真实场景评测基准,推动目标说话人提取研究从模拟条件下的性能比较,进一步走向真实环境中的能力检验。通过本次赛事,我们期待促进相关方法在复杂声学条件下取得更稳健、更具应用价值的进展。

任务与赛道设置

本次挑战赛任务为:在给定多说话人混合语音以及目标说话人的注册语音(enrollment)的条件下,从混合语音中提取目标说话人的语音。

挑战赛设置两个互补赛道:

赛道 1:在线赛道(Online Track)

  • 在线赛道面向低时延应用场景,例如助听设备、实时通信、边录边处理等任务。参赛系统需要在严格的端到端延时约束下完成目标说话人提取,总延时要求不超过 100 ms。
  • 该赛道重点考察系统在实时性与分离质量之间的平衡能力,要求模型在有限上下文条件下,依然能够有效抑制干扰说话人和环境噪声,并尽可能保留目标语音内容与说话人特征。

赛道 2:离线赛道(Offline Track)

  • 离线赛道面向会议转录、语音分析、后处理增强等应用场景,允许系统使用完整语音进行建模,不受时延限制。
  • 该赛道鼓励探索更复杂的全局建模方法和高性能网络结构,以追求目标说话人提取任务的性能上限。

本次挑战赛提供四个预训练基线模型,均基于 BSRNN 架构,并在 Libri2Mix-100 数据集上训练。基线系统在两个维度上进行设计:

说话人特征建模方式:

  • 基于 ECAPA-TDNN 的说话人嵌入
  • 基于 TF-Map 与上下文表示的多层特征

系统形式:

  • 在线(低延时)版本
  • 离线版本

基线模型基于常见的Libri2Mix 数据准备进行训练,与真实对话场景存在差异,其性能主要作为参考下限。我们鼓励参赛者探索更适合真实场景的数据构建与模型设计方法。

数据集与评测设置

挑战赛提供开发集和评测集,均基于真实对话数据构建。开发集来源于多个公开语音数据集(如 AISHELL-4、AMI 等),通过自动化流程提取真实语音重叠片段,并为每个样本提供目标说话人的注册语音和干净参考语音。该数据集可用于模型验证与调参,但禁止用于训练或微调。评测集包含两个子集:

  • Seen 子集:与开发集分布相似,用于评估模型在已知场景下的性能
  • Unseen 子集:包含全新录制的真实场景数据,用于测试模型的泛化能力

评测指标为多维度综合评分,包括语音可懂度(WER)、说话人一致性(SpkSim)、感知质量(DNSMOS)以及目标说话人检测准确率(F1)。

时间安排(AOE时间)

本次挑战赛的关键时间节点如下:

  • 2026 年 4 月 7 日:报名开启
  • 2026 年 4 月 10 日:开发集与 baseline 发布
  • 2026 年 5 月 31 日:评测集发布、排行榜开放、报名截止
  • 2026 年 6 月 20 日:排行榜冻结、结果提交截止
  • 2026 年 7 月 1 日:系统报告提交截止
  • 2026 年 7 月 8 日:SLT Challenge Paper Track 论文提交截止
  • 2026 年 9 月 1 日:录用通知发布

组织团队

  • 王帅,南京大学
  • 张克,香港中文大学(深圳)
  • 钱子涵,南京大学
  • 刘子楷,西北工业大学
  • 李浩宇,南京大学
  • Marc Delcroix,NTT, Inc.
  • 孙照凯,西北工业大学
  • 韩江宇,布尔诺理工大学
  • 俞凯,上海交通大学
  • 谢磊,西北工业大学
  • 肖龙帅,华为
  • 薛浏蒙,南京大学
  • 李明,香港中文大学(深圳)
  • 李海洲,香港中文大学(深圳)

参与方式

请在官网填写注册表参与

比赛官网:https://real-tse.github.io/challenge/

GitHub:https://github.com/REAL-TSE/REAL-TSE-Challenge

Baseline代码:https://github.com/REAL-TSE/wesep-real-tse

联系邮箱:realtse.challenge@gmail.com

REAL-TSE 挑战赛的开启,不只是一次任务评测的更新,更是一次面向真实语音交互场景的能力检验。它将目标说话人提取从理想化的模拟混合数据带回到真实会议、聚餐与自然会话之中,去检验系统在自然重叠、环境噪声、混响和跨场景泛化条件下的真正表现。对于关注 TSE、语音分离、说话人建模、鲁棒语音识别、流式语音处理与真实场景语音交互的研究者和工程师而言,这将是一场非常值得参与和关注的赛事。欢迎相关团队积极报名交流,共同推动目标说话人提取技术迈向更真实、更实用的应用环境。