本期分享西工大音频语音与语言处理研究组(ASLP@NPU)被 Interspeech 2026接收的11篇论文,以下是发表论文的相关信息。


01、OmniCodec: Low Frame Rate Universal Audio Codec with Semantic–Acoustic Disentanglement

作者列表:胡景斌,张皓宇,郭大可,詹其瑞,李文豪,陈华康,马国斌,解晗轲,王成有,谢鹏源 ,谢川,张强,谢磊

合作单位:上海灵光乍现

论文摘要:通过离散表征学习,大型语言模型(LLM)推动了音频生成技术的发展。然而,现有的大多数神经编解码器都专注于语音,并强调重建保真度,而忽略了跨多种音频领域(包括语音、音乐和一般声音)的统一低帧率建模。此外,高重建质量并不一定能产生语义信息丰富的表征,从而限制了其在下游生成任务中的有效性。我们提出了一种名为 OmniCodec 的通用神经音频编解码器,专为低帧率而设计。它采用分层多码本设计,利用预训练理解模型的音频编码器实现语义-声学解耦,并结合自引导策略来提高码本利用率和重建效果。实验表明,与 Mimi 编解码器相比,OmniCodec 在相同比特率下取得了卓越的性能,不仅提供了更优异的重建质量,还提供了更多语义信息丰富的表征,有利于下游生成任务。我们的模型和代码已开源。

论文预印版:https://arxiv.org/abs/2603.20638

开源代码:https://github.com/ASLP-lab/OmniCodec


02、FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation

作者列表:解晗轲,任夏明,郭大可,尤若楠,李文豪,胡景斌,马国斌,陈华康,徐科杰,黄睿,谭卫国,王先荣,谢磊

合作单位:华为

论文摘要:近年来,随着语音对话系统的快速发展,文本到语音(Text-to-Speech, TTS)模型需要具备更快的生成速度和更强的响应能力。现代语音对话系统对 TTS 模型提出了两个核心需求:低时延,以及对流式输入和流式输出的支持。然而,现有大多数基于单码本的 LLM-based TTS 方法仍依赖多阶段生成流程,缺乏原生的流式处理能力。这类系统通常受到自回归预测速度较慢和多步流匹配解码开销较大的限制,导致端到端时延较高。为了解决上述问题,我们提出了 FlashTTS,一个开源、低时延的流式 TTS 框架。FlashTTS 引入了一种滞后式多轨架构,能够原生处理流式文本和语音输入,从而无需等待完整句子级别的缓存。为了进一步加速声学生成,我们将并行多 Token 预测 与 X-pred flow 解码器相结合。该配置能够在精确两步实现高保真的音频生成。通过联合优化输入处理流程和解码效率,FlashTTS 为实时语音对话系统提供了一个实用的基础框架。实验结果表明,与强流式基线相比,FlashTTS 将首包时延显著降低至 325 ms,同时仍保持了较强的零样本音色克隆能力和跨语言可懂度。模型代码和检查点也将以开源形式发布。

论文预印版:https://arxiv.org/abs/2606.09141

Demo page:https://github.com/ASLP-lab/FlashTTS


03、Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition

作者列表:戴宇航,林浩鹏,钱家乐,延瑞琦,孟浩,解晗珂,温翰林,尹顺顺,陶明,陈谐,谢磊,王新升

合作单位:Soul APP,上海交通大学

论文摘要:大型音频语言模型(LALMs)在端到端的说话人日志和识别方面表现出显著性能。然而,由于大规模会话数据稀缺且缺乏显式说话人表征优化,其说话人辨别能力仍然有限。为此,我们提出了 GLSC-SDR 范式,该范式将说话人分类与说话人日志和识别两个任务在统一框架下进行联合学习。我们还进一步介绍了一种全局-局部说话人分类策略,将聚类标签作为说话人全局标签,重新编码的簇内说话人作为局部标签。这种层级设计增强了细粒度的说话人辨别,同时保持了语义转录的准确性。在 AliMeeting、AISHELL-4 和 AMI-SDM 上的实验表明,GLSC-SDR 在不依赖大规模真实对话数据的情况下,与仿真和多编码器等方法相比,实现了与之可比或更优的性能。

论文预印版:https://arxiv.org/abs/2603.25377


04、YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

作者列表:郝春博,郑俊杰,马国斌,姜月鹏,陈华康,田文杰,陈宫煜,陈子浩,谢磊

合作单位:巨人网络

论文摘要:在保持旋律一致性的同时,使用修改后的歌词重新生成歌声仍然具有挑战性,因为现有方法要么可控性有限,要么需要繁琐的人工对齐。我们提出了 YingMusic-Singer,这是一个完全基于扩散模型的模型,能够在旋律可控的歌声合成中灵活地修改歌词。该模型以一个可选的音色参考、一段提供旋律的歌唱音频片段以及修改后的歌词作为输入,无需人工对齐。通过课程学习和组相对策略优化(GRPO)进行训练后,YingMusic-Singer 相比 Vevo2 在旋律保持和歌词遵循方面表现更优;Vevo2 是目前最接近的、同样支持无需人工对齐进行旋律控制的基线方法。此外,我们提出了 LyricEditBench,这是首个用于评估旋律保持型歌词修改的基准测试集。代码、模型权重和基准测试集将公开发布。

论文预印版:https://arxiv.org/abs/2603.24589

Demo Page:https://aslp-lab.github.io/YingMusic-Singer-Plus-Demo


05、Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

作者列表:赵致闲,王水源,田文杰,胡景斌,张子萸,谢磊

论文摘要:虽然音频语言模型(Audio Language Models, ALM)表现出了强大的语义理解能力,但在处理复杂的日常情感交互时仍面临很大挑战。具体而言,文本语义主导(Textual Semantic Dominance)往往会掩盖声音信号中的细微情感变化,而认知深度的缺失则容易导致模型生成泛化的、缺乏情感认同的机械式回复。为此,我们提出了 CogAudio-LLM,一个认知情感推理框架。为了缓解文本语义的主导效应,我们构建了 LIME-440K 数据集——这是一个“词义相同、多情感表达”的大规模数据集,旨在促进声音与语义的情感解耦。同时,我们引入了 EIPS 机制,这是一种融入心理学推理的 4 阶段思维链架构。在推理效率方面,我们设计了多阶段训练策略,首先通过监督微调(SFT)显式地建立 EIPS 推理链,随后将这一复杂的逻辑链条蒸馏到隐式的生成过程中。最后,我们设计了 DR-SAPO(双路软自适应策略优化)算法,以动态平衡思维链的逻辑严密性与直截了当回复中的共情表达质量。

论文预印版:https://arxiv.org/abs/2606.06940


06、G-MaP-SE: Guided Speech Enhancement via GMM-Based Prior Matching

作者列表:朱毅可,王子谦,刘子楷,李星辰,陈庄祺,夏咸军,黄传增,谢磊

论文摘要:使用说话人嵌入作为条件信息能够增强语音增强性能,但现有大多数方法要么需要干净的注册语音(enrollment audio),要么依赖从带噪语音中提取的嵌入,而后者在噪声和领域偏移条件下较为脆弱。为此,我们提出 G-MaP-SE,一种引导式语音增强框架,通过高斯混合模型(GMM)构建干净语音嵌入先验,并通过将带噪条件嵌入与该先验进行匹配来对其进行优化。随后,将匹配得到的先验嵌入通过一个轻量级门控融合模块注入到时频域语音增强主干网络中。在 VoiceBank+DEMAND 和 DNS Challenge 2020 数据集上的实验表明,所提出的先验匹配方法相比直接使用带噪条件嵌入能够持续获得更好的性能,并显著缩小与理想的干净条件嵌入上界之间的差距,同时在推理阶段无需任何注册语音。代码、音频样例和模型权重均已公开。

论文预印版:https://arxiv.org/abs/2606.08580

开源代码:https://github.com/Hello3orld/G-MaP-SE


07、MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

作者列表:马国斌,夏宇轩,姜月鹏,郭大可,解晗轲,胡景斌,王彦博,谢磊,朱鹏程

合作单位:WeNet开源社区,新南威尔士大学

论文摘要:流式零样本语音转换(voice conversion, VC)由于其在实时应用中的潜力,近年来受到越来越多的关注。近期提出的 MeanVC 实现了轻量级的流式零样本语音转换,但仍存在若干局限性:其分块自回归去噪机制会使有效训练序列长度翻倍;在小分块设置下,转换质量会明显下降;此外,其音色编码器直接依赖参考 mel 频谱,因此对参考音频质量较为敏感。为了解决上述问题,我们提出 MeanVC 2。具体而言,我们引入了未来感受野分块机制(future-receptive chunking, FRC),该机制在扩散 Transformer 解码器的不同层中显式调度过去与未来的感受野,并移除了 clean-chunk teacher forcing。通过引入有界的未来上下文,FRC 能够在 40 ms 的小分块设置下实现稳定的语音转换。此外,我们提出了一种通用音色 token 编码器,该编码器基于全局说话人嵌入构建音色表示,并通过交叉注意力检索细粒度的音色线索,从而提升模型对低质量参考音频的鲁棒性,并增强零样本说话人相似度。实验结果表明,MeanVC 2 相较于 MeanVC 取得了显著性能提升,同时将端到端延迟从 211 ms 降低至 110 ms。

论文预印版:https://arxiv.org/pdf/2606.09050

Demo Page:https://aslp-lab.github.io/MeanVC2


08、Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

作者列表:李龙豪,陈虹洁,李泽涵,胡启涵,康健,李杰,谢磊,李永翔

合作单位:中国电信人工智能研究院

论文摘要:近年来,推理模型在文本和多模态领域取得了显著进展,但音频推理能力仍相对有限。当前只有少数大型音频语言模型(Large Audio Language Models, LALMs)显式引入了链式思维(Chain-of-Thought, CoT)推理机制,而且其能力往往不稳定,难以充分应对复杂任务。为弥补这一差距,我们提出了 Audio-Cogito,一个面向深度音频推理的完全开源解决方案。我们开发了 Cogito-pipe,用于高质量音频推理数据的构建与筛选,并生成了 54.5 万条推理样本,这些数据将在论文评审结束后公开发布。基于该数据集,我们采用自蒸馏策略对模型进行微调。在 MMAR benchmark 上的实验结果表明,我们的模型在开源模型中取得了最佳性能。MMAR 是目前唯一一个评估音频链式思维推理过程的音频基准。与此同时,我们的模型在部分指标上能够达到或超过某些闭源模型。此外,我们的方法也在 Interspeech 2026 Audio Reasoning Challenge 中位列第一梯队系统。

论文预印版:https://arxiv.org/pdf/2604.12527


09、Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

作者列表:张子萸,强春雨,王晓鹏,郭雨欣,尹慷,田文杰,胡景斌,左天伦,郭钊,马腾,梁宇哲,张晨,谢磊

合作单位:快手

论文摘要:尽管歌曲生成与歌声转换(SVC)技术已取得显著进展,但二者长期处于孤立发展状态:前者缺乏零样本说话人音色克隆能力,后者则忽视了人声与伴奏的协同关系。为弥合这一鸿沟,我们提出UniSinger——首个端到端统一框架,实现了说话人音色克隆歌曲生成与伴奏协同生成的歌声转换。基于多模态扩散变换器架构,我们构建了统一的说话人嵌入空间,将说话人表征从歌声转换迁移至歌曲生成任务,实现跨任务的精细化音色控制。为缓解多任务优化冲突,我们设计了采用任务特定模态掩码的课程学习策略,引导模型逐步掌握语义内容、人声音色与伴奏之间的生成机制。实验表明,该框架在两项任务上均达到最优性能,并产生互补增益,为智能音乐制作开辟了新可能。

论文预印版:https://arxiv.org/abs/2606.07015

Demo Page:https://ziyu6.github.io/UniSinger/


10、DiffRhythm 2: Efficient And High Fidelity Song Generation Via Block Flow Matching

作者列表:姜月鹏,陈华康, 姚继珣, 宁子谦, 韩泽瑞, 吴迪, 孟猛, 栾剑, 付中华, 谢磊

论文摘要:生成长时长、高质量的歌曲具有挑战性,因为它需要在文本与音乐模态之间以及音乐模态内部保持长期连贯性。现有的非自回归(NAR)框架虽然能够生成高质量歌曲,但常常难以实现歌词与歌声之间的对齐。与此同时,为了满足多样化的音乐偏好,需要从人类反馈中进行强化学习(RLHF)。然而,现有方法在多偏好优化时往往依赖合并多个模型,导致性能显著下降。为应对这些挑战,我们提出了 DiffRhythm 2,一个用于高保真、可控制歌曲生成的端到端框架。为了解决歌词对齐问题,DiffRhythm 2 采用了一种基于块流匹配的半自回归架构。该设计能够在不依赖外部标签和约束的前提下,实现歌词与歌声演唱的精确对齐,同时保持 NAR 模型的高生成质量和效率。为了使该框架在长序列上计算可行,我们实现了一个音乐变分自编码器(VAE),在实现高保真音频重建的同时,将帧率降低至 5 Hz。此外,为了克服 RLHF 中多偏好优化的局限性,我们提出了交叉对偏好优化方法。该方法有效缓解了模型合并带来的性能下降,使得在多样化的人类偏好上进行更稳健的优化成为可能。我们还通过引入随机块表示对齐损失,进一步增强了音乐性和结构连贯性。

论文预印版:https://arxiv.org/abs/2510.22950

开源网址:https://github.com/ASLP-lab/DiffRhythm2


11、MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-SpeakerScenarios

作者列表:王帅*,孙照凯*,林振楠*,王成有,高德辉,曹宇昂,和春江,周盼,谢磊

合作单位:南京大学,理想汽车

论文摘要:口语理解正从面向特定任务的流水线模型(如语音识别、说话人分析),快速转向可生成自然语言回答的大型音频语言模型。但现有语音评测基准多针对单人语音或独立任务,真实多人对话的说话人理解相关研究,仍缺乏充分评测与优化。本文提出MSU-Bench:一套以说话人为核心、面向多人对话理解的综合评测基准。它分两级递进式对话理解框架,包含 16 项相关任务、3000 组问答样本,并搭建了带人工质控的高质量标注与问答生成流程,数据质量和人机一致性表现优异。研究还系统分析了说话人索引方案与典型错误类型,为提升音频理解能力提供参考。实验显示,主流模型性能会随任务难度上升明显下降;开源与闭源模型间存在显著差距,在多人交互推理任务上尤为突出。