作为语音相关研究领域的旗舰国际会议,ASRU2025(IEEE Workshop on Automatic Speech Recognition and Understanding)将于12月6-10日在夏威夷檀香山举办。IEEE ASRU2025的主题为“Towards the New Era of Speech Understanding”(迈向语音理解的新时代),本次研讨会主要侧重于将学术界和工业界聚集在一起,讨论语音领域的新发展,包括但不限于语音识别系统、口语对话系统、语音分析、语音中出现的副语言学现象、自动语音识别和语音分析的应用、语音大语言模型和语音基础模型等。
会议网址:https://2025.ieeeasru.org/
本次分享西工大音频语音与语言处理研究组中稿的论文6篇,涉及智能语音处理领域的众多研究方向。以下是本届会议发表论文的相关信息,附带论文原文链接。
NO.1 EchoFree: Towards Ultra Lightweight and Efficient Neural Acoustic Echo Cancellation
作者列表:李星辰,康博意,王子谦,张子晗,刘铭帅,付中华,谢磊
论文摘要:近年来,神经网络 (NN) 在声学回声消除 (AEC) 领域得到了广泛的应用。然而,现有方法在保持性能的同时,难以满足现实世界对低延迟和计算的要求。为了应对这一挑战,我们提出了 EchoFree,这是一个超轻量级的神经 AEC 框架,它将线性滤波与神经后置滤波器相结合。具体而言,我们设计了一个基于 Bark 尺度频谱特征的神经后置滤波器。此外,我们引入了一种利用自监督学习 (SSL) 模型的两阶段优化策略来提升模型性能。我们在 ICASSP 2023 AEC 挑战赛的盲测集上评估了我们的方法。结果表明,我们的模型仅需 278K 个参数和 30 MMAC 的计算复杂度,就优于现有的低复杂度 AEC 模型,并达到了与最先进的轻量级模型 DeepVQE-S 相当的性能。
论文Arxiv网址:http://arxiv.org/abs/2508.06271
NO.2 XEmoRAG: Cross-Lingual Emotion Transfer withControllable Intensity Using Retrieval-AugmentedGeneration
作者列表:左天伦,胡景斌,李玉珂,朱新发,李海,闫影 ,刘俊晖,谢丹铭,谢磊
论文摘要:本文提出了一种名为XEmoRAG的跨语言零样本情感迁移语音合成框架,实现了从中文到泰语的情感迁移,而无需平行情感数据。该方法首先从中文参考语音中提取语言无关的情感嵌入,并从精心构建的泰语情感数据库中检索情感匹配的语音,实现可控的情感迁移。通过流匹配对齐模块,减少音高与时长的不匹配,同时在泰语合成中融合中文音色,提升节奏准确性与情感表达效果,并保持说话人特征与情感一致性。实验结果表明,XEmoRAG 仅依赖中文参考音频即可合成自然、富有表现力的泰语语音,展现了其在低资源条件下灵活进行跨语言情感迁移的能力。
论文Arxiv网址:https://arxiv.org/pdf/2508.07302
NO.3 Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
作者列表:田文杰,朱新发,解晗轲,叶蓁,雪巍,谢磊
论文摘要:文本到语音(TTS)领域的最新进展已实现了令人瞩目的自然度和灵活性,尤其是在基于大型语言模型(LLM)的方法发展之后。然而,现有的自回归(AR)结构和大规模LLM模型(如 Llasa)在推理延迟和流式合成方面仍面临重大挑战。为解决这些局限性,我们提出了 Llasa+,一种基于 Llasa 构建的加速型流式 TTS 模型。具体而言,为加速生成过程,我们在冻结的主干网络后引入了两个即插即用的多 token 预测(MTP)模块。这些模块使模型能够在一个自回归步骤中预测多个 token。此外,为减轻因 MTP 预测不准确可能导致的误差传播,我们设计了一种新颖的验证算法,该算法利用冻结的主干网络对生成的 token 进行验证,从而使 Llasa + 在实现加速的同时不牺牲生成质量。最后,我们还设计了一个因果解码器,能够从 token 中实现流式语音重建。大量实验表明,尽管仅在 LibriTTS 数据集上训练,Llasa + 仍实现了 1.48 倍的加速,且未损失生成质量。此外,这种 MTP 与验证相结合的框架可应用于加速任何基于 LLM 的模型。
代码和模型:https://github.com/ASLP-lab/LLaSA_Plus
论文Arxiv网址:https://arxiv.org/pdf/2508.06262
NO.4 Efficient Scaling for LLM-based ASR
作者列表:穆秉甡,邵益文,魏坤,俞栋,谢磊
论文摘要:基于大语言模型(LLM)的自动语音识别(ASR)取得了出色的性能,但往往会带来高昂的计算成本。这项工作研究了如何高效地获得最佳的LLM-ASR性能。通过全面且可控的实验,我们发现,在将语音编码器与LLM集成之前对其进行预训练,相较于标准的LLM-ASR联合后训练做法,能显著提高缩放效率。基于这一见解,我们提出了一种新的多阶段LLM-ASR训练策略,即编码器优先集成(EFIN)。在所有评估的训练策略中,EFIN始终能以显著更低的计算预算(49.9%的浮点运算次数)实现更好的性能(相对字符错误率为21.1%)。此外,我们推导出一种缩放定律,该定律将ASR错误率近似为计算函数,为LLM-ASR的缩放提供了实用指导。
论文Arxiv网址:https://arxiv.org/pdf/2508.04096
NO.5 DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
作者列表:陈华康,姜月鹏,马国斌,郝春博,王帅,姚继珣,宁子谦,孟猛,栾剑,谢磊
论文摘要:歌曲作为音乐艺术的核心形式,体现了人类智慧与创造力的丰富性。尽管近年来生成式建模的进展在长篇歌曲生成方面取得了显著成果,但当前的全长歌曲合成系统仍面临诸多挑战,包括数据不平衡、可控性不足以及音乐质量不一致等。DiffRhythm 作为一种开创性的基于扩散的模型,通过生成具有表现力的人声与伴奏的全长歌曲推动了该领域的发展。然而,其性能受到模型训练数据集不平衡以及对音乐风格控制有限的制约,导致生成作品在质量上存在明显差异,并限制了创作的灵活性。为了解决这些限制,我们提出了 DiffRhythm+ ,一种增强型的、可控且灵活的全长歌曲生成扩散框架。DiffRhythm+ 利用大幅扩展且平衡的训练数据集,缓解了歌词重复与遗漏等问题,同时促进了更丰富的音乐技巧与表现力的涌现。该框架引入多模态风格条件策略,使用户能够通过描述性文本与参考音频精确指定音乐风格,从而显著提升创作控制力与多样性。我们进一步引入与用户偏好直接对齐的性能优化方法,引导模型在各项评估指标上持续生成更符合人类偏好的输出。大量实验表明,DiffRhythm+ 在自然度、编曲复杂度以及听众满意度方面,相较于现有系统都取得了显著提升。
论文Arxiv网址:https://arxiv.org/abs/2507.12890
NO.6 REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
作者列表:姜月鹏,宁子谦,王帅,汪承佳,毕梦霄,朱鹏程,付中华,谢磊
论文摘要:在实际的语音转换应用中,源语音中的环境噪声以及用户对富有表现力输出的需求带来严峻挑战 。传统的基于自动语音识别 (ASR) 的方法虽能确保抗噪性和转换的稳定性,但会限制韵律的多样性;而基于自监督学习表征 (SSL) 的模型虽可显著提升转换结果的表现力,却存在音色泄漏和对噪声敏感问题。本文提出了一种抗噪且富有表现力的语音转换系统 REF-VC。其关键创新包括:(1) 采用随机擦除策略降低模型对于SSL表征中“无效信息”的关注,如背景噪声、说话人音色等,从而同时增强模型的抗噪性和表现力;(2) 利用受 E2TTS 启发的隐式对齐机制 ,可抑制对SSL表征中“无效信息”的重构;(3) 集成快捷模型加速流匹配推理,将推理步数显著减少至 4 个 。实验结果表明,REF-VC 在噪声集的零样本场景下优于 Seed-VC 等基线模型,同时在干净测试集上的表现与 Seed-VC 相当。此外,REF-VC 可在不额外训练的情况下兼容歌唱转换。
论文Arxiv网址:https://arxiv.org/abs/2508.04996
