西工大音频语音与语言处理研究组(ASLP@NPU)在本届会议将携合作伙伴宣读论文10篇,涉及智能语音处理领域的众多研究方向,包括语音识别、语音合成与转换、语音增强等。论文的合作单位包括理想汽车、网易、喜马拉雅、字节跳动、马上金融、出门问问、希尔贝壳等。实验室除联合多家单位组织车载多通道语音识别赛(ICMC-ASR)之外,还联合字节跳动获得音频深度丢包补偿(PLC)挑战赛冠军、语音音质增强挑战赛(SSIC)赛道1亚军和赛道2季军,联合马上金融获得多模态语音信息处理挑战赛(MISP)亚军。
以下是本届会议发表论文的相关信息,附带论文原文链接,与大家分享。

NO.1

PromptVC: Flexible Stylistic Voice Conversion In Latent Space Driven By Natural Language Prompts

作者列表:姚继珣,杨宇光,雷怡,宁子谦,胡彦妮, 潘宇,印晶晶,周鸿斌,卢恒,谢磊
合作单位:喜马拉雅
论文摘要:风格语音转换旨在将源语音的风格转换为目标风格。但大多数当前的风格语音转换方法依赖于预定义的标签或参考语音来控制风格转换过程,这导致了风格多样性受限以及风格表示的直观性和可解释性方面存在不足。本文提出了一种基于扩散模型(LDM)的风格语音转换方法,采用潜在扩散模型生成由自然语言提示(Prompt)驱动的风格向量。在训练期间,风格向量由风格编码器提取,然后独立训练潜在扩散模型从噪声中对风格向量进行采样,该过程以自然语言描述作为条件。为了提高风格转换的表现力,利用HuBERT提取离散Token,并用K-Means中心簇替换离散Token作为语言内容,从而最小化源语音中的残余风格信息。此外去重相同的离散Token,并使用可微的时间预测器重新预测每个标记的时长,以适应相同语言内容在不同风格下的时长。主观和客观实验结果表明了本文提出的方法的有效性。
论文网址:https://arxiv.org/abs/2309.09262
样例网址::https://yaoxunji.github.io/prompt_vc/

NO.2

DualVC 2: Dynamic Masked Convolution For Unified Streaming And Non-Streaming Voice Conversion

作者列表:宁子谦,姜月鹏,王帅,朱鹏程,姚继珣,谢磊,毕梦霄
合作单位:网易
论文摘要:随着语音转换(VC)的逐渐流行,越来越多的应用场景需要具有流式推理能力的模型。我们先前提出的 DualVC 试图通过流式模型架构设计和模型内知识蒸馏以及混合预测编码来弥补未来信息的不足,从而实现这一目标。然而DualVC 存在以下几个问题。首先,自回归解码器具有误差累积的特性,也限制了推理速度。其次,因果卷积实现了流式推理能力,但无法充分使用chunk内的未来信息。第三,该模型无法有效处理无人声段中的噪声,从而降低了整体音质。为此,本文提出了 DualVC 2 来解决这些问题。具体来说,我们将模型主干结构迁移到基于 Conformer 的架构上,从而实现并行推理。以带有动态chunk掩码的非因果卷积取代因果卷积,更好地利用块内的未来信息。此外还引入了安静注意力(quite attention)机制,以增强模型的噪声鲁棒性。实验表明,DualVC 2 在主观和客观指标上均优于 DualVC 和其他基线系统,延迟时间仅为 186.4 毫秒。
论文网址:https://arxiv.org/abs/2309.15496
样例网址:https://dualvc.github.io/dualvc2/

NO.3

SponTTS: Modeling And Transferring Spontaneous Style For TTS

作者列表:李函昭、朱新发、薛浏蒙、宋阳、陈云琳、谢磊
合作单位:出门问问、香港中文大学(深圳)
论文摘要:自发语音合成(Spontaneous speech synthesis)旨在模仿人类自然说话的方式,包括讲话中出现的不自觉停顿、拖音等自发现象,以及更加多变的语气、语调、语速和节奏,甚至包括一些非语言内容,如笑声。这些因素使得自发风格语音合成具有挑战性。此外,受限于高质量的自发风格数据稀缺的情况,合成带有目标说话人音色的自发风格语音成为一项挑战。为了解决这些问题,本文借助神经网络瓶颈 (BN) 特征来解耦说话人音色和风格,提出了一种基于两段式的方法来建模和迁移自发风格,称为 SponTTS。第一阶段使用条件变分自编码器(CVAE)从 BN 特征中学习自发风格表征,并通过自发现象标签预测损失来约束该表征与自发现象相关。为了在推理阶段能够预测出符合上下文语境的自发现象并丰富韵律变化,引入了基于流(Flow)的自发风格预测器,从文本中预测自发风格表征。第二阶段使用类似 VITS 的模块,利用 BN 特征和目标说话人音色嵌入作为输入来合成目标说话人音频。实验结果表明,SponTTS 能够有效使用目标说话人音色模拟自发说话风格,生成高自然度、高表现力、高音色相似度的自发风格语音。零样本(zero-shot)测试结果进一步验证了 SponTTS 在生成未见说话人的自发风格语音方面的鲁棒性和泛化能力。
论文网址:https://arxiv.org/abs/2311.07179
样例网址:https://kkksuper.github.io/SponTTS/


NO.4

An Audio-Quality-Based Multi-Strategy Approach For Target Speaker Extraction In The MISP 2023 Challenge

作者列表:韩润铎、闫晓鹏、许伟铭、郭鹏程、孙佳耀、王贺、陆全 、蒋宁、谢磊
合作单位:马上消费
论文摘要:我们在2023年多模态信息语音处理(MISP)挑战中提出了一种基于音频质量的多策略方案,用于音视频目标说话人提取(AVTSE)任务。该方案根据音频质量的高低采取不同的目标说话人提取策略,平衡了干扰声音的移除和语音的保留,有利于后端自动语音识别(ASR)系统。实验表明,该方案在开发集和评估集上分别实现了24.2%和33.2%的字符错误率(CER),在挑战中获得了第二名的优异成绩。
论文网址:https://arxiv.org/abs/2401.03697

NO.5

BS-PLCNet: Band-Split Packet Loss Concealment Network With Multi-Task Learning Framework And Multi-Discriminators

作者列表:张子晗、孙佳耀、夏咸军、黄传增、林丹峰、谢磊
合作单位:字节跳动
论文摘要:丢包是网络电话(VoIP)系统中不可避免的常见问题。为解决这一问题,我们提出了一种频带分解的丢包隐藏网络(BS-PLCNet)。具体来说,我们将全带信号分为宽频带(0-8kHz)和高频带(8-24kHz)。宽带信号由门控卷积递归网络(GCRN)处理,而高频带信号则由简单的 GRU 网络处理。为确保高质量的语音和对语音识别(ASR)的兼容性,我们使用了多任务学习(MTL)框架,包括基频(f0)预测、语言感知,同时多判别器策略也被用于网络训练中。所提出的方法在 ICASSP 2024 PLC 挑战赛中获得并列第一名的优异成绩。
论文网址:https://arxiv.org/abs/2401.03687
样例网址:https://zzhdzdz.github.io/BS-PLCNet

NO.6

RaD-Net: A Repairing And Denoising Network For Speech Signal Improvement

作者列表:刘铭帅、陈庒祺、闫晓鹏、吕元骏、夏咸军、黄传增、林丹峰、谢磊
合作单位:字节跳动
论文摘要:在ICASSP 2024 SSI 挑战赛中,我们扩展了上届竞赛使用的基于语音恢复和降噪的两阶段网络框架,提出RaD-Net模型,用于消除通信系统中语音信号面临的各种失真。具体来说,首先将恢复网络替换为TEA-PSE中的Com-Net。其次,在训练阶段引入了多分辨率判别器和多子带判别器。最后使用三阶段训练策略来优化模型。为了满足不同赛道实时率的要求,我们提交了两个不同参数量的RaD-Net模型。根据官方结果,所提交的系统在赛道一中获得第二名,在赛道二获得第三名的优异成绩。
论文网址:https://arxiv.org/abs/2401.04389
样例网址:https://github.com/mishliu/RaD-Net


NO.7

SELM: Speech Enhancement Using Discrete Tokens And Language Models

作者列表:王子谦,朱新发,张子晗,吕元俊,蒋宁,赵国庆,谢磊
合作单位:马上消费
论文摘要:语言模型(LM)近期在各种语音生成任务中发挥出卓越的性能,展现了其在语义上下文建模方面的强大能力。鉴于语音生成和语音增强之间的内在相似性,利用语义信息可能对语音增强任务具有潜在优势。为此,我们提出了SELM,一种语音增强的新范式,通过集成离散表征来利用语言模型。SELM包括三个阶段:编码、建模和解码。我们使用预训练的自监督学习(SSL)模型和K-Means聚类将连续的波形信号转换为离散表征。在此之后,语言模型建模隐藏在离散表征中的全面上下文信息。最后,通过将聚类中心簇的坐标应用于HiFi-GAN还原得到增强后语音。实验结果表明,SELM在客观指标上与当下最先进模型取得了可比性能,同时在主观听感上取得了更好的效果。
论文网址:https://arxiv.org/abs/2312.09747
样例网址:https://honee-w.github.io/SELM/

NO.8
MLCA-AVSR: Multi-Layer Cross Attention Fusion Based Audio-Visual Speech Recognition

作者列表:王贺、郭鹏程、周盼、谢磊
合作单位:理想汽车
论文摘要:在嘈杂环境中,语音识别(ASR)系统的性能通常会显著下降,而基于音频和视频的视听语音识别(AVSR)系统可以利用不受噪声影响的是视频对受损的音频信息进行补充,提高系统整体的鲁棒性。不过,目前的视听语音识别研究主要集中在融合经过建模的音视频模态高维表征,比如编码器的输出,没有考虑在模态特征建模期间的音视频上下文信息。本文提出了一种基于多层交叉注意力机制的AVSR(MLCA-AVSR)方法,在音频和视频编码器的不同层利用交叉注意力机制融合音视频信息。实验阶段采用了MISP2022-AVSR数据集来验证MLCA-AVSR的有效性,并在测试集上实现了30.57%的最小连接排列字符错误率(cpCER),相较于我们在MISP2022挑战赛中提交的系统降低了3.17%。在融合多个系统之后,cpCER进一步降低至29.13%,超越了挑战赛的第一名,取得了该数据集上SOTA的性能。
论文网址:https://arxiv.org/abs/2401.03424

NO.9

Automatic Channel Selection And Spatial Feature Integration For Multi-Channel Speech Recognition Across Various Array Topologies

作者列表:穆秉甡,郭鹏程,郭大可,周盼,陈伟,谢磊
合作单位:理想汽车
论文摘要:自语音识别(ASR)取得了显著的进展,但在现实远场多录音设备多阵列拓扑结构的场景中仍然面临挑战。CHiME-7远场ASR任务的目标是设计一个能够泛化多录音设备多阵列拓扑结构,并在现实环境中提供可靠识别性能的统一系统。为了完成这一目标,我们提出了一个ASR方案,该方案在各种阵列拓扑结构上表现出色。首先,我们提出了两个基于注意力机制的自动通道选择模块,用于为每个语句从多个录音设备中选择最有利的多通道信号的子集。此外,我们引入了跨通道空间特征,以增强多帧跨通道注意力的有效性,帮助ASR系统提高空间信息感知能力。最后,我们提出了一个受U-Net架构启发的多层卷积融合模块,将多通道输出集成为单通道输出。在CHiME-7数据集上的实验结果表明,我们提出的ASR方案相对于基线ASR在评估集上的DA-WER实现了40.1%的相对降低。
论文网址:https://arxiv.org/abs/2312.09746

NO.10

ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge

作者列表:王贺、郭鹏程、李越、张奥、孙佳耀、谢磊、陈伟、周盼、卜辉、徐昕、张彬彬、陈卓、巫健、王龙标、Eng Siong Chng、李荪
合作单位:理想、希尔贝壳、WeNet社区、字节、微软、天津大学、南洋理工大学、中国信息通信研究院
论文摘要:为促进在驾驶场景中的语音处理和识别研究,我们在ISCSLP 2022成功举办智能驾驶座舱语音识别挑战(ICSRC)的基础上,在ICASSP2024上推出了车载多通道自动语音识别挑战(ICMC-ASR)。此次ICMC-ASR挑战赛发布了在新能源汽车内录制的100多小时多通道语音数据以及用于数据增广的40小时噪声数据。挑战赛设有语音识别(ASR)和语音分离和识别(ASDR)两个赛道,分别使用字符错误率(CER)和连接最小排列字符错误率(cpCER)作为评价指标。本次挑战赛吸引了国内外共计98支队伍参赛,并在两个赛道上收到了53个有效提交结果。根据两赛道结果,USTC-iflytek团队获得了双赛道第一名,在ASR和ASDR赛道上分别取得了13.16%的CER以及21.48%的cpCER,相较于基线系统分别降低了13.08%和51.4%。
论文网址:https://arxiv.org/abs/2401.03473