为促进最新研究成果的传播与交流,CCF语音对话与听觉专委在专委会微信公众号启动论文导读栏目,定期分享最新语音、对话与听觉相关研究方向论文。本期是INTERSPEECH 2024专题第三部分,共遴选了8篇论文,覆盖语音合成、音色转换、情感识别、声码器、语音增强等研究方向。


此次INTERSPEECH2024专题导读论文仍在持续征集中,欢迎踊跃投稿,投稿方式请参见文末指南。


1

Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining

2

Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model

3

SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion

4

Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition

5

FreeV: Free Lunch for Vocoders Through Pseudo Inversed Mel Filter

6

Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

7

Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling

8

RaD-Net 2: A Casual Two-Stage Repairing and Denoising Speech Enhancement Network with Knowledge Distillation and Complex Axial Self-Attention


1. Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining

【论文作者】薛锦隆,邓雅月,高迎明,李雅

【论文单位】北京邮电大学

【作者邮箱】{jinlong xue, yayue.deng, yingming.gao, yli01}@bupt.edu.cn

【论文亮点】最近的基于提示的文本到语音模型能够通过仅一小段语音提示来克隆未见过的说话者,利用强大的上下文能力模仿语音提示的风格、韵律和情感。然而,当前的基于提示的TTS模型通常是手动或简单地随机选择语音提示,因此我们将检索增强生成(RAG)方法与基于提示的TTS相结合,并提出了一个上下文感知对比语言-音频预训练(CA-CLAP)模型来提取上下文感知、与风格相关的特征。

【论文简介】最近基于提示的文本到语音模型可以仅使用一段短语音提示来克隆一个未见过的说话者。它们利用强大的上下文能力来模仿语音提示,包括说话者的风格、韵律和情感。因此,选择语音提示对生成的语音有很大的影响,类似于大语言模型中提示的重要性。然而,当前基于提示的TTS模型是手动选择语音提示或简单地随机选择。因此,在本文中,我们将来自LLMs的检索增强生成(RAG)适应到基于提示的TTS中。与传统的RAG方法不同,我们还在检索过程中额外考虑了上下文信息,并提出了一个上下文感知对比语言-音频预训练(CA-CLAP)模型来提取上下文感知、与风格相关的特征。客观和主观评估表明,我们提出的RAG方法优于基线,我们的CA-CLAP比仅文本检索方法取得了更好的结果。



我们提出的方法包括三个部分:索引、检索和生成。索引过程是一个关键的初始步骤,通过预训练的上下文感知对比语言-音频模型(CA-CLAP)的音频编码器将所有可能的音频提示转换为与风格相关的表示,随后构建语音嵌入数据库。在检索阶段,它作为关键的相似性比较依据。接下来,在检索过程中,当前的文本和上下文通过预训练的CA-CLAP文本编码器编码为与风格相关的文本特征(STFs)。生成的上下文感知文本表示作为查询,用于计算与索引的语音嵌入数据库中矢量化音频提示的相似度分数。然后,模型优先选择并检索与其最相似的前K个音频提示。最后,在生成过程中,我们使用前P个提示并将它们连接起来作为最终的音频提示,以指导预训练的基于提示的TTS系统生成合适的语音。

【论文链接】https://arxiv.org/abs/2406.03714

【Demo】https://happylittlecat2333.github.io/interspeech2024-RAG/


2. Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model

【论文作者】薛锦隆,邓雅月,韩易辰,高迎明,李雅

【论文单位】北京邮电大学

【作者邮箱】{jinlong xue, yayue.deng, adelacvgaoiro, yingming.gao, yli01}@bupt.edu.cn

【论文亮点】大语言模型和音频编解码器的进展推动了零样本文本到语音技术的发展,但它们无法利用长上下文信息。我们提出一种新型语音合成模型,利用多模态上下文增强的Qformer(MMCE-Qformer)来使用长上下文内容,并且预训练LLM来预测语义标记,再用SoundStorm生成声学标记,提高了音频质量和说话者相似度。

【论文简介】 最近在大语言模型和音频编解码器方面的进步极大地推动了零样本文本到语音技术的发展。它们能够仅通过三秒未见说话者的语音作为声学提示来合成个性化语音。然而,它们仅支持短语音提示,并且不能利用在有声读物和对话语音合成场景中所需的更长的上下文信息。在本文中,我们介绍了一种基于新型音频编解码器的语音合成模型,该模型通过多种增强来适应上下文特征。受到Qformer成功案例的启发,我们提出了一种多模态上下文增强的Qformer(MMCE-Qformer),以利用额外的多模态上下文信息。此外,我们适应了一个预训练的LLM,利用其理解能力来预测语义标记,并使用SoundStorm生成声学标记,从而提高音频质量和说话者相似度。广泛的客观和主观评估表明,我们提出的方法在各种上下文TTS场景中优于基线。




整个模型由四个主要部分组成:用于提取语义和声学标记的统一音频编解码模型,利用多模态上下文信息并增强输入文本特征的多模态上下文增强Qformer编码器(MMCE-Qformer),从预训练的大型语言模型(LLM)适配的文本到语义自回归模型,以及用于语义到声学阶段的SoundStorm模型。在第一阶段,MMCE-Qformer 从多模态上下文和输入文本中提取文本和音频 Qformer 嵌入以及上下文增强的文本嵌入。然后,文本到语义模型基于提取的特征和提示语义标记生成适当的语义标记。我们将这些输入连接起来并输入预训练的 LLM,利用其理解和上下文学习能力。在第二阶段,我们采用 SoundStorm 在生成的语义标记和语音提示的条件下添加音色等声学特征,以预测声学标记。最后,音频编解码器将输出转换回生成的语音。

【论文链接】https://arxiv.org/abs/2406.03706

【Demo】https://happylittlecat2333.github.io/interspeech2024/


3. SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion

【论文作者】白炳松,王风平,高迎明,李雅

【论文单位】北京邮电大学

【作者邮箱】bingsongbai@bupt.edu.cn,wfp@bupt.edu.cn,

yingming.gao@bupt.edu.cn,yli01@bupt.edu.cn

【论文亮点】SPA-SVC模型在歌唱语音转换(SVC)领域取得了显著进展,特别是在处理源域和目标域音高范围差异较大的情况时,能够显著缓解生成哑音的问题,并能提升一般场景下的歌声合成质量。

【论文简介】SPA-SVC模型是一种针对歌唱语音转换(SVC)任务的自监督音高增强方法。该方法的核心在于通过循环音高变换训练策略,解决了当源歌唱语音的音高范围显著超出目标域时,合成歌声中常常产生哑音的问题。SPA-SVC模型创新性地引入了循环音高变换训练策略和结构相似性指标(SSIM)损失,以增强SVC模型的性能。在公共歌唱数据集M4Singer上的实验结果表明,所提出的方法在一般SVC场景和跨域SVC场景中显著提升了模型性能。


图3.1 SPA-SVC框架图


在训练过程中,SPA-SVC首先提取自监督学习特征(SSL)、音量特征(Vol)和基频(F0),并确定说话者身份信息(Speaker ID),再将这些特征经过网络层相加得到歌声的嵌入信息输入到可微数字信号处理(DDSP)模型进行歌声重建。在第一次歌声重建时,对原始基频音高变换的半音数设定为6到18之间的随机整数,模拟带有哑音的升调后的歌声。然后模型再通过二次重建,生成恢复为原始音高的歌声。通过计算循环重建音频与原始音频的Mel频谱图之间的损失,优化DDSP模型,以生成高质量的歌唱语音。SPA-SVC的另一个主要创新是在歌声转换领域引入SSIM损失作为循环一致性损失(Cycle Loss),帮助模型更专注于歌声数据的整体结构和细节,从而提升SVC模型的整体性能。实验结果表明,SPA-SVC在无需额外训练数据与显著增加模型参数的情况下,在一般SVC场景和跨域SVC场景中的模型性能均有显著提升。总之,SPA-SVC模型通过自监督学习和创新的音高增强策略,在SVC领域展现了显著的性能提升,尤其是在处理跨域转换和音高范围较大的场景中,为歌唱语音合成技术的发展提供了新的可能性。

【论文链接】https://arxiv.org/abs/2406.05692

【代码链接】https://github.com/ShawnPi233/spa-svc

【Demo】https://shawnpi233.github.io/paper/spa-svc


4. Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition

【论文作者】李启飞,高迎明,文宇华,王聪,李雅

【论文单位】北京邮电大学

【作者邮箱】

lqifei@bupt.edu.cn,yingming.gao@bupt.edu.cn,2020212213@bupt.edu.cn,congwang@bupt.edu.cn,yli01@bupt.edu.cn

【论文亮点】本文提出一种新的基于多任务的多模态情感识别框架Foal-Net。它先对齐模态间的情感信息,再进行模态信息融合。此外,该框架还引进一种辅助模态融合的副任务MEM,用于促进模态信息融合,缓解难易样本导致模态信息融合不充分的问题。实验结果证明Foal-Net对多模态情感识别任务非常有效。

【论文简介】为了缓解多模态情感识别中模态间信息融合不充分的问题,本文提出了Foal-Net多模态情感识别框架。它由4个部分组成:音视频编码器、多模态融合模块、音视频情感对齐副任务(AVEL)和模态间情感标签匹配副任务组成(MEM),如图所示。音视频中包含很多共性的信息,例如性别、说话人、情感等等。模态融合过程中模型会同时关注到除情感外的其他信息。为了让模态融合有效且重点关注情感信息,Foal-Net先利用AVEL任务对齐两个模态间的情感信息,然后再进行音视频模态融合,来提升模态融合的有效性。此外,在训练过程中,对于简单样本模型只需要利用单一模态信息就能准确预测出样本情感,这会使得模型过多关注单一模态信息,导致模态信息融合不充分,在预测复杂样本不能有效的利用其它模态信息从而出现识别错误的情况。因此,Foal-Net引入MEM。它的目标是强迫模型利用两个模态信息判断当前样本对的情感是否相同,从而促进模态信息融合并引导模型更多地关注情感信息。最终,我们在在IEMOCAP语料库上评估进行的实验评估Foal-Net的有效性。实验结果表明,Foal-Net的性能超过了现有最先进方法,并且证明情感对齐在模态融合之前是必要的。


【代码链接】https://github.com/ASolitaryMan/Foal-Net


5. FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter

【论文作者】吕元骏,李海,闫影,刘俊辉,谢丹明,谢磊

【论文单位】西北工业大学、爱奇艺

【作者邮箱】yjlv@mail.nwpu.edu.cn,lxie@nwpu.edu.cn

【论文亮点】

一行代码

model_input = (mel_spec @ mel_filter.pinverse()).abs().clamp_min(1e-5)


【论文简介】声码器根据声学特征重建语音波形,在TTS系统中发挥着举足轻重的作用。基于频域重建的声码器(如Vocos和APNet2)最近取得了快速发展,在推理速度上超过了时域模型,同时实现了良好的音频质量。然而,这些频域声码器由于参数量过大,从而带来了额外的内存负担。受PriorGrad和SpecGrad的启发,我们使用伪逆估计初始频谱。这种简单的初始化大大减少了声码器所需的参数量。基于APNet2和精简后的幅度谱预测分支,我们提出了FreeV,与APNet2相比,FreeV实现了1.8倍的推理速度提升,而参数几乎只有一半。同时,FreeV在音质上优于APNet2,这说明我们在追求实时、高保真语音合成方面又向前迈进了一步。

【论文链接】https://arxiv.org/abs/2406.08196

【代码链接】https://github.com/BakerBunker/FreeV

【Demo】https://bakerbunker.github.io/FreeV


6. Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

【论文作者】李函昭,薛浏蒙,郭浩翰,朱新发,吕元骏,谢磊,陈云琳,殷昊,李志飞

【论文单位】西北工业大学、出门问问、香港中文大学(深圳)、香港中文大学

【作者邮箱】lihanzhao@mail.nwpu.edu.cn,lxie@nwpu.edu.cn

【论文亮点】本文提出首个专门为语音合成语言模型设计的单码本编解码器 Single-Codec。该编解码器以梅尔频谱作为建模目标,从特征解耦和语音内容建模两个方面出发提升单码本编解码器性能,能够在 304bps 带宽下将一秒语音压缩为 23 个离散单元。

【论文简介】借助多码本的语音编解码器,大语言模型范式能够被用于语音合成。然而多个码本会产生多个离散序列,这对语言模型的推理效率和鲁棒性构成了挑战。为了解决这个问题,我们提出了一种新的单码本语音编解码器——Single-Codec,用于高性能语音生成。Single-Codec 以梅尔频谱而非原始波形作为建模目标,从而能够有效压缩语音信息,同时保留重要细节。为了进一步增强编解码器的性能和语音合成的应用,Single-Codec 集成了几个关键组件:

1) 全局参考编码器用于解耦时不变特征。我们提取连续的全局表征而未离散化处理,并且从更长的参考段来捕获更多的声学细节,从而能够将足够的语音信息嵌入到单码本离散单元中。

2) BLSTM 模块用于上下文建模。该模块可帮助模型发现相邻帧之间的相关性,从而提高语音内容的聚类效率。

3) 混合采样模块。通过同时使用卷积和池化来下采样,转置卷积和复制来上采样,减轻上采样和下采样失真。

4) 重采样模块。鼓励编码器从声学序列中提取更多具有较低短时方差的发音相关信息。

与多码本的编解码器(如 EnCodec 和 TiCodec)相比,Single-Codec 在仅有 304bps 的较低带宽下,展现出了更高的重建质量,STOI、PESQ 以及说话人相似度分别达到 0.842,1.933 和 0.817。而基于大语言模型的语音合成上的实验结果进一步证实了 Single-Codec 的有效性,合成音频的自然度和说话人相似度均得到了提升。


图6.1 Single-Codec 模型结构图


【论文链接】https://arxiv.org/abs/2406.07422

【代码链接】https://kkksuper.github.io/Single-Codec


7. Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling

【论文作者】姜月鹏,李涛,杨丰煜,谢磊,孟猛,王育军

【论文单位】西北工业大学、小米

【作者邮箱】jiangyp@mail.nwpu.edu.cn,lxie@nwpu.edu.cn

【论文亮点】本文提出了一种适用于中文的基于多层次韵律建模的零样本语音合成模型。通过对不同尺度内容进行韵律建模,让模型捕获全局和细粒度的韵律特征,有效提升零样本场景下合成结果的自然度和表现力。

【论文简介】最近零样本语音合成方面的研究取得了显著进展,特别是在说话人相似性方面。然而当前的工作侧重于音色的泛化上,而忽略了韵律建模,这使得合成语音的自然度和表现力有限。为了解决这个问题,我们提出了一种新的实现音色和层次化韵律建模语音合成模型。该模型在较大规模数据集上进行训练。由于音色是与表现力密切相关的全局属性,我们采用全局向量来建模说话者的音色,同时指导韵律建模。考虑到韵律既包含全局一致性又包含局部变化,我们使用扩散模型作为韵律预测器,并设计韵律适配器来实现层次化韵律建模,进一步增强合成语音的韵律表现。实验结果表明,我们的模型不仅保持了与基线相当的音色克隆能力,还展现出更好的自然度和表现力。


【论文链接】https://arxiv.org/abs/2406.05681

【Demo】https://rxy-j.github.io/HPMD-TTS/


8. RaD-Net 2: A Casual Two-Stage Repairing and Denoising Speech Enhancement Network with Knowledge Distillation and Complex Axial Self-Attention

【论文作者】刘铭帅,陈庒祺,闫晓鹏,吕元骏,夏咸军,黄传增,林丹峰,谢磊

【论文单位】西北工业大学、字节跳动

【作者邮箱】liumingshuai@mail.nwpu.edu.cn,lxie@nwpu.edu.cn

【论文亮点】本文在基于生成式对抗网络的两阶段音质修复模型RaD-Net的基础上,提出了升级版本RaD-Net 2。在第一阶段,使用基于因果性的蒸馏策略,在保证模型为因果的前提下有效利用未来信息;在第二阶段,进一步引入轴向自注意力机制提升模型的特征提取能力。

【论文简介】在实时通信系统中,语音信号经常遭受多种损伤的干扰。近期,在ICASSP 2024语音信号改善挑战赛上,我们提出了一个基于修复和降噪的两阶段模型RaD-Net,该模型可以有效改善语音信号质量。然而由于没有有效利用未来信息以及卷积感受野的约束,模型的性能受到了限制。为了解决上述问题,我们将RaD-Net扩展为RaD-Net 2。首先,在第一阶段引入基于因果性的知识蒸馏,使用非因果模型作为教师模型来提升非因果模型的性能。此外,在第二阶段将复数轴向自注意机制应用于复数特征编码器和复数特征解码器。实验结果表明,与RaD-Net相比,RaD-Net 2在ICASSP 2024 SSI挑战盲测试集上带来了0.10 OVRL DNSMOS的改进。


【论文链接】https://arxiv.org/abs/2406.07498