语音合成 (Text-to-speech, TTS) ,作为一种当前火热的AI生成任务,又称文语转换,是服务于语音交互、信息播报、有声朗读等任务的核心技术。在深度学习的推动下语音合成的自然度和音质得到了极大的提升。然而,人类语音不仅承载语言信息,而是富含表现力和极具情感的。如何在合成语音中呈现适当的情感对于构建多样化的音频生成系统至关重要。目前大多数情感语音合成系统都是基于单一说话人多情感语音数据建模的,但随着语音合成应用场景的不断扩展,对多人多情感语音合成的需求越来越大。然而多人多情感数据难以获取,一种最直接的方式是通过跨说话人情感迁移(cross speaker emotion transfer)的方法来解决该问题。
跨说话人的情感迁移任务的目标是将情感从具有情感数据的源说话人迁移到新的没有该情感的目标说话人上,使目标说话人的合成语音能够表达其系统训练数据中不存在的情感。在情感迁移过程中,源说话人的身份信息也会影响合成结果,导致说话人音色泄漏(leakage of speaker timbre)问题,即合成语音听上去具有一定源说话人的音色。同时在情感语音合成任务上,实现情感强度可控也是一个非常实际的需求,比如合成语音可以表达强、中、弱的高兴情感。因此,在跨说话人情感TTS任务中合成可控的情感语音,同时保持目标说话人的音色仍是一项极具挑战性的任务。
西工大音频语音与语言处理研究组(ASLP@NPU)近年来致力于高表现力语音合成相关研究。近期,实验室发表的跨说话人场景下的论文“Cross-speaker emotion disentangling and transfer for end-to-end speech synthesis synthesis”被语音研究领域顶级期刊IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP)接收,该论文是先前在ISCSLP会议上发表的同说话人场景下的可控情感迁移方案[1]的扩展。本文提出了一种基于解耦语音中情感和说话人成分的跨说话人情感迁移建模方案。在主流端到端语音合成框架下,通过两个子模块,对语音中的情感和说话人成分进行有效地解耦和限制。在一个模型框架下,实现将情感从源说话人迁移到目标说话人,使目标说话人的合成语音能够表达目标说话人的训练数据中不存在的各种情感。此外,我们还提出了一种直观的方法来控制目标说话人合成语音中的情感强度。现对论文进行简要的解读和分享。

论文题目:Cross-speaker emotion disentangling and transfer for end-to-end speech synthesis
作者列表:李涛,王新升,谢启聪,王智超,谢磊
发表期刊:IEEE/ACM Transactions on Audio, Speech and Language Processing
论文原文:https://ieeexplore.ieee.org/document/9747987

近年来,随着深度学习的发展,基于神经网络的语音合成系统能够生成与人类语音非常接近的语音。然而,为了满足多样化的语音交互场景,不仅需要合成高表现力的语音,更需要实现“单人千面”的功能,最典型的功能就是让每个TTS音色都能够实现不同情感的表达。然而高质量的单人多情感数据难以获取,为了实现多情感合成,通常需要每个发音人录制各种情感数据。一种最直接的方式是通过语音情感迁移(emotion transfer)的方法来解决该问题,即“借助”他人录制语音的情感,通过迁移学习,实现目标说话人具有该情感的语音合成。
基于参考音频的情感(风格)迁移是实现情感语音合成的一种有效途径,可大致分为同说话人(same speaker)和跨说话人(cross speaker)场景。same speaker场景[2,3]是根据目标说话人的参考音频和输入文本,合成同一说话人具有参考音频中情感的语音,这种场景的局限是显而易见的,它只能生成与训练数据相同说话人的合成语音。相比之下,cross speaker场景的目的是将源说话人参考音频中的情感迁移到具有目标说话人音色的合成音频上[4,5,6,7,8],使目标说话人能够表达其模型训练数据中不存在的各种情感。然而,由于情感来自另一个(源)说话人的语音,该源说话人的音色信息也可以被传递到合成语音,使合成语音听起来像源说话人或者介于源说话人和和目标说话人之间,即所谓的说话人音色泄漏问题。为了减少源说话人音色泄漏到目标语音上,现有方法不得不在情感的迁移质量和说话人音色保持之间进行折衷,导致合成语音中传递的情感表现力不足,或者仍然存在源说话人音色泄漏[9]。此外,录制一个带有不同情感类别和情感强度标签的语料库非常具有挑战性,这使得很难提供一个合适的参考音频来传递所需的情感强度到目标合成语音上。
为了从源说话人的参考音频中迁移情感来合成目标说话人的情感语音,同时在合成语音中保持目标说话人的音色,本文提出了一种新的跨说话人情感迁移TTS方案。具体来说,所提出的方法是一个基于Tacotron2的TTS系统,以情感嵌入作为条件变量,提供参考语音的情感信息。为了得到说话人无关和有情感判别性的情感嵌入,本文提出了一个情感结偶模块(EDM),约束情感嵌入与以相同语音作为输入生成的说话人嵌入之间彼此正交。提出的EDM不仅用于情感嵌入的学习,还在训练过程明确约束预测Mel谱的情感类别和说话人身份。同时,为了进一步确保了参考情感和合成情感之间的一致性,在参考音频和预测的Mel谱之间添加情感匹配损失进行约束。此外,我们还旨在回答这样一个问题:在没有人工标注情感强度的情况下,是否可以实现合成语音的情感强度控制?为此,本文引入了一种基于标量值的方法来调整学习到的情感嵌入所携带的情感强度。
图1 为跨说话人情感迁移的整体方案,采用基于注意力机制的序列到序列TTS框架,结合了本文提出的情感结偶模块(EDM)。在模型训练中EDM以解耦参考Mel谱中的情感和说话人表征作为目标进行学习,以获得说话人无关的情感嵌入。该 EDM 还用于decoder之后以预测 Mel 谱作为输入,以约束合成语音的情感和说话人身份。目标说话人的身份由Identity Controller提供。此外,在合成时还使用了一个灵活的情感标量来控制情感强度。

图1 语音风格迁移框架图
Emotion Disentangling Module (EDM): EDM通过学习情感编码器,将说话人信息从情感嵌入中分离出来,从而获得与说话人身份无关的情感嵌入。EDM由两个编码器组成,即说话人编码器和情感编码器。情感编码器生成的情感嵌入e_i对于情感类别应该是有判别性的,并且与从同一音频中提取的说话人嵌入s_i不相关。
情感编码器:为了使情感嵌入e_i在区分不同情感时具有判别性,采用了基于情感类别的分类损失。同时,为了使情感嵌入与说话人信息无关,提出了正交性损失的概念。具体来说,假设我们有一个从同一音频中提取的与情感无关的说话人嵌入s_i与情感嵌入e_i,目标是最小化式(2)的正交性损失。


学习与情感无关的说话人嵌入: 说话人编码器产生的说话人嵌入s_i应该是 1)具有对说话人身份的辨别性,2)不包含与情感相关的信息。为此,使用两个loss函数来优化说话人编码器。一种是分类损失,使得到的说话人嵌入具有说话人身份判别性。另一种是对抗损失,使获得的说话人嵌入与情感不相关。这里,在说话人编码器和基于情感的分类器之间采用了梯度反转层(GRL),使说话人编码器不能产生具有情感判别性的嵌入。因此,我们可以最小化这种基于情感的分类器的分类损失,从而在情感分类任务中反向优化说话人编码器。


最终情感解耦模块EDM的总目标为:

EDM for explicit constraint: EDM还用于decoder,以确保 1)约束预测Mel谱的情感类别和说话人身份,2)参考Mel谱和预测Mel谱之间的情感一致性。值得注意的是两个EDM的参数不是共享的,但它们具有类似的目标函数。
Emotion matching loss:除了以 high-level 的方式监督情感编码器,即使用情感分类器。确保合成语音的情感表示与参考语音的情感表示相似也至关重要。为此,引入了情感匹配损失来约束合成Mel谱的情感嵌入接近参考语音的情感嵌入。这种情感匹配缺失的详细信息可参考我们之前的工作[1]。
Emotion strength control:本文使用情感标量乘以情感嵌入的方式来控制推理阶段的情感传递强度。这类似于图像风格转换中的程度控制。在训练过程中,这个标量始终等于1。
Speaker identity controller:虽然情感无关的说话人表示可以通过EDM模块的说话人编码器获得,但由于对抗训练策略,学习到的说话人表示对于控制说话人的身份是不稳定的。因此,我们采用一个可训练的说话人lookup table来提取目标说话人的说话人嵌入。
实验设置:为了将情感从源说话人迁移到目标说话人,需要一个至少由两个说话人构成的语料库,其中一个是源说话人以提供情感语音,另一个是只有中性(无情感)而没有情感语音数据的目标说话人。表1汇总了本文用来评估所提出方法在cross speaker情感转移TTS任务中性能的语料库。
表1 本文实验所用的语料库

对于情感强度控制,考虑到情感嵌入所传递的情感信息在“挤出”源说话人音色的过程中往往会被削弱,这可能会使合成语音中的情感变得平淡[9],为此将标量设置为1来表示较弱的情感强度,并使用2和3来表示相对中等和较强的强度。
实验内容:本文从与源说话人情感语音的情感相似度,目标说话人语音的音色相似度和情感强度控制三个方面来进行评估。使用多说话人Mspk-GST和Mspk-VAE作为基线系统,与本文对比情感相似度和说话人相似度;情感强度控制通过分析F0、情感强度排序和CMOS进行评估。
与基线系统的对比:对跨说话人情感迁移采用计算DMOS分数、speaker cosine similarity 和情感嵌入可视化的方式,分别对情感相似度和说话人身份保持进行评估。从DMOS、speaker cosine similarity 和可视化结果中,能够看出本文提出方法的效果在整体上优于所有对比系统,尤其是在去除情感嵌入中源说话人音色的同时保持情感表现力上具有更为明显的优势。实验结果表明,提出的方法在跨说话人情感迁移任务上拥有更好的性能。
表2 目标说话人情感合成语音与目标说话人语音的说话人相似度,及与源说话人情感语音的情感相似度DMOS结果

表3 目标说话人情感合成语音与源说话人语音的说话人相似度DMOS结果

表4 目标说话人情感合成语音与源说话人语音、目标说话人语音的speaker cosine similarity 结果


图2 不同系统情感嵌入的情感类别t-SNE可视化结果,(a)gst, (b) VAE, and (c) Proposed EDM module

图3 不同系统情感嵌入的说话人身份t-SNE可视化结果,(a)gst, (b) VAE, and (c) Proposed EDM module
跨说话人情感强度控制:图4展示了目标说话人的情感强度排序结果。在该图中,对角线上的值意味着合成样本准确地反映了预期的情感强度。正如我们所看到的,对于所有的情感类别,在所有强度水平上都达到了很高的准确性。

图4 跨说话人情感强度控制混淆矩阵
图5显示了不同的情感类别在3种情感强度时合成语音的音高(F0)情况。结果显示,不同强度的音高轨迹呈现出相似的趋势,音高和时长等与情感相关的特征均会随着情感强度的变化而变化,从而证明了情感强度控制方法的有效性。

图5 跨说话人情感强度控制情感控制中生成语音的F0曲线
本文提出的可控情感迁移TTS方法提出了一个问题:用标量控制情感强度是否会影响目标说话人的身份保持?为了回答这一问题,对不同情感强度的合成语音进行了说话人相似性DMOS测试。结果如表5所示。可以看出,它确实显示了一种趋势,即更强的情感转移倾向于降低说话人相似性DMOS。然而,不同情感强度的言语之间的DMOS差异并不显著,情感控制对说话人保留的影响是可以接受的。
表5 三种强度下的目标说话人情感合成语音与目标说话人音色相似度的DMOS结果

消融实验:与我们的前期工作[1]相比,情感嵌入和说话人嵌入之间的正交约束是本文的主要扩展方法。这里我们进行了消融研究,评估了两种变体:1)没有对Tacotron编码器输入的情感嵌入约束采用正交约束,也没有对Tacotron解码器输出的说话人嵌入约束采用正交约束,即“w/o 2ort”;2) 正交约束仅用于Tacotron编码器输入的情感嵌入,即“w/o ort”。表6中展示了这两种变体和最终提出方法的性能比较。对于说话人相似性,“w/o 2ort”在所有评估的情感类型中获得最低的说话人相似得分,这是因为提取的情感嵌入包含源说话人的音色信息。在情感相似性方面,虽然“w/o 2ort”和“w/o ort”的情感表达优于所提出的方法,但这些性能差异并不显著。这些结果表明,所提出的情感传递TTS模型设计良好,能够更好地在说话人音色保持与情感表现力之间取得平衡。
表6 三种强度下的目标说话人情感合成语音与目标说话人音色相似度的DMOS结果

由于页面数量限制,仅仅展示部分demo,更多样例请访问:https://silyfox.github.io/multispkemotion/
目标说话人训练集中性语音样例
基于源说话人情感语音为目标说话人合成的不同强度的情感语音
[1] T. Li, S. Yang, L. Xue, and L. Xie, “Controllable emotion transfer for end-to-end speech synthesis,” in Proc. ISCSLP, 2021, pp. 1–5.
[2] H. Li, Y. Kang, and Z. Wang, “Emphasis: An emotional phoneme-based acoustic model for speech synthesis system,” in INTERSPEECH, 2018.
[3] X. Zhu, S. Yang, G. Yang, and L. Xie, “Controlling emotion strength with relative attribute for end-to-end speech synthesis,” 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pp. 192–199, 201.
[4] Y. Wang, D. Stanton, Y. Zhang, R. Skerry-Ryan, E. Battenberg, J. Shor, Y. Xiao, F. Ren, Y. Jia, and R. A. Saurous, “Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,” in Proc. ICML, 2018, pp. 5180–5.
[5] Y.-J. Zhang, S. Pan, L. He, and Z.-H. Ling, “Learning latent representations for style control and transfer in end-to-end speech synthesis,” ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6945–6949, 20.
[6] Y. Bian, C. Chen, Y. Kang, and Z. Pan, “Multi-reference tacotron by intercross training for style disentangling,transfer and control in speech synthesis,” arXiv preprint arXiv:1904.02373, 2019.
[7] R. Skerry-Ryan, E. Battenberg, Y. Xiao, Y. Wang, D. Stanton, J. Shor, R. Weiss, R. Clark, and R. A. Saurous, “Towards end-to-end prosody transfer for expressive speech synthesis with tacotron,” in international conference on machine learning. PMLR, 2018, pp. 4693–47.
[8] Z. Wang, X. Zhou, F. Yang, T. Li, H. Du, L. Xie, W. Gan, H. Chen, and H. Li, “Enriching Source Style Transfer in Recognition-Synthesis Based Non-Parallel Voice Conversion,” in Proc. Interspeech, 2021, pp. 831–835.
[9] S. Karlapati, A. Moinet, A. Joly, V. Klimkov, D. Saez-Trigueros, and T. Drugman, “Copycat: Many-to-many fine-grained prosody transfer for neural text-to-speech,” in INTERSPEECH, 2020.
