语音合成或文语转换(Text to Speech, TTS)是指将文本转换为自然语音的一类技术。人类的语音具有灵活多样的特点,正如“世界上没有两片完全相同的叶子”一样,针对同样的文本,我们每次发出的语音都各有不同,形成了各种“风格”(style)。具体来说,在不同的语境下,我们的讲话“风格”就更加明显,比如新闻播报、客服、诗歌、小说风格各有不同。我们期待一个语音合成系统具备合成不同风格语音的合成能力,实现“单人千音”的效果。
为此,语音风格迁移(Speech Style Transfer)技术是一种旨在保持说话人身份的同时,将源语音中的风格迁移到目标语音上的技术。随着深度学习技术的不断发展,端到端语音合成框架在语音风格迁移上已经展现出良好的性能,但是这种性能仍然局限在训练数据中见过的风格和说话人。此外,录制新风格的训练样例也耗时耗力。将源语音的风格有效地迁移到具有不同风格的目标语音上是语音合成中一项极具挑战性的任务。

西工大音频语音与语言处理研究组(ASLP@NPU)一直关注语音风格迁移方面的研究工作。去年针对风格迁移中情感表示不丰富的问题,对GST-tacotron进行了改进,提出了基于端到端语音合成的可控情感迁移方案[1]以便更好的迁移语音中的情感。
近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和微软亚洲研究院(MSRA)合作的论文“Improving Performance of Seen and Unseen Speech Style Transfer in End-to-end Neural TTS”被语音研究顶级会议INTERSPEECH2021接收[2]。该论文提出了一种新的针对训练数据中见过的和未见过的语音风格迁移方法,利用不相交的多风格数据可以有效地实现见过的和未见过的风格的风格迁移。现对该论文进行简要的解读和分享。
论文题目:Improving Performance of Seen and Unseen Speech Style Transfer in End-to-end Neural TTS
作者列表:安晓春,宋謌平,谢磊
论文原文:https://arxiv.org/abs/2106.10003

发表论文截图

扫码直接看论文
背景动机
近来端到端神经TTS能够生成非常自然逼真的语音,对这些模型的扩展也表明语音风格,如情感,说话风格,能够被很好的建模。但随着语音合成应用场景的发展,对单人多风格的语音合成有极大的需求。然而,要获取大量的单人多风格语音数据和风格标注成本高且耗时耗力,一种有效的解决方法是对语音进行风格迁移,从而满足单人多风格应用场景的需求。
当前常采用基于GST和VAE的方法[3][4]来实现语音的风格迁移任务。理论上,这两种方法及其变体都能够在连续的潜在空间中建模任何复杂的风格以便于通过操作一个参考音频的潜在变量或变分推断来控制或迁移风格。但是,这些模型建模所有的语音风格到一种表示,该表示包含太多的推断信息以至于这些信息不鲁棒和不可解释,缺乏独立迁移特定风格的能力,且在不相交的多风格数据上不能实现风格迁移。为了解决这些问题,文献[5]和[6]分别引进了基于多参考编码器的交叉训练和对抗循环一致性训练方法来分解多种风格,从而实现在不相交数据上的风格迁移。虽然这两种方法改善了风格迁移的性能,但他们仍有一个限制:只能迁移在训练时见过的风格,并不能从一个有未知的、任意风格的新的说话人的语音迁移到目标风格上,这就极大的限制了语音合成的应用场景。此外,录制新风格的训练数据也具有挑战性,发音人不一定能驾驭新风格的演绎和录音。从一种数据集迁移语音风格到另一种数据集上是一项非常有意义的工作。因此,改善在不相交的、多风格的数据集上的可见的和不可见的风格迁移性能颇为重要。
为此,本文提出了一种新的可见的和不可见的语音风格迁移方法来改善语音风格迁移的性能和泛化性。首先,为了能更好地编码风格信息,本文采用逆自回归流 (IAF) [7] 方法来改进变分推断,然后采用四种不同损失函数的加权和最小化方法来优化整个系统:1)重构损失用于衡量源重构和目标重构中的失真;2)对抗损失的目的是“愚弄”判别器;3)风格差异损失用于衡量迁移后的预期风格的损失;4)周期一致损失用于保持迁移后源句子的说话人身份。实验结果表明该方法在主观和客观上都能有效地实现见过的和未见过的风格迁移,且该方法的性能比现有的四个基线系统更好更鲁棒。
方案介绍
如图1所示,文中的模型结构采用的是基于编码器-解码器的框架,主要包含风格编码器、说话人编码器和基于Tacotron2的解码器三个部分。风格编码器和说话人编码器分别学习并提取有区别的风格表示和说话人表示。解码器将风格和说话人文本嵌入作为条件输入,输出目标语音mel谱。最后采用LPCNet进行波形重构。

图1 本文模型结构
可见的和不可见的风格迁移:对于一个样例来说,在给定该样例的说话人嵌入和目标风格表示时,使用Tacotron2解码的序列应该在目标域。因此,使用重构损失来保证解码器中句子的重构精度,重构损失如下所示:

借鉴GAN的思想,本文引进了一个对抗损失,通过一个判别器D来辨别生成句子的真假,解码器的目的是愚弄该判别器,对抗损失如下所示:

但对一个样例来说,它的风格表示可以是任意值来最小化上面的重构损失和对抗损失,该表示也许不能够抓住句子的风格,这会影响说话人表示,使其不能够完全表示说话人身份,说话人身份应该不会随风格变化。为了解决这个问题,本文引进了风格差异损失来限制句子的风格表示应接近目标风格表示,风格差异所示如下所示:

此外,上面的损失只能约束生成的句子与目标风格对齐,但并不能确保源句子的说话人保持不变。因此,本文进一步引入循环一致性损失来限制迁移句子能够保持它源句子的说话人身份,使其能够以一种循环的方式来恢复源句子,循环一致性损失如下所示:

综上所述,最终损失是以上四个损失的加权和。
实验验证
实验中使用一个不相交的、多风格的汉语语料库,其中源数据包含朗读(R)、电台(B)、谈话(T)和读故事(S)四种风格,来自于四个说话人,而目标数据包含客服(C)和古诗(P)两种风格且来自于两个说话人。为了验证方案的有效性,我们分别随机选取见过的朗读风格(R)和没见过的一个来自于新的说话人的台湾口音朗读风格(TR)来分别迁移到目标风格客服(C)和古诗(P)上,具体如图2所示,图中不同颜色表示的是不同的说话人。

图2 多风格数据迁移示意图
实验中的对比方法如下所示:
GST:将全局风格符号[3]引入到Tacotron2 [8]中来实现语音风格的控制和迁移;
VAE:合并VAE [4]到Tacotron2 [8]中用以学习说话风格的潜在表示从而指导生成语音的风格;
MRF-IT:增加一个多参考编码器结构到GST-Tacotron2 [5]中并采用交叉训练的方法来控制和迁移语音的风格;
MRF-ACC:在多参考神经TTS风格化中使用对抗循环一致训练方法[6]来确保所有风格信息的使用从而实现语音的风格迁移;
Proposed:首先利用IAF来改善风格表示,然后引进四个不同的损失函数:重构损失、对抗损失、风格差异损失和循环一致性损失来一起确保在不相交的、多风格数据上的可见的和不可见的语音的风格迁移。
语音自然度测试:采用MOS和ABX的方式来评价语音的自然度,分别如表1和图3所示。可以看出,提出的模型在可见的和不可见的风格迁移上均要优于所有基线系统,且不可见的风格迁移的性能要比各个基线系统好的多,从而说明了提出的方法在不可见风格迁移任务上有较好的泛化性,同时也证明了该方法在语音自然度上的有效性。
表1 语音自然度MOS的测试结果


图3 语音自然度ABX的测试结果
风格相似性测试:如图4所示,为了评价各系统的风格转换性能,我们采用了风格相似性的ABX的方式,从结果来看,文中提出的方法比其他基线系统获得了较高的风格相似性。

图4 风格相似性ABX的测试结果
说话人相似性测试:为了评价迁移句子与源说话人音色的匹配程度,我们在提出的方法和每个基线系统间做了CMOS测试,如表2所示,从表中看出我们的模型比所有的基线系统均传递了较好的说话人相似性能。
表2 说话人相似性CMOS的测试结果

如表3所示,为了进一步验证系统对于源音频音色的保持能力,我们提取了源音频和迁移音频的说话人嵌入,计算了它们之间的余弦距离,值越大表示音色保持能力越高。从余弦距离值来看,提出的方法的最高。
表3 说话人相似性的余弦距离结果

样例展示
请访问:https://xiaochunan.github.io/transfer/index.html。
参考文献
[1] T. Li, S. Yang, L. Xue, and L. Xie, “Controllable emotion transfer for end-to-end speech synthesis,” in Proc. ISCSLP, 2021, pp. 1–5.
[2]X. An, F. K. Soong, and L. Xie, “Improving performance of seen and unseen speech style transfer in end-to-end neural TTS,” in INTERSPEECH, 2021, Brno, Czech Republic, Aug 30 - Sept 3, 2021.
[3] Y. Wang, D. Stanton, Y. Zhang, R. Skerry-Ryan, E. Battenberg, J. Shor, Y. Xiao, F. Ren, Y. Jia, and R. A. Saurous, “Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,” in Proc. ICML, 2018, pp. 5180–5189.
[4] Y. Zhang, S. Pan, L. He, and Z. Ling, “Learning latent representations for style control and transfer in end-to-end speech synthesis,” in Proc. ICASSP, 2019, pp. 6945–6949.
[5] Y. Bian, C. Chen, Y. Kang, and Z. Pan, “Multi-reference tacotron by intercross training for style disentangling, transfer and control in speech synthesis,” in Proc. INTERSPEECH, 2019.
[6] M. Whitehill, S. Ma, D. McDuff, and Y. Song, “Multi-reference neural TTS stylization with adversarial cycle consistency,” in Proc. INTERSPEECH, 2020, pp. 4442–4446.
[7] D. P. Kingma, T. Salimans, R. Jozefowicz, X. Chen, I. Sutskever, and M. Welling, “Improving variational inference with inverse autoregressive flow,” in Proc. NIPS, 2016, pp. 4743–4751.
[8] J. Shen, R. Pang, R. J. Weiss, M. Schuster, N. Jaitly, Z. Yang, Z. Chen, Y. Zhang, Y. Wang, R. Skerrv-Ryan, R. A. Saurous, Y. Agiomyrgiannakis, and Y. Wu, “Natural TTS synthesis by conditioning WaveNet on mel spectrogram predictions,” in Proc. ICASSP, 2018, pp. 4779–4783.
相关链接:
