语音转换(Voice Conversion)旨在保留语言内容的同时,将源说话人语音转换成目标说话人的语音。随着深度学习技术的引入,语音转换技术取得了巨大的飞跃。现有的语音转换方法可以成功地实现音色的转换,但是对源音频中的风格韵律缺乏有效的建模和转换。对于配音等场景中,将源语音中的情感、风格有效地迁移(tranfer)到目标说话人的语音上至关重要,情感、风格这些副语言信息对于信息的准确表达具有重要作用。
西工大音频语音与语言处理研究组(ASLP@NPU)近年来致力于语音转换方向的研究。去年实验室发表的论文有效实现了语音转换过程中,目标说话人和口音的有效解耦,可以将源说话人语音转换到目标说话人带有口音的语音上,而目标说话人的建模数据不包含该种口音,详情见论文[1]。
近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和爱奇艺合作的论文“Enriching Source Style Transfer in Recognition-Synthesis based Non-Parallel Voice Conversion”被语音研究顶级会议INTERSPEECH2021接收[2]。该论文提出一种显隐式混合建模的方法,可以有效的利用从源音频中提取的显式韵律特征以及从梅尔谱和瓶颈特征中提取的隐式韵律特征,在语音转换中实现源风格到目标的有效迁移。现对该论文进行简要的解读和分享。
论文题目:Enriching Source Style Transfer in Recognition-Synthesis based Non-Parallel Voice Conversion
作者列表:王智超,周芯永,杨丰煜,李涛,杜洪强,谢磊,甘文东,陈海涛,李海
论文原文:http://arxiv.org/abs/2106.08741


背景动机
语音转换(Voice Conversion,VC)是一个在不改变语音内容的前提下,改变语音中说话人音色的一项技术,是语音研究领域中热门的研究方向。现有大多数的语音转换方法主要关注于音频中音色的转换和内容的保持。然而,源音频中的风格和韵律也需要准确的转换到目标上。韵律信息主要体现在音高、时长和响度等方面。韵律信息的保留对于表现力要求高的语音转换场景十分重要,比如配音、直播和数据增广等。因此研究语音转换中带源音频韵律的转换是十分有趣和有意义的。
在语音语音合成和语音转换两种典型的生成式任务中,韵律建模包含为两种方式:使用韵律特征进行显式建模(Explicit Modeling)和构建韵律提取器隐式建模(Implicit Modeling)。显式建模一般是指使用从语音中提取的韵律特征(Pitch, Loudness,Duration)来表示韵律信息。这种方式具有明确的解释性,能够使用不同的韵律特征对韵律进行独立的控制,但是由于语音风格、情感中韵律表达的复杂性,通过手工设计的特征难以完全准确的表征韵律。对于隐式建模,韵律提取器可以采用Referece encoder, GST, VAE等[3,4];其局限性也很明显,提取出来的韵律表征难以解释和控制,同时其中包含其他非韵律的成分。
本文选择了基于音素后验概率(Phonetic Posteriorgram, PPG) 的识别-合成(recognition-synthesis)语音转换框架[5]来保证在不同应用场景下的稳定性。该框架也是工业界应用中普遍使用的方案。在本文工作中没有直接使用PPG,而是使用的PPG前一网络层的瓶颈特征(Bottleneck Feature, BN),前期的研究也证明BN特征更加鲁棒。鉴于单独使用显式或者隐式建模的局限性,我们设计了一个混合韵律表征模块,有效地结合了显式和隐式的建模方法[6]。一方面,使用对数域基频和短时平均幅度表征音高和能量;另一方面,采用了VAE和reference encoder分别从梅尔谱(Mel Spectrum)和BN提取韵律表征,同时为了去除梅尔谱中的说话人相关的信息,引入了对抗训练策略。此外,我们使用加权聚合自注意编码网络(SA-WA)[7]从BN中提取上下文信息,它也隐式地从分层表征中聚合源语音的韵律信息。实验结果可以表明,在不影响目标语音质量和说话人相似度的情况下,提出的方案能够有效的转换源音频的韵律。
提出的方案
如图3所示,文中的模型结构是由三个组件组成的编码器-解码器结构:韵律模块(Prosody Module)、SA-WA编码器和自回归的解码器。韵律模块学习提取独立于说话人的韵律表示。利用SA-WA编码器从不同层级提取上下文信息。解码器将韵律、内容和说话人嵌入作为输入,输出目标语音mel谱。最后采用WaveRNN进行波形重构。

图3 本文模型结构
韵律模块包含显式建模和隐式建模两个部分。
显式建模:采用的是对数域基频(lf0)和短时平均幅度(energy)分别表示音高和能量,同时提取了vuv信息,来表征当前帧的是否是有声段。在实验中,为了减小说话人之间数值上的差异同时减小对韵律信息的改变,我们对lf0和energy使用了最大最小归一化。
隐式建模:该建模方法包括两个部分—带说话人分类器的VAE和参考编码器。其中VAE模型使用mel谱作为输入,由于mel谱中包含说话人相关信息可能导致VAE的输出和说话人相关,最终使转换语音的音色变化或带有源说话人音色信息,于是引入辅助的说话人分类器来,利用对抗过程去除说话人相关的信息。在该方案下,对抗训练的引入能有效去除VAE输出的说话人相关信息,但同时也会损失部分韵律信息。由于BN是一个说话人相对无关且包含韵律信息的特征,我们考虑使用reference encoder直接从BN中提取说话人无关的韵律加强韵律表征的能力。
SA-WA encoder:如图4所示,我们采用自注意加权聚合(SA-WA)编码器[7]来学习更加全面的句子表征,该表征通过聚合不同自注意层的上下文信息得到。SA-WA编码器分为三部分:Encoder Prenet、自注意模块和加权聚合模块。

图4 SA-WA encoder
模型训练分为下面两个步骤。
步骤一:基础模型,整个模型包含生成器和判别器交替训练。模型的loss组成如下所示。

步骤二:为了提高在特定说话人的稳定性和说话人相似度,需要在基础模型上进行finetune,在这里只对解码器部分进行了优化,其余网络进行冻结不进行更新,防止在finetune的过程中降低说话人无关信息提取能力以及前面网络对不同说话人的稳定性。
实验验证
实验中使用包含59个说话人42小时语音的多说话人语料库训练基础语音转换模型,同时采用标贝公开语料库DB1[8]作为目标说话人进行finetune。为了验证方案的有效性,我们选取的数据都是朗读风格缺乏表现力的数据。
主观测试:主观测试包含三个方面—音质、说话人相似度、源风格转换表现。前面两项采用了MOS的打分的方式,如表1所示。从表中可以看出,各个系统较目标语音(TA)的表现还是有一定的距离,系统之间在音质和说话人相似度上没有明显的差异,这个结果符合预期,在不影响说话人相似度和转换语音的质量的情况下去提高源风格转换的性能。同时在主观打分中,测试集每个句子风格不同,转换出来的风格没有对应风格的目标音频也会造成一些判断上的误差。
表1 语音质量和说话人相似度主观测试结果(MOS)

如图5所示,为了评价系统间对源音频风格的转换性能,我们采用了AB test的方式,从结果来看,文中提出的方法都能够提高系统的风格转换性能。

图5 表现力主观测试(ABtest)
客观测试:如表2所示,为了进一步验证系统对于源音频风格的转换能力,我们提取了源音频和转换音频的lf0和energy,计算了它们之间的Pearson相关系数,越高表示相关性越高。从能量和lf0分数来看,提出的方法(P3)的得分最高。
表2 相关系数 (lf0,energy)

为了更加直观的展示系统间的差异,绘制了源音频和转换音频对应的energy和f0走势,如图6所示,从图6(a)看出系统间在曲线的走势和轮廓上与源音频差别不大。从图6(b)中可以看出,P3较BL明显更加符合和源音频f0曲线的走势,同时P3有更大的音高变化范围和更加好的表现力。

图6 由不同系统产生的转换语音的能量和f0值(请关注曲线的变化趋势)
如图7所示,验证系统中显式韵律特征的有效性,我们使用了0.5、1、1.5的系数分别对energy和lf0进行控制。

图7 对系统中energy和f0的控制
如图8所示,这一项验证系统中使用说话人分类器对抗去除说话人信息的有效性,其中同一种颜色的代表同一个说话人。可以看到说话人去除的方法是有效的。

图8 VAE输出说话人验证
样例展示
先听一下目标说话人原始录音,原始录音建模数据没有明显情感(来自标贝db1)。
第一组(女声-情感,BL为基线系统结果,P为提出方法的结果)
第二组(女声-综艺,BL为基线系统结果,P为提出方法的结果)
第三组(男声-直播,BL为基线系统结果,P为提出方法的结果)
更多样例:
https://kerwinchao.github.io/SourceStyleTransfer.github.io/
参考文献
注:本文样例仅供科研技术展示。
