
本文由清华大学、香港中文大学和虎牙信息科技有限公司合作,提出了一种基于混合瓶颈特征解耦语音内容和细粒度韵律信息的语音转换算法,可以实现高韵律自然度和高音色相似度的语音转换。特别地,我们发现在基于识别-合成框架的语音转换(VC)工作中,因为语音识别模型训练时所用的损失函数(CE或CTC)不同,导致识别模型提取的瓶颈特征(BNFs)所包含的信息存在局限,限制了语音转换的效果。本文提出的混合瓶颈特征(Hybrid BNFs)解耦方法,结合了 CE-BNFs 与 CTC-BNFs 的优点,提升了语音转换结果的音色相似度或韵律自然度指标。
论文链接:
https://arxiv.org/abs/2203.12813
语音转换效果试听:
https://thuhcsi.github.io/icassp2022-hybrid-bottleneck-vc/

对于非并行语音转换而言,一种常见的思路是将源语音和目标语音分别携带的内容信息和非内容信息进行解耦,然后再将它们组合起来并合成转换后的语音。保持内容和非内容信息的完整性并尽可能解耦,是产生高音色相似度和高质量音频的关键。
在基于识别-合成框架的语音转换方法中,语音识别模型丰富的先验知识提供了更为鲁棒的语言学特征,这些特征被认为和内容信息高度相关;常用的特征有识别模型最后一层的语音后验概率图(PPGs)或者先前层的中间输出瓶颈特征(BNFs)。现有工作大多通过交叉熵损失(CE loss)以及经过时间对齐的语音-文本数据训练识别模型并提取出CE-BNFs。但是我们发现CE-BNFs包含额外的源语音的韵律和源音色信息,且该信息会泄露到语音转换任务中。尽管转换后的语音能够保留细粒度的韵律信息,但是其音色相似度会存在较大局限。另一方面,通过CTC损失(CTC loss)训练并提取的CTC-BNFs则包含较为纯粹的内容信息,具有更好的内容解耦性能和更高的音色相似度。但是,我们发现CTC-BNFs丢失了较多的细粒度韵律信息,导致转换语音在韵律自然度上表现受损。如何将 CE-BNFs 与 CTC-BNFs 结合,综合它们各自的优点、避免其缺点,是本文的主要研究动机。
在本文中,我们通过合理的实验,验证了CTC-BNFs和CE-BNFs中包含的信息差异及其对语音转换效果的影响程度。为了保持CTC-BNFs 良好的解耦性能,同时保留 CE-BNFs 中包含的细粒度韵律信息,我们提出了一种基于两种BNFs混合的多对一(any-to-one) 语音转换方法。该方法试图从CE-BNFs中提取细粒度韵律信息,同时从 CTC-BNFs 中提取纯粹的内容信息;达到CE-BNFs和CTC-BNFs 方法的优势互补,在目标说话人音色相似度和韵律自然度、音频质量上都取得了更好的效果。
基于开源的Wenet框架,我们预训练了两个网络结构和训练数据完全相同的语音识别(ASR)模型,它们仅在数据标注(是否帧级别对齐)和损失函数上存在区别:CE-ASR使用CE loss和帧级别强制对齐的文本标注,而CTC-ASR则使用CTC loss和序列级别的文本标注。BNFs均提取自Conformer encoder的最后一层256维隐藏特征。
如下图所示,本文所提模型包括两个编码器,分别是韵律编码器(prosody encoder)和内容编码器(content encoder)。韵律编码器以CE-BNFs作为输入,输出韵律相关特征;且韵律特征被设置为比CE-BNFs具有明显小的维度。内容编码器以CTC-BNFs作为输入,输出内容相关特征。在获取内容和韵律特征后,将两者拼接在一起后送入基于Tacorton2的自回归解码器,以生成高质量的语谱。
为了更好地解耦韵律和内容信息,在训练阶段,本文在模型中使用了一种对抗-预测(adversarial-prediction)结构。在该结构中,韵律特征被送入到一个韵律预测器(prosody predictor),该预测器由两个子预测器组成,分别试图从韵律特征中预测基频和能量序列,以促进韵律编码器正确履行职责。另一方面,在对抗结构中,一个对抗内容预测器(adversarial content predictor)试图从韵律特征预测所提取的内容特征,并通过梯度翻转层将优化方向取反,最终达到减少韵律特征和内容特征信息重叠的目的。

实验验证
模型对比
为了验证所提方法的有效性,我们的基线模型基于基本的识别-合成语音转换框架,以单种BNFs作为输入,经过单一编码器-解码器结构生成语谱,如下图所示。该基线模型转换的语音具有前文所述的CE-BNFs或CTC-BNFs的特点。

需要注意的是,关于模型的参数量,虽然在训练阶段本文所提模型比基线模型具有更大的参数量;但在转换阶段,本文所提模型并不需要读入对抗-预测结构的参数,因此最终的参数增加量仍然处于可接受的水平。
实验设置
为了训练语音识别模型,我们使用了虎牙的3000小时直播数据。该数据由日常主播的直播场景组成,具有复杂的背景噪音。
为了训练语音转换模型,我们使用了一个内部女声数据集。该女性说话人包括2小时的中文语音,具有较为明显的风格。为了保证韵律多样性,我们将该数据变速处理扩增到10小时。
在瓶颈特征信息验证实验中,我们训练了一个以BNFs作为输入的说话人识别系统。该系统基于AISHELL-1、AISHELL-3、THCHS和本文所用语音转换数据集组成,共有381个女性说话人和252个男性说话人。
我们设计了一系列的主客观评测实验:基于说话人识别系统和帧级别的余弦相似度计算两种BNFs的信息含量;使用MCD/RMSE 对音色相似度和韵律自然度进行评价;使用5分制MOS和ABX主观评测验证所提方法的效果和各结构的有效性。
瓶颈特征信息验证
我们首先训练了一个以BNFs为输入的说话人分类模型,以验证不同BNFs所包含的说话人信息的区别。此外,考虑到相邻帧BNFs具有相同或接近的内容表征,其余弦相似度值越低代表细粒度的韵律变化越丰富,可以体现所包含韵律信息的丰富程度。因此,我们还计算了CE-BNFs 和 CTC-BNFs所有相邻帧BNFs的平均余弦相似度。实验结果如下表所示,结果表明CE-BNFs具有更多的韵律信息和说话人信息,而CTC-BNFs具有更纯粹的内容信息。

对比实验
为了验证不同语言学表征(BNFs还是PPGs)的输入对语音转换效果的影响,我们首先进行了转换语音自然度的ABX实验。下图表明,BNFs作为输入比PPGs作为输入,因为BNFs对识别错误更加鲁棒,因此转换语音具有更高的自然度。

我们进一步进行了不同BNFs的ABX实验。下图(a)为在基线模型上,CE-BNFs和CTC-BNFs在转换语音的韵律自然度(Nat)和说话人相似度(Sim)上的ABX实验结果。该实验验证了不同BNFs所包含的信息差异,CTC-BNFs在说话人相似度上表现得更好,而CE-BNFs在韵律自然度上则表现得更好。
下图(b)为对比本文所提方法与基线模型的ABX实验结果。可以看出,本文所提方法在音色相似度(Sim)上与单独使用CTC-BNFs的基线模型效果相当;而在韵律自然度(Nat)上,本文所提方法与单独使用CE-BNFs的基线模型相比,其效果更好。该结果表明本文所提方法成功结合了CE-BNFs和CTC-BNFs两者的优势,达到了更高的音色相似度与韵律自然度。

下表为语音转换结果的进一步的客观指标。其中,MCD是转换语音与目标说话人语音进行计算得到的,该值越低表明转换语音的说话人相似度越高;而能量和基频的RMSE是针对转换语音与源语音进行计算得到的,其值越低表明转换语音的韵律越接近源语音,韵律自然度越高。下表的结果可以得到与上文一致的结论。

消融实验
我们进一步基于MOS主观评测进行了消融实验以验证各模块的有效性。另一方面,当我们把韵律编码器的输入替换为梅尔谱时(表中mel-prosody encoder行),转换性能有明显下降,该结果表明瓶颈特征与Mel谱相比面对不同分布的输入更加鲁棒。

在现有主流的识别-合成语音转换方法中,瓶颈特征的选取经常被研究者所忽略。尽管通过对抗学习的后处理方法可以缓解来自瓶颈特征的信息泄露问题,但是并没有从根本上解决问题。在本文中,我们发现训练识别模型的损失函数对瓶颈特征信息存在较大影响,并且这一影响会导致现有语音转换方法在音色相似度和韵律自然度上进行取舍。本文所提方法通过妥善的模型设计,从CE-BNFs和CTC-BNFs两个瓶颈特征中解耦并提取它们各自包含的信息,提高了语音转换的效果,达到了优势互补的目的。
