为了使语音合成系统合成更加自然的语音,很多人研究韵律模型。韵律模型主要分为:global prosody 和fine-grained prosody。其中global prosody是把参考的句子转成一个embedding,这也是目前很多系统采用的方案。fine-grained prosody主要是音素级别(PL:phone level)的韵律建模,常使用单高斯来建模。本文提到使用单高斯来建模不能很好表达音素级别之间的信息,因此使用GMM来对PL进行建模。本文在单发音人和多发音人以及prosody-clone上进行设计和实验,结果表明本文的方案效果较优。
首先,先区分两个概念prosody cloning和prosody transfer。prosody cloning是参考的音频内容和输入的text一样,而prosody transfer不需要,本文主要设计prosody cloning,其训练和推理阶段如图1所示。

接下来我们先看一下单发音人系统设计如图2所示,其使用MDN网络来预测GMM分布。图中prosody extractor是从音素对应的mel-spec来抽取prosody embedding,主要在训练阶段使用。在推理阶段则使用prosody prediector来预测GMM,并获取prosody embedding。接着图3为多发音人系统,其中添加speaker embedding table来表征speaker id,其与图2不同之处是把speaker信息拼接到系统,而且prosody predictor也接受发音人相关信息。图4是prosody cloning的过程,其流程为先训练好图3模型,然后使用参考的语音来计算gaussian index seq。合成目标语音时候,使用gaussian indexseq来进行高斯选取采样。



table 1对比句子级别和音素级别的效果,在客观指标MCD显示,PLP音素级别较好。图5显示GMM的高斯数量大小对似然值影响,从10到20几乎变化很小,本文选取20作为余下实验。图6显示PLP-GMM(使用GMM音素级别建模)比PLP-SG(单高斯音素级别韵律建模)和ULP(句子级别建模)在ABtest上远远好于后两者。图7为自然度的测试,其结果PLP-GMM比PLP-SG和ULP好。图8测试韵律embedding有效性。图9,图10和图11是prosody cloning实验,本文最好。







该文章主要使用GMM来进行phone-level的韵律建模,从而提高语音的自然度。该文章主要在单人,多人和prosody clone三个方面进行设计和实验,结果优于现有方案。
