歌声合成( singing voice synthesis )是根据乐谱来生成歌声的技术,是创造能说会唱的虚拟人中的重要一环。例如,近期网易雷火音频与网易伏羲推出的拜年歌曲一键创作工具,取得了用户的好评,歌声合成是其核心基础服务。与语音合成任务相比,歌声合成需要根据乐谱内容生成正确的发音,还要需要符合乐谱的标注(如音高、歌唱节奏等),同时由于歌唱的基频等声学特征的变化范围更广,而且存在颤音等歌唱技巧,所以建模歌声的难度更大。随着深度学习技术的引入,歌声合成技术取得了巨大的飞跃,合成的歌声越来越逼真且更富表现力,但是距离真正媲美真人歌唱还有一段距离。
近期,由西工大音频语音与语言处理研究组(ASLP@NPU)和网易伏羲合作的论文“ VISINGER: VARIATIONAL INFERENCE WITH ADVERSARIAL LEARNING FOR END-TO-END SINGING VOICE SYNTHESIS ”被语音研究顶级会议ICASSP 2022接收。该论文在VITS [1] 模型的基础上改进得到一个完全端到端的歌声合成系统VISinger,可以避免声学模型和声码器两段式系统在训练和推理过程中的不匹配问题,简化歌声合成系统的训练流程,在使用更少的参数量下实现与两段式系统相当的歌声合成效果。现对该论文进行简要的解读和分享。

论文题目:VISinger: Variational Inference with Adversarial Learnling for End-to-End Singing Voice Synthesis
作者列表:张雍茂,从坚,薛鹤洋,谢磊,朱鹏程,毕梦霄
论文原文:https://arxiv.org/abs/2110.08813v2

发表论文截图

扫码直接看论文

图1 一个典型的歌声合成系统(供图:薛鹤洋)
如图3所示,类似VITS,VISinger分为先验编码器(Prior Encoder)、后验编码器(Posterior Encoder)、解码器(Decoder),其中后验编码器从波形中提取潜变量z,解码器将潜变量z还原为波形,二者构成一个VAE的结构,先验编码器编码乐谱信息 c 来为后验编码器提取 z 的过程提供先验信息,从而模型整体构成一个CVAE的结构。VISinger的结构图如图2所示。

图2 VISinger的模型结构
Frame Prior Network:采用时长模型进行扩展来代替VITS中的MAS,并通过Frame Prior Network预测帧级的均值和方差,提高先验编码器的建模能力。 F0 Predictor:由于基频变化对于歌声合成的效果十分重要,所以我们加入基频预测器,同时也给Prior Encoder提供了更多的监督信息,提高模型整体的稳定性。 Phoneme Predictor:潜变量 z 的提取过程主要受到重建loss的监督,但是由于在推理过程中需要从乐谱中预测潜变量 z ,所以为潜变量 z 的提取过程添加更多监督信息可以帮助提取出更稳定的隐层表征,减少发音错误,所以我们加入了音素预测器,根据潜变量 z 来预测音素并计算CTC loss。 Note Norm:由于歌声合成的结果需要符合乐谱中时长的标注,而乐谱中规定了每个Note的时长,Note时长是我们已知的信息,每个Note通常对应多个音素。所以我们可以将乐谱中的Note时长作为一个先验信息来辅助时长预测器,即时长预测器的输出为Note中每个音素的时长占其所在Note的时长的比例,最终每个音素的时长可以表示为乐谱Note与时长预测器输出的乘积。
整体训练loss为:

实验使用标贝4.7小时的100首单人中文女歌手的歌唱数据,数据在高保真环境下录制,采用48k采样率并降采样到24k进行使用,使用16-bit编码。音素的时长由人工进行标注。
实验对比了FastSpeech[3]+Neural vocoder、原始VITS和VISinger的效果,从模型大小、音质MOS、自然度MOS、F0 MAE、Dur MAE等方面进行对比,结果总结在表1中。在主观打分结果表明,音质上VISinger优于其他模型,自然度上接近两段式模型。端到端模型在模型参数量上具有优势,同时简化了训练流程。实验中我们也发现,完全端到端的模型由于模型建模任务更加困难(直接从文本信息到波形采样点),所以其模型的训练会更有挑战性,训练的稳定性还值得进一步优化。
表1 主观评测得分和客观评测得分

表2消融实验验证了各种改进的作用,包括音素预测器、基频预测器、帧级先验网络和Note归一化策略。可以看出,音素预测器对自然度的提高有帮助,基频预测器和帧级先验网络对音质和自然度的提高均有帮助。而加深flow的层数并不能起到帧级先验网络的作用。
表2 消融实验的主观评测得分


图3 消融实验中的时长偏差
如图3所示,加入Note归一化策略后时长预测的误差会减小,主要体现在一些误差较大的时长预测结果会被纠正过来,减少由于时长预测偏差使歌曲整体偏快或者偏慢的现象,使歌曲整体节奏符合乐谱的标注。
实验中的更多样例敬请访问:
https://zhangyongmao.github.io/VISinger/
《柠檬树》:音频戳我
《胆小鬼》:音频戳我
《没那么简单》:音频戳我
《给我一首歌的时间》:音频戳我
歌声合成开源库Opencpop发布
朱鹏程,公众号:语音之家 全球首个中文精标歌声合成开源数据Opencpop正式发布
