
下面是沙龙的回顾:
任意
叶振辉
提高文本表征是实现富有韵律的语音合成系统的重要途径,然而现有的工作通常采用基于语言模型 (BERT) 的文本表征来提升合成语音的韵律的方法,这就带来了使用预测掩码标记(masked token prediction)任务进行预训练,更关注的却是文本的语义信息而非语音的韵律,从而导致训练效率低以及韵律建模困难等问题。基于上述观察,火山语音团队联合浙江大学提出了CLAPSpeech,这是一个跨文本-语音模态的对比预训练方法。与现有工作不同,它从相同文本标记在不同语境下的韵律变化中学习,因而能够显式高效地从文本中提取韵律相关的信息。
江子越
李瑞琦
语音到歌声转换(STS)任务是给定目标音高序列和一段源语音,合成出符合该音高要求和源语音内容的歌声信号。STS 任务的主要挑战在于,在没有给定文本信息的情况下,目标音高序列和源语音内容之间的对齐关系是很难学习的。本工作基于显式建模跨模态对齐提出了新的 STS 任务解决方案,AlignSTS。本工作使用一种新型且有效的 Rhythm 表示来连接语音内容和音高之间的模态差异,并采用了 Rhythm Adaptor 来预测目标的 Rhythm 表示。本工作还设计了一个跨模态对齐模块来根据生成的目标 Rhythm 表示对语音内容特征进行重排序,并使用了模态融合来进行歌声的合成。实验结果表明,AlignSTS 在主观和客观测试中都获得了更好的表现。
至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!
