2021年7月24日,由CCF语音对话与听觉专委会 、AIIA 中国人工智能产业发展联盟评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司共同主办的【语音之家】AI技术沙龙——语音合成,成功举办!
【语音之家】AI技术沙龙第三期以语音合成为主题,以线上形式举办,并邀请了中国清华大学深圳国际研究生院副研究员、博士生导师吴志勇、小米技术委员会AI实验室语音生成团队负责人栾剑、The principal scientist manager in Speech China team of Microsoft何磊在会上进行了分享。本次沙龙由百度语音技术部经理李超进行主持。
https://www.bilibili.com/video/BV1ng41177Ts?share_source=copy_web

重点讲述了传统的合成中自回归方法到非自回归方法的转换,在非自回归方法中,如何基于自编码器将VAE引入进去,从而达到更好的效果;保证现有非自回归效果的同时,提升合成音频的音质与合成的速度。
简述了自回归的框架原理,指出自回归的模型的主要缺陷是时间复杂度比较大,且自回归是不断迭代过程,因此累计误差会变大。
自回归转化成非自回归主要需要解决的是phoneme/character-leval的特征与帧级别语音学特征的转换,进一步讲述了从自回归模型转换成非自回归的方法:基于Phoneme-leval duration和Utterance-leval duration 模型。

阐述了Phoneme-leval duration和Utterance-leval duration 自回归模型的不足,并在此基础上提出了一种VAENAR-TTS模型,该模型主要受FlowSeq的启发,不需要phoneme-leval durations而使用的是utterance-leval duration,并引入VAE去获取更具信息量的placeholder。
且 spectrogram placeholder 是基于 attention 的 soft-alignment , 最后就该模型与其他 TTS 方法做了一些简要的对比实验。另外 VAENAR-TTS 相关的代码样例等都已经开源。
地址 :https://github.com/thuhcsi/VAENAR-TTS

简单梳理回顾了Seq2Seq TTS框架,并分析了目前工业界主流的编码器方案,最后着重介绍小米提出的对编码器多层结果进行聚合的思路。同时报告还将简要介绍语音合成在小米产品上的主要应用。

主要探讨工业界主流的编码器方案,包括CBHG(Tacotron),CNN+BLSTM(Tacotron2),Self-Attention+CNN(FastSpeech)等等。
基于self attention,对编码器多层结果进行不同方式的聚合做了详细介绍,主要是将multi-Head Attention 每层的输出作为序列,并用self attention方式进行重新整合,从而得到动态加权结果。并在脱口秀(TS)、语音助手(VA)、朗读风格(DB1)三类测试集上就不同系统做了实验。

针对Neural TTS在大规模产品话过程中面临的挑战做了简单概要,以及目前为止,微软在TTS方面的工作。最后就相对前沿的课题上的一些探索,如超越sentecce-leval的human parity TTS优化,如何获取更好的、可控的、更高的表现力的TTS以及语音识别与语音合成之间的协同工作等。

简要回顾了下传统TTS和Neural TTS的框架,并就现在TTS产品基础上阐述了目前Neural TTS发展的主要挑战以及相关方案:如cost和Robustness。

就目前前沿的方向做了方案探讨,首先就超越句子级别的TTS方案做了说明,主要包含Paragraph以及Dialogue conversation两个方面。其次介绍了微软在Cross-speaker Style Transfer上做的工作,重点是基于Prosody Bottleneck的风格转换。
最后就语音识别和语音合成在实用层面下的协同问题做了概述:如何用合成技术来帮助ASR做数据的收集(Univewrsal TTS model)以及ASR与TTS的对偶学习问题等。

在沙龙直播期间,我们收到了许多小伙伴的支持,感谢大家对语音之家的关注。我们将继续优化沙龙及社区的的内容和效果,努力成为更受大家喜爱的AI语音开发者社区!
扫码加入(语音合成)微信群

下面奉上嘉宾的PPT:
在公众号后台的对话框中回复“语音合成”,即可获取三位嘉宾的演讲PPT。
