INTERSPEECH 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。本次论文预讲会按照技术领域投稿和实验室专场两种形式进行招募,欢迎大家投稿报名。
INTERSPEECH 2024 论文预讲会第二期邀请到罗切斯特大学音频信息实验室做本次会议的专场分享,欢迎大家观看。
实验室概况

罗切斯特大学音频信息实验室【专场】
时间:7月5日(周五)10:00 ~ 11:00
形式:线上
议程:每位嘉宾分享30分钟(含5分钟QA)


摘要:表达性语音合成旨在生成捕捉广泛语音外语特征的语音,包括情感和表达,尽管当前的研究主要强调情感方面,而不是专业配音演员掌握的细致的发音特征。受此启发,我们通过发音语音学的视角探索表达性语音合成。具体而言,我们定义了一个具有三个维度的框架:声门化、紧张度和共振(GTR),以指导语音产生水平的合成。借助这个框架,我们录制了一个名为GTR-Voice的高质量语音数据集,包括由一位专业配音演员发音的20句中文句子,涵盖125种不同的GTR组合。我们通过自动分类和听力测试验证了框架和GTR标注,并演示了在两个经过精细调节的表达性TTS模型上沿着GTR维度的精确可控性。我们开源了数据集和TTS模型。
Demo:gtr-voice.com

嘉宾简介:臧永宜,罗切斯特大学 (University of Rochester) 音频工程专业本科毕业生,现在 Neosensory 担任机器学习工程师。臧永宜的研究兴趣在于音频信号相关的应用机器学习领域,包括多模态和空间音频,合成歌声和语音识别,及音乐信息检索方向。他的研究成果已在 ICASSP, INTERSPEECH, AES, JAES 等国际知名会议或期刊上发表。
分享主题 :CtrSVDD: 受控性强的歌声鉴伪基准及基线模型分析
摘要:最近的歌声合成和转换技术发展需要强大的歌声鉴伪(Singing Voice Deepfake Detection, SVDD)模型。但是,目前的SVDD数据集面临着受控性有限、深度伪造方法不够多样和版权限制等诸多挑战。在这份工作中,我们介绍了CtrSVDD,一个大规模、多样化的真实和歌声深度伪造的集合,使用最先进的方法从公开可访问的唱歌声音数据集合成的。CtrSVDD包括47.64小时的真实和260.34小时的深度伪造唱歌声音,涵盖了14种深度伪造方法,并涉及164个歌手身份。我们还提供了一个灵活的前端特征基线系统,并在我们提供的训练/开发/评估集上进行了评估。我们的基线实验表明特征选择的重要性,并凸显了需要对偏离训练分布的深度伪造方法进行泛化的需求。CtrSVDD数据集和基线系统以CC BY-NC-ND 4.0 开源。
论文:
代码:
直播将通过语音之家微信视频号进行直播


扫码添加语音小管家,进入语音之家讨论群

为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。
联系人邮箱
bd@speechhome.com
联系人微信

