ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。    

ICASSP 2024 论文预讲会第十六期邀请到香港中文大学(深圳)做本次会议的专场分享,欢迎大家观看。



第十六期

香港中文大学(深圳)【专场】

时间:3月25日(周一)19:00 ~ 21:05

形式:线上

议程:每位嘉宾分享25分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:白奇丙,香港中文大学(深圳)数据科学学院博士一年级学生。

分享主题:Leveraging In-the-Wild Data for Effective Self-Supervised Pretraining in Speaker Recognition

摘要:当前的说话者识别系统主要采用受监督方法,但受限于标记数据集的规模。为了提升系统性能,研究人员利用大型预训练模型(例如WavLM),将学到的高级特征迁移到下游的说话者识别任务。然而,这种方法在预训练模型保留在推理阶段时引入了额外的参数。另一种思路则是直接采用自监督方法(如DINO)进行说话者嵌入学习,但是目前还未有工作验证过在大规模的真实无标签数据上的相关效果。本研究展示了在大规模WenetSpeech数据集上进行的DINO训练的有效性,并证实了其在增强对CNCeleb数据集的受监督系统性能方面的可迁移性。此外,我们引入了一种基于置信度的数据过滤算法,用于从预训练数据集中排除不可靠的数据,从而在使用更少训练数据的情况下实现更优越的性能表现。相关的预训练模型、置信度文件、预训练和微调脚本将提供在 Wespeaker 工具包中。


嘉宾简介:My name is Sho Inoue. I’m a second year phd student supervised by Professor Li Haizhou. My research topic is text-to-speech model. 

分享主题:HIERARCHICAL EMOTION PREDICTION AND CONTROL IN TEXT-TO-SPEECH SYNTHESIS 

摘要:It remains a challenge to effectively control the emotion rendering in text-to-speech (TTS) synthesis. Prior studies have primarily focused on learning a global prosodic representation at the utterance level, which strongly correlates with linguistic prosody. Our goal is to construct a hierarchical emotion distribution (ED) that effectively encapsulates intensity variations of emotions at various levels of granularity, encompassing phonemes, words, and utterances. During TTS training, the hierarchical ED is extracted from the ground-truth audio and guides the predictor to establish a connection between emotional and linguistic prosody. At run-time inference, the TTS model generates emotional speech and, at the same time, provides quantitative control of emotion over the speech constituents. Both objective and subjective evaluations validate the effectiveness of the proposed framework in terms of emotion prediction and control.


嘉宾简介:王力,香港中文大学(深圳) 数据科学学院博士一年级学生。研究方向为音频Deepfake。在ICASSP和INTERSPEECH等会议上发表过4篇学术论文。曾在字节跳动、华为和腾讯进行实习。曾是IEEE Signal Processing Letters的审稿人。目前参与了国家自然科学基金、深圳市大数据研究院和华为等机构的多个项目。
分享主题:AdvSV: An Over-the-Air Adversarial Attack Dataset for Speaker Verification
摘要:深度神经网络虽在自动说话人验证(ASV)系统的特定应用场景中表现出稳健性,但众多研究已揭示这些系统对于对抗性攻击的脆弱性。现阶段,研究进展主要受限于缺乏标准化数据集,这一缺陷显著地限制了可重复性研究的进行。为此,我们开发了AdvSV,一个旨在针对说话人验证研究领域的开源对抗性攻击数据集,以应对这一挑战。在我们的初步工作中,我们特别关注了所谓的“空中”攻击,即通过空气传播对ASV系统构成威胁的对抗样本。AdvSV数据集基于Voxceleb1验证测试集,涵盖了多个受到对抗性攻击的典型ASV模型和相应的对抗性样本,以及多种播放和录制设备,旨在模拟“空中”攻击场景。该数据集的潜在应用范围广泛,未来可扩展至更多种类的对抗性攻击。我们计划以CC BY-SA 4.0许可证发布AdvSV数据集,以促进科研社区的发展。同时,我们提供了一套检测基准,以推进可重复性研究的前进。此举旨在提高ASV系统的安全性,通过分享这一资源,我们希望能够促进对抗性攻击研究领域的合作和创新。

嘉宾简介:李珈祺,香港中文大学(深圳)本科四年级学生,他将于9月入学香港中文大学(深圳)博士项目。在ICASSP会议上以一作或共同作者发表2篇论文。曾在微软研究院、深圳大数据研究院实习。
分享主题:An Initial Investigation of Neural Replay Simulator for Over-the-Air Adversarial Perturbations to Automatic Speaker Verification
摘要:在过去几年中深度学习推动了声纹识别系统(ASV)的发展。基于深度学习模型的ASV系统容易受到对抗攻击的影响,而在涉及到包含对声纹识别系统物理访问(OTA攻击)的相关研究较少。OTA 攻击涉及扬声器、麦克风和能影响声音传输的重放环境。我们的初步实验证实,重放过程影响了 OTA 对抗攻击的有效性。本研究进行了一项初步调查,旨在利用基于深度学习的重放模拟器提高 OTA 攻击的鲁棒性。我们通过在生成对抗样本时加入重放模拟器模拟OTA 过程。在 ASVspoof2019 数据集上进行的实验证实,基于神经网络的重放模拟器能够显著提高 OTA 攻击的成功率。这引发了对物理访问的声纹识别系统遭受对抗攻击的关注。 


嘉宾简介:顾毅骋,香港中文大学(深圳)本科二年级学生,在ICASSP会议上以第一作者发表一篇论文,现于深圳大数据研究院实习。
分享主题:Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity Vocoder

摘要:基于生成对抗网络(GAN)的声码器在从声学表示中重建可听波形方面具有优越的推理速度和合成质量。本研究着重于改进判别器部分以促进基于GAN的声码器的合成质量。现有的基于时频域表征的判别器大多数根植于短时傅里叶变换(STFT),STFT频谱图中的时频域分辨率是固定的,这使其与需要对不同频段施加灵活注意力的信号(如歌声)不兼容。受此启发,我们的研究利用了常数Q变换(CQT),它在频谱上具有动态的时频域分辨率,有助于更好地提升音高建模的准确性和高频谐波的跟踪能力。具体而言,我们提出了一种多尺度子带CQT(MS-SB-CQT)判别器,它在多个尺度上对CQT频谱图进行操作,并根据不同的八度进行子带处理。在语音和歌声上进行的实验证实了我们提出的方法的有效性。此外,我们还验证了基于CQT和基于STFT的判别器在联合训练下可以做到信息的相互补充,从而进一步提升合成效果。具体而言,通过提出的MS-SB-CQT和现有的MS-STFT判别器的增强,HiFi-GAN的MOS评分可以从3.27提升到3.87(对于集内歌手)和从3.40提升到3.78(对于集外歌手)。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇



讨论群


扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信