INTERSPEECH 2025 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2025 录用论文的作者进行报告交流。
INTERSPEECH 2025 论文预讲会第六期邀请到清华大学语音与音频技术实验室(SATLab)做本次会议的专场分享,欢迎大家观看。
实验室概况
清华大学语音与音频技术实验室(SATLab)致力于研究语音、音频、音乐、听觉信息处理的理论、方法及其应用。主要研究方向为语音识别与分析、音频识别与分析、音乐与声学信号处理,机器学习等。实验室牵头承担了自然科学基金重点项目、国家重点研发课题等多个国家项目和企事业单位合作项目,并在多项语音音频技术国际权威评测或挑战赛中获得冠军。
第六期
清华大学语音与音频技术实验室【专场】
时间:8月5日(周二)19:00 ~ 20:40
形式:线上
议程:每位嘉宾分享25分钟(含5~10分钟QA)

嘉宾&主题

嘉宾简介:蒲钰,清华大学SATLab三年级硕士生,研究方向为端到端语音交互。
分享主题:Empowering Large Language Models for End-to-End Speech Translation Leveraging Synthetic Data
摘要:语音到语音翻译(S2ST)是实现跨语言交流的重要技术。传统的级联系统依赖语音识别、文本翻译和语音合成,容易产生误差传递和延迟。我们提出了端到端模型SLAM-TR,可直接将输入语音翻译为目标语音,避免了中间的文本处理步骤。在FLEURS基准上,SLAM-TR取得了8.2的ASR-BLEU分数,显示出良好的泛化能力。同时,为解决真实语音翻译数据稀缺的问题,我们构建了SynStard-1000数据集,通过高质量平行文本合成1000小时语音翻译数据,并已开源,为S2ST研究提供了有力支持。

嘉宾简介:梁文锐,清华大学SATLab二年级硕士生,研究方向为基于语音的抑郁症检测和工业异常声音检测。
分享主题 :DepressGEN: Synthetic Data Generation Framework for Depression Detection
摘要:自动化抑郁症检测对于早期诊断至关重要,但由于伦理和隐私方面的顾虑,常常导致训练数据不足,从而阻碍了抑郁筛查的研究。为应对这一挑战,我们提出了DepressGEN这一新颖框架,用于生成模拟抑郁患者的合成访谈文本和语音,以增强检测模型的训练效果。该框架通过将与抑郁相关的语言特征输入大型语言模型,生成访谈文本,并借助文本转语音(TTS)系统合成相应语音。我们还设计了一个抑郁调制模块以调整合成语音的抑郁特征,以及一个语音验证模块,用于缩小合成数据与真实数据之间的分布差距。实验结果表明,使用额外合成数据训练的GRU/BiLSTM模型相比仅用原始数据训练的模型,F1值提升了9.9%,并在EATD数据集上优于现有方法。

嘉宾简介:孙琪,清华大学SATLab二年级硕士生,研究方向为基于语音的阿尔兹海默病检测。
分享主题:PPGs-BERT: Leveraging Phoneme Sequence and BERT for Alzheimer’s Disease Detection from Spontaneous Speech
摘要:阿尔茨海默病(AD)是一种常见的神经退行性疾病,常伴随语言表达障碍。传统语音识别方法容易忽略或“规范化”患者语音中关键的异常特征,如迟疑、重复、停顿、发音错误等,且有语种依赖。本研究提出一种基于音素后验图(PPGs)和BERT模型的方法,用于从自发语音中检测AD。我们使用音素识别器代替传统ASR,保留更多语言细节,并通过BERT提取高维特征进行诊断。本方法具有良好的跨语言适应能力,兼顾准确性与计算效率。

嘉宾简介:贾恺琛,清华大学SATLab本科毕设学生,研究方向为基于语音的阿尔兹海默病检测。
分享主题:Whisper-Based Multilingual Alzheimer’s Disease Detection and Improvements for Low-Resource Language
摘要:阿尔茨海默病(AD)由于人口老龄化趋势,已成为全球日益严峻的健康挑战。利用自发性语音进行AD早期诊断,正成为一个重要的研究方向。针对AD的全球性问题,本研究提出了一种基于语音的多语言AD检测方法。我们采用Whisper进行迁移学习,构建了一个多语言AD诊断模型,在对应多语言测试集上取得了81.38%的准确率。为提升低资源语言的检测效果,我们在结合多语言数据和完整转录文本的基础上对多语言模型进行微调,使低资源语言准确率提升了4-7%。此外,我们还引入了受试者的背景信息,使低资源语言的检测准确率进一步提高了11-13%。实验结果验证了我们方法在多语言阿尔茨海默病检测任务中的有效性,也展现了其在应对全球AD检测需求方面的可行性。
参与方式
直播将通过语音之家微信视频号进行直播
手机端、PC端可同步观看
👇👇👇

预讲会征集
INTERSPEECH 2025 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2025 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。
预讲会报名方式
联系人邮箱:bd@speechhome.com
联系人微信

