论文预讲会由中国中文信息学会、CCF语音对话与听觉专委会、深圳市人工智能学会、语音之家发起,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ACL 2026 录用论文的作者进行报告交流。
ACL 2026 论文预讲会第一期邀请到武汉大学国家网络安全学院多媒体安全实验室做本次会议的专场分享,欢迎大家观看。
实验室概况
武汉大学多媒体安全实验室(MMS Lab)由国家网络安全学院任延珍教授成立,专注于多媒体信号安全研究,涵盖深度伪造检测、音频水印以及图像/音频/视频隐写。实验室在国际安全领域顶刊顶会发表多篇论文, 包括S&P、TIFS、TDSC等。

第一期武汉大学国家网络安全学院多媒体安全实验室【专场】
时间:5月27日(周三)19:00 ~ 20:00
形式:线上
| 时间 | 主题 | 嘉宾 |
| 19:00~19:45 | RTCFake: Speech Deepfake Detection in Real-Time Communication | 薛军 |
| 19:45~20:00 | Q&A |
嘉宾&主题

嘉宾简介:薛军,武汉大学国家网络空间安全学院2025级博士生,研究方向为多媒体信号处理,研究内容为音频深度伪造检测、视听语音识别和多模态融合。在ICML,ACL,CVPR,AAAI,IJCAI,ICASSP,SPL等期刊会议发表学术论文30余篇。曾在ESDD 1 比赛的track1和track2均获得国际第一名,ESDD2比赛获得国际第一名。
分享主题:RTCFake: Speech Deepfake Detection in Real-Time Communication
摘要:随着语音生成技术的快速发展,语音深度伪造(speech deepfake)在实时通信(RTC, Real-Time Communication)场景中所带来的安全威胁日益加剧。然而,现有检测研究主要聚焦于离线模拟场景,难以应对 RTC 传输过程中引入的复杂失真,包括未知的语音增强处理(如噪声抑制)以及编解码压缩等问题。为了解决这一挑战,我们提出了首个面向 RTC 场景的大规模语音深度伪造数据--RTCFake,总规模约为 600 小时。该数据集通过将语音传输至多个主流社交媒体与会议平台(如 Zoom)进行构建,从而能够实现离线语音与在线传输语音之间的精确配对。此外,我们提出了一种音素引导一致性学习(Phoneme-Guided Consistency Learning, PCL)策略,用于约束模型学习跨平台不变的语义结构表示。在本文中,RTCFake 数据集被划分为训练集、开发集和评测集。其中,评测集进一步包含未见过的 RTC 平台以及未见过的复杂噪声条件,从而提供了一个更加真实且更具挑战性的语音深度伪造检测评测基准。进一步实验表明,所提出的 PCL 策略在跨平台泛化能力和噪声鲁棒性方面均取得了显著提升,为语音深度伪造检测提供了一种有效且具有良好泛化能力的建模范式。
论文链接:https://arxiv.org/abs/2604.23742
代码链接:https://huggingface.co/datasets/JunXueTech/RTCFake
Demo链接:https://www.junxue.tech/RTCFake-demo/dataset.html
参与方式
直播将通过语音之家微信视频号进行直播
手机端、PC端可同步观看
👇👇👇

预讲会征集
ACL 2026 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 ACL 2026 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。

