当前语音对话与听觉处理领域蓬勃发展,学术界与工业界不断涌现创新的技术与产品,为了更好地推动经验交流与前瞻研讨,由中国计算机学会(CCF)语音对话与听觉专委会发起的第三届CCF语音对话与听觉处理前沿进展研讨会(RASDAP2026,Recent Advances on Speech Dialogue and Auditory Processing)于2026年4月26日在香港科技大学(广州)顺利举办。本次研讨会在香港科技大学(广州)刘李助理教授、香港科技大学雪巍助理教授、香港中文大学吴锡欣助理教授、三星电子中国研究院研发副总裁朱璇博士、中国科学技术大学张结副教授和语音之家创始人兼CEO卜辉等的共同组织下,邀请了上海交通大学俞凯教授、香港中文大学Helen Meng教授、中国科学技术大学凌震华教授、北京大学邹月娴教授、信息工程大学屈丹教授、中国科学技术大学杜俊教授、昆山杜克大学李明教授、思必驰樊帅博士、阿里巴巴陈谦博士、内蒙古大学刘瑞教授、苏州大学朱梦尧教授、上海交通大学陈谐副教授、南京大学王帅副教授、北京科技大学钱馨园副教授、昆山杜克大学苗晓晓助理教授、南京大学薛浏蒙助理教授等国内语音技术领域专家,通过6场技术引导报告与2场分组(3个小组)讨论,系统性梳理了音频推理的技术路径、空间音频的产学研结合、具身智能的音频处理机遇与挑战、多智能体端边云群体协同的前沿探索。同时还针对NCMMSC 2026特殊议题、未来赛事、CCF进展报告以及未来基金项目指南进行了广泛且深刻的探讨。研讨会延续“小规模、精品化、深度聚焦”的特色,为学术界与产业界搭建了高效对话平台。RASDAP这种小规模、精品化、主题高度聚焦的研讨会对团结和组织我国语音、对话与听觉相关领域的专业人士开展学术交流活动,强化各研究方向的融合,促进学术界与工业界的合作,提升语音、对话与听觉领域的科研、教学、应用水平以及国内国际影响力具有重要意义。
1.引导发言(Introductory Talks)
上海交通大学陈谐老师介绍了近期四个在音频理解领域的创新性成果,包括:1)首次将思维链推理引入音频大语言模型,显著提升了中易程度推理性能,并发现迫使推理自一致性可以进一步提升性能;2)提出语音、音频、音乐中深度推理的一个具有挑战性的基准,massive multi-disciplinary audio reasoning (MMAR),包含了7个模态、4个大类16个子类,并将音频大模型的错误划归为感知错误、知识错误、推理错误;3)举办音频推理挑战,从单纯考虑音频推理模型与智能体的最终结果准确性转变为评估推理过程质量;4)迈向精细感知的数据流程、模型、基准,作为首个基于精细感知的完形填空式(填空型)评估,全面覆盖了音频、视频、音视频场景。

图1 深度音频推理基准MMAR构建流程
陈老师指出,当前的音频理解研究,音频的精细感知是主要瓶颈。音频大模型普遍在语义任务上表现较好,而在信号处理、细节感知任务表现较差。随着精细感知数据的完善,基准会进一步完善,细节感知任务将有望获得缓解。在问答环节中,Helen Meng老师指出客观无偏见的音频感知的重要性。俞凯老师也指出工具性的常识性理解与面向目标的智能体理解存在的差异。
陈博士介绍他们团队的最新工作Fun-Audio-Chat。他首先回顾了音频大模型的演进,语音交互正从传统的级联管线,向端到端的音频大模型发展,包括纯级联的ASR+LLM+TTS、S2T LLM+TTS、以及端到端语音到语音模型。陈博士指出,目前的核心挑战在于时间分辨率失配、灾难性遗忘、语音质量与计算效率的权衡、全双工交互等。针对分辨率失配的问题,陈博士团队提出了基于分组(grouping)机制的双分辨率语音表征,在LLM基座模型上使用5Hz低帧率防止序列长度爆炸,在语音细化输出过程采用25Hz帧率补全细节,有效兼顾了效率与质量。针对灾难性遗忘的挑战,陈博士团队提出了Core-Cocktail解决方案,提出两阶段训练加参数合并的策略,巧妙地利用了参数空间的线性插值特性来缓解遗忘问题。同时,多任务直接偏好优化(direction preference optimization,DPO)训练,基于口语问答、指令跟随、情感感知与共情回复的多样化数据,提升了Fun-Audio-Chat多维度核心能力。在全双工交互方面,Fun-Audio-Chat将用户语音、助理语音和文本同时作为模型的三路并行输入,模型在生成回复的同时,持续接收并编码用户的语音流,实现真正的同时双向通信。

图2 Fun-Audio-Chat半双工(左)与全双工(右)架构图
陈博士指出,目前的全双工交互智商只能与半双工相媲美或不足,真实数据存在明显差距是一个重要原因。他总结了当前的三大局限:1)在长多轮对话中可能出现上下文遗忘(memory loss),影响对话连贯性;2)语音共情在某些场景下表现出不稳定的表达力(instability in expressiveness);3)当前最长支持约6分钟的语音上下文,限制了长对话场景的应用。未来可能的研究方向包括更长上下文、更丰富情感控制、更强文本基模、强化学习与在线策略蒸馏(on-policy distillation)提升偏好对齐并缓解灾难性遗忘。邹月娴老师也指出音频表征在多模态融合中的挑战,和面向最终实际问题的音频表征挖掘的重要性。
李明老师总结了近期的多说话人语音识别研究的四条路线:
1)级联说话人日志 + 语音识别,包含独立的说话人日志和语音识别系统;
2)联合说话人归属的基于Whisper架构的语音识别,联合优化说话人建模与语音识别;
3)大语言模型辅助的混合方法,保留传统混合流程,后处理引入LLM优化转录文本一致性与说话人归属准确性;
4)端到端统一语音-大语言模型,直接从原始音频生成带说话人标签的转录文本。李老师回顾了近期的有代表性工作,例如SpeakerLM、JEDIS-LLM、VibeVoice-ASR。
李老师指出,许多系统仅聚焦于解决“谁说了什么”,而能够建模“谁说了什么以及何时说”的模型仍占少数,词级时间戳依然是一个较少探究的方向,显式说话人日志线索在模型中的辅助作用尚未得到充分挖掘。李老师团队提出了创新的DM-ASR(Diarization-aware Multi-speaker ASR)将日志线索显式融入LLM, 用更小的模型和更少数据实现优异性能,实现了词级时间戳预测,在不同语言和对话场景下具有良好泛化能力。在相对说话人标签和段时间戳离散标签送到LLM之前,说话人标签和时间边界会以 0.1 的概率被随机扰动,实验验证了大模型会思考并自主推理时间戳和说话人信息,不完全依赖日志系统输入, 由于引入了随机扰动机制,提示文本中可能包含一个错误的说话人词元(Speaker Token),但模型生成的目标转录文本以正确的说话人词元开头。

图3 李老师团队提出的 DM-ASR 框架的整体架构
李老师指出在有限规模下,当前大语言模型预测的说话人和时间戳性能仍未超越强大的前端日志系统。目前的输出内容仍较为单一,只包含说话人相对标签、词级别时间戳、对应文本,没有其他副语言信息。缩短推理窗口长度会影响整体性能。未来将可探讨三个方面:
1)规模扩展,增加模型规模和训练数据,以进一步缩小甚至逆转这一性能差距,挖掘LLM在语音处理任务中的潜力;
2)任务扩展,进一步丰富模型的输出,利用多任务融合互补,提高多维度多人语音精细感知的能力;
3)在线扩展,可将 DM-ASR 框架扩展到低延迟的在线处理,实现实时的具备说话人感知能力和精确时间定位的语音转录,进而用于多人全双工对话系统。
刘瑞老师首先介绍了他们团队的一个新颖的多说话人自动语音识别(ASR)模型TellWhisper。该模型将一种时间–说话人感知的旋转位置编码引入语音编码器中,从而自然地融合了时间信息与说话人活动信息。提出一种基于双曲空间的说话人日志模型,以获得可靠的帧级说话人活动信息。刘老师还介绍了他们面向共情对话语音合成的链式理解与生成模型,Chain-Talker。该模型包含了两个主要模块,EmGPT负责情感与语义的理解,Synthesizer负责共情语音的生成。刘老师还介绍了对话音视频语音合成,UniTalker。该模型首先通过“多模态对话上下文标记化”来表示对话中的多模态信息。然后,在“多任务对话上下文建模”过程中,它解读这些多模态线索,并依次预测目标语句的情感、面部表情和语音的标记序列。最后,通过“多模态响应内容渲染”,它生成并回应用户共情语音以及自然的谈话面部动画。

图4 刘瑞老师团队提出的Chain-Talk系统框架图
在问答环节中,各位老师也讨论了目前音视频生成的控制条件比以往更加多模态化,使得生成的条件信息更多,有机会生成更加惊艳的效果。朱璇老师也指出目前的惊艳结果有赖于大量的资源(如Sora),但是实际工业应用中,往往对资源的使用有比较重要的考量。
雪巍老师首先总结了面向生成的音频推理的方法,目前主要有三种:1)基于思维链,专注于利用内部的中间信息,以实现更具可控性和更精细的生成过程,从而提升生成质量;2)基于强化学习,重点关注后期训练与解码过程,利用奖励模型或类似原理来影响最终结果;3)基于推理任务,根据任务给定的输入执行复杂的推理过程,以更好地理解音频,并且通常以问答形式进行评估,且这个过程中思维链与强化学习也可以被集成。
在思维链方法方面,雪老师团队探讨了三种基于文本、非文本、跨模态的内部媒介表征。基于文本或多模态的思维链过程以理解视频内容,规划音频内容并进行控制。在强化学习方面,他们提出一种新的语音合成范式:不同于在输入中添加控制条件,合成结果可以通过音频语言模型解码过程中的搜索来进行控制。也可以对每个样本计算其在多个验证器下的相对排名,包括说话人相似度、词错误率、CLAP、美学等验证器,然后将这些排名取平均,以获得一个统一的集成分数。或者通过奖励模型控制音频输出的不同方面。

图5 雪老师团队提出的Audio-Omni框架图
(6)樊帅:分布式智能体系统及音频感知和推理
樊博士首先讨论了智能体的中央大模型+外部模块的结构性定义,并指出智能体的功能性本质在于具备目标驱动的自主闭环能力,并能通过记忆与协作持续进化。随着更多硬件设备的智能化,和具身智能的兴起,更需要分布式智能体系统来解决问题。主要解决端云异构协作、大小模型协作、实时处理、分布式感知和执行的问题。樊博士指出,可靠性是分布式智能体系统的核心挑战,包括执行可靠性和协作可靠性。和大模型一样,智能体也存在幻觉,即执行和协作的过程和结果与人类合理预期不一致。智能体幻觉来源于外部根因,训练数据的噪声和缺失,或内部根因,神经网络模型的概率生成特性使得输出存在不确定性。目前处理幻觉有两个主流的范式,一个是工具增强,通过让模型调用工具来拓展知识边界;另一个是对输出的置信度进行评估,高置信度采纳,低置信度拒答或校正。对于工具增强范式,调用工具本身也存在幻觉,不能完全消除幻觉。同时,模型存在过度自信的情况,对错误输出也会产生非常高的置信度,导致基于置信度的筛选机制失效。樊博士团队提出了第三种新的范式:基于不确定性感知的容错对齐理论,其核心是对不确定的问题,宁可拒绝也不要犯错,可靠性指标就是最大化有用性的同时,最大程度的减少由于错误带来的成本。该范式显式建模知识边界感知,明确引入非决定性空间,区分可靠性和正确性,基于可靠性这个对齐目标进行偏好数据的生成,然后进行强化学习的训练。该范式为智能体研究提供了全新的视角,实验结果也为未来的研究奠定了基础。
樊博士还介绍了分布式智能体系统在智能座舱、会议办公方面的产业应用,以及他们参加Interspeech2026音频推理挑战赛的情况。他们的参赛系统由3个主要部分组成,包括多模态特征提取、多模型投票推理、细粒度类别感知路由。目标是最大化异构大音频语言模型能力的同时,避免繁琐且易出错的Agent编排。他们的系统性能优越,获得比赛全榜第一,推理评分第二的优异表现。

图6 樊博士团队基于显式知识边界感知的可靠性目标对齐、偏好数据生成与强化学习训练的容错对齐新范式
2.开放讨论(Open Discussion)
(1)【第一轮小组讨论】
小组1:俞凯、邹月娴、朱璇、刘李、卜辉、薛浏蒙、朱凌玉、陈培林、李哲、罗佳宸、任昕(朱璇老师作为代表,报告小组讨论情况)
聚焦问题:数据原生知识探讨
数据在今天的研究开发中发挥着举足轻重的作用。概括起来,目前有三种数据衍生的方式:1)数字层面的数据:叠加自监督等训练范式,原来的数据采集、生成、标注是否还有价值?在LLM时代下,现在缺乏的不是单模态的标注数据,而是各种模态的对齐。传统的数据采集和标注的需求不断降低,跨模态数据对齐的标注需求会不断提升;2)物理世界的知识:数字层面的数据也要与物理空间对齐,这在机器人或具身智能中尤为重要。这些数据存在于我们的物理世界中、书本中,如何有效的提取出来是一个关键问题。从近期具身智能的研究发展可以看到,潜空间的语义一致性的概念会逐渐被强化,随之而来的对数字世界和物理世界数据,以及实采和生成数据的融合上的需求;3)多智能体协作:多智能体的合作分工,不只是数学问题,也是一个社会学问题。这里有许多原来数据生产过程中没有考虑的新问题,例如成功与失败如何判断,协作的成功率或者完成度如何评估,都是非常值得进一步研究和探讨的问题。未来关于多智能体数据生产的科学研究,势必需要融入社会学的相关理论知识,从而产生一些新的研究话题和技术方向。
小组2:Helen Meng、杜俊、陈谐、刘瑞、雪巍、吴锡欣、朱梦尧、苗晓晓、刘学琛、陈雅琪(吴锡欣老师作为代表,报告小组讨论情况)
问题一:运用语音的科学理论让大模型更加惊艳
受工业问题牵引(朱梦尧老师)
工业界语音技术的自动化应用跨度大,很多场景(如IoT设备、无法联网设备)对精巧低资源需求的小模型青睐有加,研究应受实际工业问题牵引,贴合实际需求,使方案在实际应用中结果惊艳。随着技术更新迭代,研究也需要推陈出新,今天很少人做搜索引擎,但是现在热门的RAG其实也是一种检索的研究。
结合语音的机理与理论(多位老师提到)
设计方法时要结合发声、传播、感知机理,用领域知识、物理世界的知识支持模型与架构设计,使方法更漂亮且具解释性。如几位老师提出在流式语音识别、歌唱破音修复、伪造语音检测中不仅要关注发声机理,还要考虑声音传播和人对声音的感知机理。如果对语音的机理做得好,那么多模态交互有可能就变成是语音的研究来主导。
立意新颖(杜俊老师、刘瑞老师、吴锡欣老师)
语音的研究有其独特性,在多模态融合的时代,有自己的东西,尤为重要,而不只是follow其他领域的工作。同时,结合其他领域知识,兼容并蓄,提出解决实际问题的创新方案范式,也是不可或缺的。例如语音音频理解应突出与文本理解的不同,让模型具备“情商”,理解口语交流的世界知识。
问题二:安全的大模型技术
目前的大模型的偏见、隐私、安全问题仍然没有很好解决。但在基模上的研究需要有洞察,研究成果才能经久有影响力,否则基模一旦更新,之前的研究都会变成无用。
小组3:凌震华、李明、樊帅、陈谦、屈丹、刘恩泽、雷延强、李梦璐、钱馨园、王帅、杨继臣、李艳雄(凌震华老师作为代表,报告小组讨论情况)
聚焦问题:音频推理的定义问题
音频推理应该建立在音频感知之上,语音识别虽然不算推理,却是推理的重要前导步骤。推理应该跟理解不一样,推理应该基于一些常识、外部知识、数学知识、物理知识,采用多层的信息加工而得到结论。
推理应该是动态的,一个问题没有解开之前,需要详细推理,一旦解开了,就不需要(细致的)推理。现在研究的推理有可能未来就变成只是简单的一步。
目前的各种任务对推理的核心任务起到帮助。需要建立一些真实场景的高难度benchmark,能够更好地体现语音与音频的特点和价值。
集体讨论
1)讨论话题:
a) 面向具身的时代,研究有哪些核心挑战和问题
具身智能时代首先要理解机器怎样感知环境和与环境交互。理解了机器的感知与交互特点,数据的搜集成为第一个关键问题。当前的单声道变成360度环绕立体声,具有极高的商业价值。从这个角度切入,可以把现有的研究基础很快利用起来,迅速推向实际落地应用。同时,如何实现从用消费型的电子设备麦克风(通常两三个)采集空间音频数据变化为高质量的多麦克风阵列采集到的空间音频也是一个很好地利用现有数据与研究基础的场景。有了物理世界的数据,是否可以基于对比学习训练得到一个表征,从而将物理世界的知识、信息、规律融入到机器的感知、推理、生成中,也是一个值得期待的研究问题。
b) 具身时代数据的获取与运用
具身智能时代数据的获取和高效运用尤为重要。音频采集中麦克风阵列采用什么拓扑结构,便是其中一个值得研究的问题,也是需要学术界与工业界合作的重要领域。是否可能开发一款球型阵列录音设备,统一标准以积累大量数据?由于声音的多普勒效应,动态的空间音频也需要采集。同时,应该采集真实世界中的完成实际任务的数据,而不是现在的主要还是问答场景的数据。
c) 多智能体协同下的新型研究范式
与会老师首先讨论了智能体的特征,包括工具调用、模型协同、任务编排、自学习自进化等。老师们颇有共识的是,在增强多智能体协同的过程中,多智能体编排的错误传播是一个极为关键的问题。智能体之间的信息传播目前主要是依赖文字,未来是否可以是多种模态的。目前的信息传播是点对点的,未来是否可以是类似于人类社会的某些交流机制,如运用BBS、微信群聊去交流协作。
2)讨论共识:
与会老师们经过讨论,达成诸多共识。老师们都认识到,物理世界与数字世界结合是未来。前面集中讨论的推理问题,实际上也与物理世界紧密相连。未来数据的获取和使用,结合研究问题与模式的变化,可能会发生一些范式性的变化。统一数据采集设备以分布式录取大量数据,是一条可能的道路。随着智能体的发展,管理学、人文学、伦理学的研究会融合到智能体的研究,带来新的研究角度与科学问题。
(2)第二轮小组讨论
小组1:NCMMSC 2026特殊议题与未来赛事小组:凌震华、朱璇、雪巍、陈谦、刘瑞、卜辉、苗晓晓、薛浏蒙、朱凌玉、陈培林、李哲(凌震华老师作为代表,报告小组讨论情况)
a) NCMMSC2026特殊议题组织
在今年11月的NCMMSC2026会议上,计划围绕本次研讨会主题组织2场特殊议题活动,分别针对比较宽泛的音频推理主题与更加具体的空间音频处理主题,形式上可能采用论文征稿、邀请报告等不同方式。在投稿征集方面,除引导嘉宾老师约稿外,在参会老师中进行征集。若投稿较多,可将部分接收稿件迁移至会议的regular session进行报告展示。
b) 未来赛事设想与讨论
未来的赛事组织需要着重考量比赛要素,有影响力的比赛更受关注,如举办多届或有大公司参与的比赛。选题应具有一定难度,避免榜单短期内被刷爆,要能真正解决问题。数据与场景选择可以从空间音频数据入手,以最低时间成本获取数据,开展赛事。目前已有基础是基于 ASR 项目的多个细分场景,如游戏、卖产品、新闻朗诵等,建立动态榜单。可设置多个任务,如类似视觉 VQA任务,加入不同噪声和复杂难度挑战。场景应用方面考虑路径导航、驾驶场景等依赖音频推理的场景,参考视觉导航任务设置方式。可以通过加强硬件合作拓宽赛事内容覆盖,如基于智能眼镜的数据进行比赛。但智能眼镜存在数据采集困难、续航问题以及多数据抽取复杂等问题,需与硬件厂商合作。可询问讯飞是否愿意开放接口,提供原始数据。
小组2:CCF进展报告小组: 李明、陈谐、邹月娴、刘李、樊帅、刘恩泽、雷延强、李梦璐、钱馨园、王帅、杨继臣、李艳雄(刘李老师作为代表,报告小组讨论情况)
主题聚焦在音频推理,有很多老师已经有研究成果。报告的框架包括:
a) 音频推理的定义。定义需要与视觉文本的推理有区分性。音频推理需要有与音频相关的任务目标,以精细的感知作为基础,推理的过程需要引入外部的知识与常识,融合真实场景数据信息完成推理。该过程往往需要经过多步推理完成复杂任务目标,且推理本身是动态变化的。
b) 研究方法。音频推理任务的数据、benchmark需要有特色。技术路线上,可以包括级联与端到端大模型的讨论。可以涉及音视频多模态联合推理和基于智能体的架构。面向理解与生成两方面的推理都可以讨论。以人为中心的推理过程是我们领域的特色。以解决实际问题为导向,同时突出音频推理与其他模态推理的方法新颖性。总结目前的评价指标、数据与benchmark、竞赛等。
c) 现存挑战与未来研究方向。音频表征是音频的感知与推理的重要前提,是目前的一个关键挑战。多模态联合推理是另一个关键问题。
小组3:未来基金项目指南小组: 俞凯、杜俊、吴锡欣、罗佳宸、任昕、朱梦尧、刘学琛、刘桐、屈丹、陈雅淇(朱梦尧老师作为代表,报告小组讨论情况)
未来的基金申请除了继续关注国家自然科学基金委,可以加强国际(包括港澳台)联合项目申请。科技部、发改委、工信部等多部委的基金项目同样值得关注。基金申请要注意面向国家经济建设、社会可持续发展和科技发展的重大需求。区域性基金申请要需要联系当地经济社会实际发展需求。
未来要加强团队协作,包括基金申请信息同步,建立更多国际合作点,邀请国际专家参与研讨会建立联系。专委会老师通力合作,递交更多基金项目指南。
会议总结(Summary)
本次会议汇聚了40多位学术界与工业界的学者专家,针对当前语音对话与听觉处理领域的最新进展进行了深入研讨,通过产学联动,凝练出关键的科学问题,形成产学研攻关的领域共识,总结了切实可行的发展方案,增进了产学研合作沟通,对本领域未来的发展具有很强的指导意义。会议中形成的提案将在随后的第二十一届全国人机语音通讯学术会议以及其他专委会学术活动中进一步落实为实际的议题、研讨会、赛事和产学合作,促进本领域的快速发展。
[ 初审:吴锡欣 ]
[ 复审:朱 璇 ]
[ 终审:凌震华
