过去一年,OpenAI、Thinking Machines Lab 等多模态团队开始把注意力从「生成更拟人的语音回答」,迈向一个更难的问题:AI 如何真正参与一场实时发生的互动。
全双工模型让智能体边听边说,全模态让语音、视觉等信息协同判断,而交互模型又往前一步:此刻这场互动正在发生什么,下一步应该如何思考、响应和行动。

10 月 23 日下午,iRTE 2026「对话式 AI 技术专场」将围绕 「互动即智能:对话式 AI 与交互模型」,一起讨论这些正在发生的变化。
本场论坛由西北工业大学计算机学院教授、博士生导师谢磊,与声网多模态负责人吴渤共同担任出品人。
从音频智能、多模态交互、多说话人语音识别,到语音生成与交互模型,来自高校与产业一线的研究者、开发者,将从不同技术路径回答一个共同的问题:AI 真正进入实时互动,还需要具备哪些能力?
主题分享丨AI 如何学会实时互动?
从音频智能、多模态交互,到多说话人识别、实时语音生成,再到下一代交互模型,五场主题分享将从不同环节拆解 AI 如何实现「实时互动」。
- 谢磊@西北工业大学|基础模型时代的音频智能:从理解与生成走向交互与智能体
- 王泽源@声网|多模态模型与实时语音交互
- 李明@香港中文大学(深圳)|复杂多人交互场景下的目标人声抽取与多说话人语音识别
- 王新升@Soul|Loxi-Speech:为实时交互而生的语音合成
- 杨学锐@阶跃星辰|关于下一代交互模型的技术思考
圆桌|实时交互模型的落地和探索
来自模型、语音与产品一线的嘉宾将一起讨论:实时交互真正进入产品,还要跨过哪些模型、工程与体验门槛?
圆桌嘉宾
- 徐广健|亮源新创音频技术负责人
- 谢之非|NTU PhD,VoiceMem、Mega-ASR、Mini-Omni 作者
- 杨斌丨BreezeBlue AI 创始人 & CEO
- 王新升|Soul 洛希事业部负责人、Loxinity co-founder
主持人
- 吴渤|声网多模态负责人
如果你正在做语音交互、多模态模型、实时 AI 应用,欢迎来到现场!
10 月 23 日 14:00–17:00,iRTE 2026 实时智能大会,北京悠唐皇冠假日酒店。
门票限时免费,点击阅读原文或扫描海报二维码报名,加入我们!

