由CCF语音对话与听觉专委会 、西北工业大学音频语音与语言处理研究组、语音之家、希尔贝壳共同主办的【语音之家】AI技术沙龙 — OSUM-Echat: 语音理解驱动的端到端共情口语对话生成模型,将于2025年9月16日19:00-20:00线上直播,欢迎大家预约观看。
沙龙简介
在当今人工智能飞速发展的时代,语音交互技术不断迭代。西北工业大学音频语音与语言处理研究组(ASLP@NPU)正式发布的开源端到端共情语音对话系统 OSUM-EChat,正致力于攻克当前共情语音对话领域的数据依赖、副语言线索提取不足以及缺乏统一评估标准等难题。本沙龙将深入剖析 OSUM-Echat 这一创新模型,其基于先前 OSUM 语音理解大模型研究成果,通过独特的「理解 - 生成 - 共情」三阶段训练策略,以及「语义 - 副语言双重思维机制」,让模型如同人类一般,先理解用户语义内容,推断年龄、性别、情绪等副语言信息,进而生成饱含同理心的回应,在资源有限的环境下也能取得不错的效果。模型采用原生多模态架构,将语音编码与解码整合于单一框架,最大程度保留关键副语言信息。本次沙龙将为大家带来对该模型全面且深入的解读,助力学术界和开发者社区更好地理解和应用这一前沿技术,推动语音交互领域迈向新高度 。
沙龙议程
时间:9月16日(周二)19:00 ~ 20:00
形式:线上直播
| 时间 | 报告题目 | 报告人 |
| 19:00-19:40 | OSUM-Echat: 语音理解驱动的端到端共情口语对话生成模型 | 耿雪龙 |
| 19:40-20:00 | Q&A |
报告嘉宾

嘉宾简介:耿雪龙,西北工业大学音频语音与语言处理研究组(ASLP@NPU)二年级硕士生,主要从事与 LLM 结合的语音理解和语音对话研究,主要涉及多模态语音语义融合、端到端共情对话生成及开源语音系统构建,是 OSUM 系列研究的主要负责人,已以第一作者或合作者身份发表论文 7 篇。
报告题目:OSUM-Echat: 语音理解驱动的端到端共情口语对话生成模型
报告摘要:
- 介绍OSUM-Echat的设计思路
- 展示OSUM-Echat实验效果和demo展示
- 实验经验分享
- 技术答疑
相关链接:
论文:https://arxiv.org/pdf/2508.09600
代码:https://github.com/ASLP-lab/OSUM
Demo:https://aslp-lab.github.io/OSUM.github.io/
参加方式
直播将通过语音之家微信视频号进行直播
手机端、PC端可同步观看
👇👇👇

