由CCF语音对话与听觉专委会 、西北工业大学音频语音与语言处理研究组、语音之家、希尔贝壳共同主办的【语音之家】AI技术沙龙 — OSUM-Echat: 语音理解驱动的端到端共情口语对话生成模型,将于2025年9月16日19:00-20:00线上直播,欢迎大家预约观看。

沙龙简介

在当今人工智能飞速发展的时代,语音交互技术不断迭代。西北工业大学音频语音与语言处理研究组(ASLP@NPU)正式发布的开源端到端共情语音对话系统 OSUM-EChat,正致力于攻克当前共情语音对话领域的数据依赖、副语言线索提取不足以及缺乏统一评估标准等难题。本沙龙将深入剖析 OSUM-Echat 这一创新模型,其基于先前 OSUM 语音理解大模型研究成果,通过独特的「理解 - 生成 - 共情」三阶段训练策略,以及「语义 - 副语言双重思维机制」,让模型如同人类一般,先理解用户语义内容,推断年龄、性别、情绪等副语言信息,进而生成饱含同理心的回应,在资源有限的环境下也能取得不错的效果。模型采用原生多模态架构,将语音编码与解码整合于单一框架,最大程度保留关键副语言信息。本次沙龙将为大家带来对该模型全面且深入的解读,助力学术界和开发者社区更好地理解和应用这一前沿技术,推动语音交互领域迈向新高度 。

沙龙议程

时间:9月16日(周二)19:00 ~ 20:00

形式:线上直播

时间报告题目报告人
19:00-19:40OSUM-Echat: 语音理解驱动的端到端共情口语对话生成模型耿雪龙
19:40-20:00Q&A

报告嘉宾

嘉宾简介:耿雪龙,西北工业大学音频语音与语言处理研究组(ASLP@NPU)二年级硕士生,主要从事与 LLM 结合的语音理解和语音对话研究,主要涉及多模态语音语义融合、端到端共情对话生成及开源语音系统构建,是 OSUM 系列研究的主要负责人,已以第一作者或合作者身份发表论文 7 篇。

报告题目:OSUM-Echat:  语音理解驱动的端到端共情口语对话生成模型

报告摘要:

  1. 介绍OSUM-Echat的设计思路
  2. 展示OSUM-Echat实验效果和demo展示
  3. 实验经验分享
  4. 技术答疑

相关链接:

论文:https://arxiv.org/pdf/2508.09600

代码:https://github.com/ASLP-lab/OSUM

Demo:https://aslp-lab.github.io/OSUM.github.io/

参加方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看

👇👇👇