由CCF语音对话与听觉专委会 、阶跃星辰、语音之家、希尔贝壳共同主办的 技术沙龙 — Step-Audio 2 技术分享交流会,将于2025年9月8日19:00-20:30线上直播,欢迎大家预约观看。

沙龙简介

Step-Audio 2 是阶跃星辰自研的第二代端到端语音大模型,业内首个将音频理解、深度思考、语音生成统一建模的架构,打通“听得懂、想得明白、说得自然”的完整交互链路。模型基于千万小时真实语音数据训练,具备实时对话、语音翻译、工具调用等关键能力,并在端到端语音模型中首创百变音色和深度思考能力,能对情感场景等副语言信息、声音音乐等非语言信息进行精细理解与推理,达到 SOTA 级语音理解与表达水平。Step-Audio 2已经上线阶跃 AI 手机 APP 和阶跃星辰开发平台,开源版 Step-Audio 2 mini 近期也已经于 GitHub 和 HuggingFace 发布。

论文链接:https://arxiv.org/abs/2507.16632

代码链接:https://github.com/stepfun-ai/Step-Audio2

Demo链接:https://www.stepfun.com/docs/zh/step-audio2


沙龙议程

时间:9月8日(周一)19:00 - 20:30

形式:线上直播


报告嘉宾

黎静北

阶跃星辰大模型语音算法研究员

报告题目:Step-Audio 2技术分享交流

摘要:Step-Audio 2 是阶跃星辰自研的第二代端到端语音大模型,业内首个将音频理解、深度思考、语音生成统一建模的架构,打通“听得懂、想得明白、说得自然”的完整交互链路。模型基于千万小时真实语音数据训练,具备实时对话、语音翻译、工具调用等关键能力,并在端到端语音模型中首创百变音色和深度思考能力,能对情感场景等副语言信息、声音音乐等非语言信息进行精细理解与推理,达到 SOTA 级语音理解与表达水平。Step-Audio 2已经上线阶跃 AI 手机 APP 和阶跃星辰开发平台,开源版 Step-Audio 2 mini 近期也已经于 GitHub 和 HuggingFace 发布。

田飞

阶跃星辰大模型语音算法研究员

报告题目:语音中感知与推理结合的探索与实践

摘要:Step-Audio 2 作为国内首个实现深度推理的语音对话大模型,开创性地探索并实现了音频感知与深层推理的融合,在多项国际基准测试中均达到SOTA性能。现有语音大模型大多仍停留在感知层面,虽在浅层语义理解方面表现良好,但仍缺乏对语音中复杂逻辑、情感意图以及隐含信息的深度推断能力,难以洞察语音背后所蕴含的深意。本次分享将系统介绍 Step-Audio 2 在语音理解与推理方面的技术实践,重点探讨语音推理的必要性、其带来的超越字面意义的认知增益,以及该模型如何推动语音AI向更深层次的认知交互迈进。


参加方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看

👇👇👇