以下文章来源于433的3号同学,作者贾彦
一、结论先行
过去四年,音频智能的核心范式发生了五次迁移:
先形成可复用的两类听觉前端。Whisper 提供稳健的语音语义表征,解决“说了什么”;CLAP 提供通用声音—文本对齐,解决“这是什么声音、与哪段文字匹配”。它们共同成为后续 Audio-LLM 最常复用的两类“耳朵”。 从单任务模型转向“音频编码器 + 连接模块 + LLM”。2023 年的 Pengi、LTU、LTU-AS、SALMONN、Qwen-Audio 将分类、描述、问答、识别和推理统一为文本生成任务,模型开始处理语音、环境声和音乐,而非只做 ASR。 从能听懂转向能交互、能推理、能处理长音频。2024 年后,研究重点转向开放式指令跟随、复杂音频推理、长上下文和实时全双工对话;2025—2026 年进一步采用思维链数据、推理强化学习、流式音频 token 和任务定制 RLHF。 从“文本模型帮忙猜”转向“听觉证据约束的推理”。2025 年后,音频问答开始系统采用结构化 CoT、可验证奖励与推理后训练;Audio-Reasoner、Step-Audio-R1 等代表工作把推理训练引入音频,而 AHA 和 audio-contribution-aware training 则用反事实样本或音频贡献筛选,检验并约束回答是否真的依赖听觉证据。 从十亿级适配器模型转向原生超大规模 Omni 预训练。MiMo-Audio 把音频预训练扩展到超过 1 亿小时;Qwen3-Omni 采用 Thinker–Talker MoE;Qwen3.5-Omni 进一步达到数千亿参数、256K 上下文和超过 1 亿小时音视频数据。这说明 2026 年前沿已不是单一的“音频编码器接 LLM”,而是原生多模态 MoE、超长上下文、统一理解—生成和专门后训练的组合。
二、“音频理解”到底包含什么
音频比图像更难统一,原因是同一波形同时携带多层信息:
因此,本文所称“大模型”不只指参数量大,也指在大规模、多任务音频—文本数据上训练,能以自然语言接口完成多种听觉任务的基础模型。
三、技术路线的演化:只看高影响代表作
3.1 2022:先建立可复用的语音与声音前端
2022 年最重要的不是“已经出现 Audio-LLM”,而是后续模型获得了两类成熟、可直接复用的听觉前端:
Whisper 用 68 万小时多语言、多任务弱监督语音训练获得稳健的连续语音表征。它后来被 LTU-AS、SALMONN、Qwen-Audio/Qwen2-Audio、Kimi-Audio、Audio Flamingo 3、Eureka-Audio 等直接采用或改造,是 Audio-LLM 中影响最广的语音编码器之一。 CLAP 将 CLIP 式对比学习迁移到音频和自然语言,把固定标签分类扩展为开放词汇检索与零样本识别。Pengi 自行训练 CLAP 式编码器,Audio Flamingo 使用 CLAP 系滑窗前端,Audio Flamingo 2 又进一步训练 AF-CLAP。
两者分工不同:Whisper 更擅长回答“说了什么”,CLAP 更擅长判断“这是什么声音、它与哪段文字最匹配”。Whisper 虽然本身是 ASR/翻译模型,但在本文中作为Audio-LLM 基础设施保留,不参与后面的通用音频理解或 ASR 排名。
3.2 2023:音频编码器接入 LLM
这一年的核心结构收敛为:
波形/频谱 → 预训练音频编码器 → prefix/projector/Q-Former → 文本 LLM → 自然语言答案
四篇代表作构成一条清晰链路:
Pengi 把分类、描述、检索和问答统一成文本生成,证明“一套生成接口处理多种音频任务”可行。 LTU 用 OpenAQA-5M 和感知→理解课程,将非语音音频问答与解释作为核心任务。 SALMONN 组合 Whisper 与 BEATs,通过 window Q-Former 接入 Vicuna,形成“语音内容 + 通用声音”的双前端范式。 Qwen-Audio 将 30 多种 speech/sound/music/song 任务纳入大规模多任务预训练,再用指令微调形成聊天模型。
因此,2023 年真正完成的不是某个单项指标突破,而是把音频任务的输出空间统一成语言。
3.3 2024:从短音频回答走向长上下文和实时交互
2024 年有四个影响后续路线的变化:
Audio Flamingo 引入音频少样本上下文学习、检索增强和可量化的多轮对话。 Gemini 1.5 Pro 将音频纳入百万 token 多模态上下文,推动长音频检索与跨片段推理。 Qwen2-Audio 用自然语言提示替代复杂任务标签,并区分 Audio Analysis 与 Voice Chat 两种交互模式。 Moshi 用双音频流和低帧率 codec 实现约 200ms 的全双工 speech-to-speech,对后续实时 Omni 模型影响显著。
这一阶段的主线可概括为:模型不仅要回答音频问题,还要处理更长输入、适应未见任务,并以自然语音实时交互。
3.4 2025:推理、长音频与原生 Omni 汇流
2025 年的代表工作可以归纳为三条主线,但每条只保留最有影响的模型:
开放通用听觉。Audio Flamingo 2 以 AF-CLAP、AudioSkills 和 LongAudio 将理解扩展到 5 分钟;Audio Flamingo 3 改用统一 AF-Whisper,覆盖 speech/sound/music、最长 10 分钟音频和按需思考,并开放权重、代码与主要数据。 原生 Omni。Qwen2.5-Omni 奠定流式 Thinker–Talker;Kimi-Audio 将预训练扩展到 1,300 万小时;Qwen3-Omni 进一步采用 30B-A3B MoE,并统一 Instruct、Thinking、Captioner 与实时生成。 规模化少样本学习。MiMo-Audio 将预训练推至超过 1 亿小时,在未专门训练的任务上观察到少样本能力,说明 Audio-LLM 开始出现类似文本 LLM 的规模效应。
3.5 2026:大模型、小模型与可信推理并行
Qwen3.5-Omni:数千亿参数、256K 上下文、超过 1 亿小时音视频数据,代表超大原生 Omni。 Eureka-Audio:1.7B 语言骨干配合稀疏 MoE adapter,代表紧凑通用听觉。 ALARM:冻结 4B 推理 LLM,仅训练多编码器压缩和对齐模块,代表低成本推理迁移。 Audio-Cogito:开放 54.5 万条推理样本并进行自蒸馏,代表开放 grounded reasoning。 StepAudio 2.5:ASR、TTS、实时对话共享骨干,通过任务约束和 RLHF 切换工作模式,代表产品化统一语音系统。
这五个阶段串成一条主线:对齐声音与语言 → 把音频接入 LLM → 扩展长上下文和实时交互 → 统一理解、推理与生成 → 同时追求规模、效率和听觉可信度。
四、统一评测与排名
4.1 音频理解:基准解释与总排名
音频理解榜只保留三项交集高、覆盖互补的主流基准:
| 广度 | |||
| 深度 | |||
| 语音细粒度 |
三项均为百分制准确率,越高越好。
| 1 | Gemini 3.1 Pro(标杆) | 83.70 | 82.03 | |||
| 2 | Qwen3.5-Omni-Plus | 82.20 | 82.80 | 81.67 | ||
| 3 | Qwen3.5-Omni-Flash | 75.53 | ||||
| 4 | Qwen3-Omni-Instruct | 72.89 | ||||
| 5 | Audio contribution-aware(Mixed-to-Strong) | 71.27 | ||||
| 6 | MiMo-Audio-7B-Instruct | 66.73 | ||||
| 7 | Kimi-Audio-7B-Instruct | 63.84 | ||||
| 8 | Step-Audio-2-mini | 62.89 | ||||
| 9 | Eureka-Audio-Instruct | 62.17 | ||||
| 10 | Audio Flamingo 3 | 60.95 | ||||
| 11 | DIFFA-2 | 59.42 | ||||
| 12 | Qwen2.5-Omni-7B | 59.02 | ||||
| 13 | ALARM-E | 57.47 | ||||
| 14 | Qwen2.5-Omni-3B | 53.24 | ||||
| 15 | Qwen2-Audio-Instruct | 46.90 | ||||
| 16 | SALMONN | 33.17 | ||||
| 17 | LTU | 19.67 | ||||
| Gemini 2.5 Flash(标杆) | 68.70† | |||||
| Audio-Reasoner | 50.30† | |||||
| Audio Flamingo 2 | 41.50† | |||||
| GAMA | 24.10† | |||||
| Baichuan-Omni-1.5 | 50.60† |
前 17 行为第五节已调研且三项齐全的主榜,按同一模型或同一训练策略的三项算术平均值排序;其后“补充”行仍是已调研模型,但缺少部分交集基准。†是按已报项目均值,不能与三项齐全的主榜进行严格排名。需特别注意:数字来自不同论文的集中评测表,虽使用同名基准,但提示词、解码设置、数据版本和模型版本未必一致;因此本表用于观察能力层级与分项短板,不等同于统一复现的严格官方排行榜。Gemini 3.1 Pro 的数值来自 Qwen3.5-Omni 的同协议外部对照,Qwen3.5-Omni-Plus/Flash 则为该论文自报;二者均应结合这一来源边界解读。Audio contribution-aware 论文的 MMAU 单项最高值 75.60 来自 Weak-to-Strong,但该策略的 MMAR/MMSU 是 65.30/69.30;正式排名采用三项均由同一 Mixed-to-Strong 策略产生的 75.10/67.00/71.70,避免把两个 checkpoint 的最佳分数拼接成不存在的模型。
4.2 ASR:基准解释与总排名
ASR 单独衡量“是否听清并准确转写”,不并入理解综合分。榜单只保留两个稳定且被近年 Omni/Audio-LLM 论文反复采用的公开集合,共四个目标子集:LibriSpeech test-clean/test-other(英文 WER)和 WenetSpeech test-net/test-meeting(中文 CER)。为便于展示,WER/CER 统称为字词错误率。
榜单范围也收紧为:第五节已逐一调研、具有通用音频理解或 Omni 能力,且其原论文/技术报告实际报告了上述四项中至少一项的模型。不再把未调研的外部基线或专用单任务 ASR 模型塞进排名;因此 Qwen3-ASR 系列不参与本表。StepAudio 2.5 保留,因为其报告的是 ASR/TTS/实时对话共享骨干的统一模型,而非单任务 ASR。平均值按实际报告的目标子集计算:ASR 平均错误率 = 已报告目标子集错误率之和 / 覆盖子集数,越低越好。覆盖 4/4 的模型构成正式排名;覆盖不足的模型放在同一表底部,仅作补充对照。
| 1 | Step-Audio 2 | 3.25 | ||||
| 2 | Qwen3.5-Omni-Plus | 3.37 | ||||
| 3 | Qwen3.5-Omni-Flash | 3.41 | ||||
| 4 | StepAudio 2.5 | 3.45 | ||||
| 5 | Qwen3-Omni-Flash-Instruct | 3.52 | ||||
| 6 | Qwen3-Omni-30B-A3B-Instruct | 3.57 | ||||
| 7 | Kimi-Audio | 3.84 | ||||
| 8 | Qwen2.5-Omni-7B | 4.70 | ||||
| 9 | Eureka-Audio-Instruct | 5.35 | ||||
| 10 | Gemini 3.1 Pro(标杆) | 8.38 | ||||
| Audio Flamingo 3 | 2.35 | |||||
| Qwen2-Audio | 2.60 | |||||
| MiMo-Audio-7B-Instruct | 3.50 |
严格可比的 4/4 行里,Step-Audio 2 居首;Qwen3.5-Omni-Plus/Flash、StepAudio 2.5 紧随其后。Qwen3.5-Omni-Plus 的 LibriSpeech clean/other 均为已列模型最低;虽然它的 WenetSpeech meeting 错误率高于 Flash,但四项平均仍略低于 Flash。WenetSpeech 的错误率普遍高于干净朗读集,是更能区分真实场景鲁棒性的部分。
五、模型全景、结构与训练细节
六、四年间最关键的技术变化
6.1 音频表示:连续特征与离散 token 并行发展
连续特征路线常使用 Whisper、BEATs、CLAP 等编码器,保留细粒度信息,再由线性投影、Q-Former 或 resampler 压缩后送入 LLM。优点是理解任务成熟、训练稳定;缺点是难以直接生成音频。 离散 token 路线用神经音频 codec/tokenizer 把波形离散化,使 LLM 同时建模文字与声音。优点是天然支持 speech-to-speech;缺点是序列很长,语义与声学细节存在码率冲突。 新一代系统常采用混合方案:连续特征负责输入理解,离散 token 负责输出生成,Kimi-Audio 是典型例子。
6.2 连接模块:从简单前缀到跨层聚合与稀疏专家
早期 Pengi 式prefix projector成本低,但可能丢失音频时序细节;随后 Q-Former、音频适配器和多层特征聚合成为主流。2026 年 Eureka-Audio 又把 adapter 做成稀疏 MoE,让 speech、sound、music 的冲突由不同专家分担。连接模块的目标本质上是解决两个压缩问题:把高帧率长音频压到 LLM 可承受的长度,同时不丢事件顺序、说话人和韵律。
6.3 数据:从人工标签转向合成指令、反事实与规模化预训练
OpenAQA-5M、CompA-R、CoTA、AF-Think、AudioMCQ 等数据表明,Audio-LLM 的跃升高度依赖 LLM 自动生成问答、解释或思维链;MiMo-Audio/Qwen3.5-Omni 又把原始音频规模推到 1 亿小时级。这显著提升覆盖,却带来四类风险:
文本教师可能根据标签“编答案”,而不是忠实于原音频; 模型学会语言先验,听觉证据不足时仍能猜中; 训练数据、公开音频集和评测题之间可能发生污染。 “小时数”和“token 数”跨论文口径不一致:原始去重音频、增强后样本、混合重采样和音视频联合 token 不能直接比较。
6.4 后训练:SFT → DPO → RLVR → grounded / multi-objective RLHF
2023 年重点是音频指令微调;2024 年 Qwen2-Audio 等将偏好优化引入音频交互;2025 年后,多篇工作将可验证奖励、结构化 CoT 或强化学习用于音频问答。audio-contribution-aware、AHA、Step-Audio-R1 分别从听觉贡献、反事实一致性和有根推理角度收紧“答对即可”的目标。Step-Audio-R1.5 的结论尤其重要:只奖励答案正确可能损害韵律、情绪和对话连续性,真实助手需要多目标后训练,而不是一味延长 CoT。
6.5 交互:级联系统向全双工端到端系统迁移
传统语音助手依赖 ASR→文本 LLM→TTS,容易丢失语气、情绪、环境声及重叠说话。Moshi、Qwen2.5-Omni、Kimi-Audio、Step-Audio 系列尝试直接建模音频输入输出。但级联系统依然具备模块可替换、结果可审计和工程稳定的优势,短期内两条路线会并存。
七、仍未解决的核心问题
真正的音频 grounding。模型可能依赖问题文本和数据集先验;需要音频扰动、反事实样本和“无声/错配音频”对照实验确认答案确实来自听觉证据。 复杂声景与时间定位。多说话人、音乐加语音、弱事件被强声源遮蔽、长时间跨度上的先后与因果,仍是明显薄弱项。 长音频不是简单扩大上下文。分钟到小时级音频需要分层记忆、事件索引、时间戳引用和检索机制,否则计算量随帧数迅速增长。 推理的可信度。思维链可以改善分数,也可能只是更流畅的事后解释;需要可验证中间变量,如事件时间、声源、频率/节奏证据。 评测不可比。不同论文使用不同提示、音频预处理、闭源裁判和数据版本;开放生成指标对措辞敏感,LLM-as-a-judge 还可能偏好某些回答风格。 语言与领域覆盖不均。多数通用音频数据偏英语和公开视频;低资源语言、方言、医疗听诊、生物声学、工业异常声仍缺少高质量音频—语言配对。 隐私与安全。音频天然包含身份、位置、健康、背景对话等敏感信息;实时模型还需处理录音同意、说话人冒充、提示注入和深度伪造风险。
八、值得继续跟踪的研究方向
可验证音频推理:输出答案时同步给出事件、说话人和时间区间证据。 反事实与音频贡献评测:替换、静音、打乱或移动关键声源,检查答案是否真的随听觉证据变化。 多尺度音频记忆:局部声学细节、句子级语义、长程事件摘要分层建模。 联合声景理解:同时处理语音内容、副语言、音乐与环境事件,而非只选择最强声源。 空间与物理听觉:从单声道标签扩展到方向、距离、混响、遮挡、频带、事件次数与连续运动。 小模型与边缘部署:蒸馏、帧率压缩、流式编码和动态计算,在隐私场景本地运行。 交互式主动听觉:模型能请求重放、放大某段、分离声源或调用音频检索工具,而非一次性猜答案。 独立第三方评测:固定提示、预处理、裁判和版本,加入反事实、噪声、口音及真实对话压力测试。
九、总体判断
音频理解大模型已经完成了从“音频分类器”到“可对话、可推理、可生成的听觉基础模型”的范式切换。Qwen3.5-Omni、MiMo-Audio 说明 1 亿小时级数据、MoE 和长上下文正在形成新的规模前沿;AF3、Eureka-Audio、ALARM 则说明开放数据与专门结构仍能让较小模型有竞争力。但现有系统尚未达到稳定、可信的类人听觉,真正困难的部分仍是:混合声景、长程时序、弱声源、多说话人、副语言、空间/物理属性、专业知识以及可验证推理。
未来两三年的胜负手不是“规模”或“数据”二选一,而是五件事的组合:原生多模态规模化预训练、更高保真的多尺度/空间音频表示、更可信且可追溯的音频—语言数据、面向听觉证据与感知体验的多目标后训练,以及能揭示“模型到底有没有听”的反事实评测。2026 年最值得警惕的误区,是把更长 CoT、更自然的语音或更大的输入窗口直接当成更强的音频理解。
