标题:Index-ASR Technical Report

链接:https://arxiv.org/pdf/2601.00890

发表日期:2026年1月6号

作者单位:Artificial Intelligence Platform Department, bilibili

这篇报告讲的是bilibili AI平台团队做的 Index-ASR ——一个基于大语言模型的大规模语音识别系统。核心目标是解决现有LLM-based ASR的两个痛点:一是容易“瞎编”(幻觉错误,输出又长又重复,还没跟上声学输入),二是没法灵活定制上下文(比如特定领域的热词识别不行)。

01、引言:为啥要做Index-ASR?

近几年ASR进步特别快,一方面是模型参数和数据量越做越大(比如早期的Whisper,1.5B参数、训了680k小时多语言语音数据,多语言识别效果就很好),另一方面是和LLM深度结合,ASR架构从以前的“编码器-解码器(AED)”慢慢转向了LLM-based(比如Seed-ASR、FireRedASR这些模型,都证明加LLM能提升语义消歧能力,转录结果更连贯、更贴合上下文)。
  • 抗噪声能力差:背景噪声一大会让LLM-based ASR“瞎编”,输出没根据的长文本;
  • 上下文定制弱:没法灵活用用户定义的热词,识别领域术语(比如特定行业的词)不准。
所以团队就搞了Index-ASR,主打三个优势:识别准、抗噪声强、支持自定义热词。

02、模型架构:Index-ASR由哪几部分组成?

整体结构分三大块,还支持灵活的prompt,下面一个个说:

  • 音频编码器:核心是提取语音的“高层表征”——就是把输入的语音信号转换成模型能懂的特征;
  • 音频适配器:做两件事:一是“时域下采样”(简化时间维度的特征),二是把编码器输出的特征,投影到LLM需要的维度(让音频特征和文本特征能对齐);
  • LLM解码器:基于Qwen3-8B模型,用“自回归(autoregressive)”的方式生成转录文本——生成时会同时参考适配器处理后的语音特征,以及文本prompt。
重点说下prompt设计:除了常规的“指令prompt”(比如告诉模型“把这段语音转文字”),还加了“上下文prompt”——如果给模型用户定义的热词列表、或者段落级摘要,它就能更准地识别低频词、领域术语(比如游戏圈的专属词汇)。

03、训练数据:用什么数据训模型?

数据分三类,每类对应不同训练阶段:
  • 音频编码器的训练数据:主要用开源数据集(覆盖中英),比如LibriSpeech(英文)、GigaSpeech(多领域)、WenetSpeech(中文)、AISHELL-2(中文),再补点bilibili内部的标注数据,提升数据多样性;
  • 监督微调(SFT)数据:在上面数据集的基础上,加了两个:一是开源的Multilingual LibriSpeech(只用到英文部分),二是内部的“伪标注数据”(就是模型初步预测后,人工稍微调整过的数据);
  • 上下文监督微调数据:专门为提升上下文能力做的,分两种:
    • 热词上下文数据:用DeepSeek-V3模型,从ASR样本里提取关键词、领域术语;
    • 摘要上下文数据:把同一个视频的所有转录文本拼起来,让DeepSeek-V3生成简洁摘要,作为上下文信息。

04、训练过程:分三步走,不一步到位

训练分三个阶段,每个阶段侧重点不同,还涉及参数冻结/微调的技巧,下表能看的很清楚:

具体阶段细节:
  • 音频编码器训练:跟着FireRedASR的思路,用Wenet框架训一个“Conformer编码器+Transformer解码器”的AED模型——Conformer擅长抓语音的局部和长距离依赖,Transformer擅长序列转换;训完后,把这个AED模型的“编码器”拿出来,作为Index-ASR音频编码器的初始参数;
  • 监督微调(SFT):分两阶段
    • Stage1:冻结音频编码器和LLM,只训适配器——目标是让适配器把音频特征“转译”到LLM能懂的语义空间,实现音频和文本的“对齐”;
    • Stage2:音频编码器和适配器全参数训,LLM用LoRA微调——进一步提升识别性能,同时避免全训LLM太费资源;
  • 上下文监督微调:用第3节说的“上下文数据”训,但会混一部分SFT阶段的普通ASR数据——防止模型只适应有上下文的场景,没上下文时性能下降;LLM还是用LoRA微调,可训练参数和Stage2一样是438M。

05、实验评估:Index-ASR表现怎么样?

实验对比了4个主流开源模型(Whisper、Kimi-Audio、Step-Audio 2 mini、FireRedASR),测了三类数据集:开源干净数据集、内部多领域(含噪声)数据集、上下文相关数据集。结果都用WER(越低越好)和热词召回率(越高越好)衡量,重点看三个表。
5.1 开源测试集结果:噪声场景显优势
下表测的是AIShell-2、LibriSpeech这些开源数据集的WER,重点看关键数据集的对比:

结论很明显:在干净的数据集(比如LibriSpeech test-clean、AIShell2)上,Step-Audio 2 mini表现更好;但到了 有噪声的GigaSpeech ,Index-ASR直接冲到第一(10.29),比第二的FireRedASR(11.33)还低1个多点——证明它抗噪声能力确实强。
5.2 内部测试集结果:多领域(尤其噪声领域)SOTA
内部测试集覆盖中文8个领域(A到H,其中A、E领域背景噪声多)和英文2个场景(speech、music),看WER对比:

重点看 噪声多的领域A、E :Index-ASR的WER比第二的FireRedASR低不少(A领域9.90 vs 12.21,E领域6.57 vs 7.67);其他中文领域、英文场景也都是Index-ASR最好——说明它在真实业务的多领域场景里,是当前最优(SOTA)。
5.3 上下文测试集结果:加上下文效果超明显
测的是“有无上下文”对WER(越低越好)和热词召回率(越高越好)的影响,三个数据集:AIShell-1热词、ContextASR-Speech-Mandarin、内部上下文集:

这个结果很直观:
  • 加了上下文后, 平均WER从5.70降到3.25,降了43% ;
  • 热词召回率从67.62升到89.93,升了33%——尤其是AIShell-1热词集,召回率从39.90飙到88.08,翻了一倍多; 证明Index-ASR能很好地利用上下文提示,识别热词、领域术语的能力很强。

06、核心创新点

整个方案的核心创新:
  • 架构创新:把音频编码器、适配器、Qwen3-8B LLM结合,还支持“上下文prompt”(热词、摘要),专门针对上下文定制;
  • 数据创新:用大量带真实噪声的语音数据抗幻觉,用“热词+摘要”的上下文数据提升定制能力;
  • 训练创新:分三阶段训练(先训编码器、再分两阶段SFT、最后上下文SFT),还在上下文SFT里混普通数据,避免性能下降;
  • 问题解决:同时搞定了“噪声引发幻觉”和“上下文定制弱”两个痛点,而不是只优化一个。

07、局限与未来计划

虽然Index-ASR表现不错,但还有三个小问题:
  • 目前只支持中文和英文,没法处理其他语言——未来要做“多语言版”;
  • 训练数据量比工业级ASR模型还少,得再扩充;
  • 不支持“流式ASR”(就是边听边转文字,实时输出)——这是下一步重点优化的方向。

08、结论

简单说,Index-ASR是个基于LLM的ASR系统,靠“加噪声数据、加上下文数据”和“分阶段训练”,解决了现有模型的幻觉和上下文定制问题。不管是开源干净数据集、内部多领域(含噪声)数据集,还是上下文场景,表现都很好,尤其是抗噪声能力和热词识别能力突出。未来再补多语言和流式功能,实用性会更强。