论文题目:《TASU: Text-Only Alignment for Speech Understanding》

原文链接:https://arxiv.org/pdf/2511.03310

这篇论文是上交大和思必驰等合作,提出了一个叫TASU(Text-only Alignment for Speech Understanding)的新方法,核心就是不依赖大量音频-文本配对数据,只用没配对的纯文本,就能实现语音和文本的跨模态对齐。效果还不错:零样本语音识别 accuracy 跟用了音文监督的方法差距很小;当成课程学习(Curriculum Learning)的预训练阶段时,能明显提升语音识别的领域泛化能力;在MMSU(大规模多任务语音语言理解基准)上,零样本性能还超过了GLM-4-Voice、Step-Audio这些主流Speech LLM,算是给Speech LLM提供了个高效又能扩展的对齐思路。

01、引言:为啥要搞TASU?

现在的Speech LLM虽然能处理各种语音任务,但有两个大问题:
  • 一是用“连续特征投影”对齐语音和文本时,会引入很多冗余信息,不仅训练推理费资源,还容易过拟合;
  • 二是要想性能好,得靠海量音文配对数据和复杂训练流程,碰到没见过的领域或任务,泛化能力就拉胯。
不过早期CTC的方法给了作者启发:CTC输出的“后验分布”(简单说就是模型对每个帧对应哪个token的置信度)比原始音频特征更像文本结构,甚至能用文本的one-hot向量近似。所以作者就想:能不能用纯文本模拟CTC后验,彻底摆脱对音频监督的依赖?这就是TASU的由来。

02、相关工作:前人的方法差在哪?

先铺垫下CTC的基础:它会用“空白符号”和“合并重复token”,把没分段的音频序列转成变长文本序列,输出的帧级后验是压缩过的,很紧凑。
  • AlignFormer:虽然能用CTC信号下采样音频特征,还有点指令跟随能力,但一旦只有少量音文数据,多任务性能暴跌(比如选择题准确率快接近瞎蒙);
  • LegoSLM:用CTC后验给LLM的词嵌入加权,虽然特征更规整,但牺牲了多任务能力,还得用大规模数据重新对齐LLM的词汇表。
相比之下,TASU只用文本训练,还能保留LLM的多任务能力,零样本性能也强。

03、TASU核心方法:两大模块+训练推理流程

TASU的关键是搞了个“统一的后验接口”——训练时用文本模拟CTC后验,推理时用语音生成真实CTC后验,再通过同一个投影器对接LLM。下面重点说两个核心模块:


3.1 第一个核心:LSD(Label-Synchronous Decoding,标签同步解码)
作用是压缩语音的真实CTC后验,去掉冗余还不丢语义,能实现近6倍下采样(训练推理都快,还防过拟合)。就两步操作:
  • 删空白帧:设个阈值τ(实验里用0.9),如果某帧“空白符号”的概率超过0.9,直接扔了这帧;
  • 合并连续帧:如果有多帧的“最可能token”一样,就把这些帧的向量求平均,消除重复冗余。
3.2 第二个核心:CPS(CTC Posterior Simulation,CTC后验模拟)
作用是把纯文本转成“伪CTC后验”,让只用文本训练成为可能。模拟了真实CTC的特点(比如丢帧、重复),分三步随机操作:
  • 随机标签平滑:把文本token的one-hot向量,和均匀分布混一下(混合系数α在0.8-1.0之间随机),模拟真实音频后验的不确定性;
  • 随机删除:每个伪后验元素有5%概率被删掉,模拟CTC对齐时偶尔丢token的情况;
  • 随机插入:按5%的插入率,要么插“前一帧的复制”,要么插“空白向量”,模拟CTC的重复和空白分离特性。
3.3 训练&推理流程
  • 训练(只用文本):文本先转成one-hot向量→CPS生成伪CTC后验→训练一个“投影器”(Linear-SiLU-Linear结构),把伪后验映射到冻结的LLM输入空间(LLM参数不动,保留多任务能力);
  • 推理(用语音):语音经Audio Encoder(用的是SenseVoice-Small)生成真实CTC后验→LSD压缩后验→预训练好的投影器把压缩后验送进LLM,输出识别结果或其他任务预测。
3.4 跟其他方法的对比

只有TASU能做到“只用文本、只训投影器”,还同时有零样本和多任务能力。

04、实验细节:用啥模型、数据和指标?

  • 模型架构:语音编码器是SenseVoice-Small,LLM用Qwen2.5-1.5B(全程冻结),投影器是Linear-SiLU-Linear(只训它),投影器瓶颈维度平时1024,多任务时2048;
  • 数据:ASR用LibriSpeech(经典数据集)、SlideSpeech、CommonVoice4;语音翻译(ST)用CoVoST2(英转中);指令理解用SLURP;领域泛化测试用TED-LIUM 3(讲座领域,跟源域差异大);
  • 评估指标:ASR看WER(词错误率,越低越好),ST看BLEU(越高越好),多任务看MMSU的ACC(准确率,越高越好);
  • 关键参数:LSD的τ=0.9,CPS的α范围0.8-1.0、删除/插入概率都是0.05,学习率5e-5,训练5个epoch。

05、实验结果:TASU到底行不行?

分两部分看:先看零样本语音识别和领域泛化,再看多任务性能,每个关键表格都单独分析。
5.1 零样本识别+领域泛化

这张表对比了TASU和SLAM(用音文数据的基线)的性能,重点看这几个点:
  • 零样本能力:在LibriSpeech的clean/other测试集上,TASU的WER是4.57%/9.90%,SLAM是3.72%/8.47%,差距不到1.5%——说明只用文本训练,也能做到接近音文监督的对齐效果;
  • 加文本数据的提升:如果TASU训练时加入SlideSpeech的文本,在TED-LIUM 3(新领域)的WER从19.36%降到13.23%,甚至超过了SLAM的20.65%;
  • 课程学习(TASU + SFT):先文本预训练TASU,再用少量音文数据微调(SFT),效果更炸——LibriSpeech的WER降到3.55%/7.96%(比SLAM还低),TED-LIUM 3降到14.38%,SlideSpeech降到17.40%,既保了源域 accuracy,又提了泛化。
5.2 LSD的消融实验:LSD是刚需!

  • 没LSD的TASU:WER全超过100%,完全没法用——说明LSD压缩冗余、保留语义的作用是不可替代的;
  • 有LSD的对比:SLAM-CTC(用CTC后验+LSD)的Libri clean WER从3.79%(没LSD)降到3.13%,Ted-3从25.89%降到14.61%;TASU(伪CTC+LSD)也能正常工作,进一步证明LSD是TASU的核心。
5.3 多任务语音理解:小模型也能打赢大模型!

这张表测TASU在ASR、ST、MMSU多任务上的表现,重点看三个亮点:
  • 零样本多任务:TASU(1.5B参数,0小时音频)的MMSU ACC是40.32%,比用了1.8k小时音频的SLAM(36.70%)还高——说明纯文本训练的对齐效果比音文训练还好;
  • SFT后的提升:TASU (+SFT) 用了0.9k小时音频微调后,ASR的Libri clean/other WER降到3.28%/6.91%,ST的BLEU升到36.51%,MMSU还能保持40.48%(没掉)——说明微调只提任务性能,不丢泛化;
  • 跟大模型对比:TASU(1.5B)的MMSU ACC超过了SALMONN-13B(25.84%)、GLM-4-Voice(35.51%)、Step-Audio(130B,37.42%),虽然比Qwen2.5-Omni(7B,60.57%)低,但TASU模型小、用的音频少,性价比极高。

06、结论&未来计划

  • 结论很简单:TASU靠纯文本训练,搞定了三个事——零样本语音识别(差距小)、课程预训练提泛化、多任务零样本性能强,是个高效的Speech LLM对齐范式。
  • 未来要做的:一是改进CPS,让文本模拟的伪CTC后验更接近真实音频的后验;二是用更多文本数据,看看TASU的扩展能力和性能上限能到哪。
最后总结一下TASU的核心创新点:
  • 范式创新:首次实现“纯文本训练”的Speech LLM对齐,彻底摆脱对音文配对数据的依赖;
  • 效率创新:LSD实现6倍下采样,既减训练推理成本,又缓解过拟合;
  • 方法创新:CPS通过三步随机操作,精准模拟CTC后验特性,让文本替代音频训练成为可能;
  • 性能创新:零样本和多任务能力都超过主流方法,小模型也能打赢大参数Speech LLM。