标题:Unifying Speech Recognition, Synthesis And Conversion With Autoregressive Transformers

链接地址:https://arxiv.org/pdf/2601.10770

作者单位:AutoArk-AI

发表日期:2026年1月15日

开源地址:https://github.com/AutoArk/GPA

本文是无界方舟(AutoArk)团队提出的统一多任务方案,叫GPA(General-Purpose Audio),下面先顺着论文的路子来,先搞懂它为啥要做这个研究,再讲核心的GPA模型咋设计的,接着说实验是咋跑的、结果咋样,最后聊聊亮点和小遗憾。

01、开头:传统语音系统太“分家”,GPA就是来“统一战线”的

现在语音技术其实挺强的:TTS能合成像人说话的声音,ASR能把语音转成文字,VC能变声。但问题是这仨活儿“各干各的”,用的模型、架构全不一样,特别碎片化:
  • TTS要么用“自回归生成token”,要么用“扩散模型”,还有多阶段的混合架构,步骤多还复杂;
  • ASR虽然有Whisper、Qwen-Audio这些大模型,但它们只擅长“认声音转文字”,想让它们合成语音或者变声,得大改架构;
  • VC靠“解纠缠”把语音拆成“内容”“音色”这些部分,但得要大量平行数据,还得额外微调才能适配新说话人。
这种“分家”导致啥问题呢?重复干活、知识不互通、部署还麻烦——比如一个智能音箱要同时做“听指令(ASR)”“说话回应(TTS)”,得装俩模型,占内存还费电。所以论文团队才想:能不能搞一个模型,不用改架构,靠“指令”就能切换这三个任务?GPA(General-Purpose Audio)就是这么来的。

02、GPA的核心创新:四个“狠活”,解决“分家”问题

GPA能做到“一个模型干三活”,全靠四个关键设计,每一个都戳中了传统模型的痛点,先看整体架构图:

1. 创新1:纯自回归架构+共享token空间,不用改架构就能切任务

GPA没搞花里胡哨的混合模块,而是基于 Qwen3 LLM 做“骨架”,把TTS、ASR、VC全变成“序列生成问题”——核心是靠“共享的离散audio token空间”,就像大家都用同一种语言交流,模型不用“学三种方言”。
为了让这个“语言”又准又全,语音部分搞了个双Tokenizer方案 :
  • BiCodec Tokenizer:负责抓语音的“声学特征”和“内在语义”,比如说话的调子、快慢、音色;
  • GLM Tokenizer:从ASR模型来的,专门抓“和文本对齐的语言学语义”,比如哪个声音对应“你好”,哪个对应“吃饭”,避免模型生成的语音“听不懂”。
俩Tokenizer互补,既保证语音“好听”,又保证和文字“对得上”。切换任务也简单:靠“输入输出的token组合”,比如ASR是“输入音频token→输出文本token”,TTS是“输入文本token+说话人属性→输出音频token”,不用加任何专属模块,像“换频道”一样方便。
2. 创新2:多任务联合训练,三个任务互相“带飞”
传统模型是“分开训”:先训一个ASR,再训一个TTS,互相不干涉。GPA是“放一起训”,用的是 Emilia公开数据集+团队自己的私有数据 ,分两阶段:
  • 预训练:用100万小时语音数据,覆盖多说话人、多场景、多语言,让模型先学“声音和语义的基本对应”,不针对任何单个任务;
  • 微调:用20万小时专门数据,针对TTS/ASR/VC调优,比如给TTS加“说话人标签”,给ASR加“精准文本标签”。
这么训的好处太明显了:
  • ASR帮模型“锚定语义”,让模型知道“这个声音对应这个词”,避免TTS生成“听不懂的话”;
  • TTS和VC帮模型“保留声学细节”,让合成/变声的声音“像真人”,避免ASR只认文字不管“听感”;
  • 三个任务一起训,还能互相“纠错”,减少过拟合——比如ASR防止模型只关注音色忽略内容,TTS防止模型只认文字不管节奏,泛化性更好。
3. 创新3:流式效率高,部署起来不费劲
GPA用的是“纯自回归”设计,不像传统混合架构要分“编码器→解码器→后处理”多步,所以特别适合“流式场景”——比如实时语音转文字、实时合成语音,不用等整个音频/文本处理完,生成一点就输出一点。
部署也方便:能直接对接标准LLM推理框架,不管是云端服务器还是手机这种边缘设备,都能无缝用,并发高的时候吞吐量也比传统模型好。
4. 创新4:模型搞“家族化”,从手机到云端都能装
团队没搞“一刀切”,而是做了不同参数的GPA模型,适配不同场景:
  • GPA-0.3B:超轻量,只有0.3B参数,专门给手机、嵌入式设备这种“内存小、算力弱”的场景用,能跑多任务还不占地方;
  • GPA-3B:大参数版本,3B参数,追求性能上限,适合云端服务(比如大规模语音合成、企业级ASR)。

03、实验咋做的?细节拉满,保证结果靠谱

实验部分特别严谨,从数据处理到训练流程都没糊弄,一步步说:
1. 训练流程:从头训,避免“偏见”
团队没复用任何预训练的语音/文本模型权重,而是“从头开始训”——这样能保证模型的行为全靠“输入输出的token组合”,不是靠其他模型的“旧经验”带偏。流程分两步:
  • 预训练:100万小时数据,覆盖多说话人、多场景(比如安静办公室、嘈杂街道)、多语言(中英文为主),让模型先“打好基础”;
  • 微调:20万小时针对性数据,比如TTS加“说话人+文本”对,ASR加“音频+精准文本”对,VC加“源音频+参考音频”对,优化每个任务的精度。
2. 数据处理:把“脏数据”变“干净数据”,不然训歪了
语音数据最容易有噪音、说话人混乱、文本标签错这些问题,团队做了四步“清洁”:
  • 音频归一化+去噪:把所有音频归一化,避免有的声音大有的小;还用自己训的去噪模型,去掉回声、背景说话声这些干扰;
  • 说话人分割:用VAD+话者分离工具,把一段音频里“张三说的”、“李四说的”拆开,删掉有交叉说话、非语音(比如咳嗽、关门声)的部分,还过滤掉“说一半被截断”的句子;
  • 高置信度转录:找了好几个ASR模型(Faster-Whisper Large-V3、Canary-1B这些)一起给音频转文字,然后算它们之间的“平均 pairwise WER”(pWER,就是互相之间的词错误率),只有pWER<15%(也就是大家意见特别一致)的文本才留用,避免标签错;
  • 韵律对齐标点:用Montreal Forced Aligner强制对齐,根据说话的停顿加标点——比如300ms以上的停顿加逗号,50ms以内的流畅片段删掉多余标点,让文字和说话的节奏匹配,TTS合成时更自然。

04、实验结果:GPA到底行不行?看图表说话

结果分两部分:一是“部署性能”(延迟、吞吐量),二是“任务精度”(TTS、ASR)——VC没单独做表,因为它的评估指标(可懂度、说话人相似度)和TTS一样,只是输入输出token不同,不用重复测。
1. 部署性能:流式场景扛得住,边缘设备也能用
重点看 TTS流式基准和ASR流式延迟,测的都是GPA-0.3B在不同“并发请求”下的表现:
  • TTS的表现
    • TTFC(Time-to-First-Chunk):生成第一块音频的时间,越短用户等得越久
    • RTF(Real-Time Factor):生成音频的时间÷音频本身的时长,说明生成比实时快(比如RTF0.2,生成10秒音频只花2秒)。
结果如下:

  • 并发1的时候:TTFC才258.8ms(不到0.3秒),RTF0.197,生成6.44秒的音频实际只花1.27秒,特别快;
  • 并发160的时候:TTFC涨到9847.9ms(不到10秒),RTF1.718(生成6.44秒音频花11秒)——虽然负载高了延迟涨,但还在“能接受”的范围,比如实时语音助手用着不卡。
  • ASR的表现
看两个指标:
    • TTFT(Time-to-First-Token):输出第一个文字token的时间,越短“实时感”越强;
    • 总延迟:从输入音频到输出完整文本的时间。
结果如下:


  • 并发1的时候:TTFT157.5ms(0.16秒),总延迟190.9ms(0.2秒),差不多“说完就出字”;
  • 并发160的时候:TTFT5037ms(5秒),总延迟5044ms(5秒)——对于实时会议转写、语音输入,这个速度够用。
2. 任务精度:小模型能打,大模型更强
重点看TTS精度和ASR精度,对比了GPA和其他专门模型的表现:
  • TTS精度(分“多阶段模型”和“单阶段AR模型”比) :
指标是CER和 Speaker Similarity 。
结果如下:

  • 小模型GPA-0.3B(0.3B参数):中文Seed-zh数据集CER0.95%,比同参数的F5-TTS(1.52%)好太多;相似度65.9%,和同类型的Spark TTS(66%)差不多——作为边缘模型,能打成这样很牛;
  • 大模型GPA-3B(3B参数):中文CER0.84%,英文Seed-en的WER(词错误率)1.31%,相似度73%——虽然比专门的Seed-TTS(相似度79.6%)差一点,但GPA能同时干ASR/VC,已经很能打了。
  • ASR精度(按模型参数分“<0.5B”和“≥0.5B”比):
指标是WER(词错误率,英文用)和CER(字符错误率,中文用)。
结果如下:

  • 小模型GPA-0.3B:Librispeech英文数据集WER8.88%,比同参数的Whisper-S(3.13%)差——论文认为不是架构问题,是参数少容量不够,装不下太多“语音知识”;
  • 大模型GPA-3B:Librispeech WER2.52%,中文AISHELL-1数据集CER1.93%——虽然不如专门的Fun-ASR-nano(WER1.76%),但GPA是3B参数,比Fun-ASR的7.7B小很多,还能同时干TTS/VC,性价比很高。

05、总结:GPA的亮点和小遗憾

亮点
  • 第一次用纯自回归架构把TTS/ASR/VC整合成一个模型,不用改架构靠指令切换;
  • 做了轻量版,边缘设备能跑;
  • 实验证明它在同参数下比很多专门模型强,部署起来还方便——特别适合需要多语音功能的场景(比如智能音箱、实时翻译)。
小遗憾
  • 共享token空间有瓶颈,比起专门为单个任务设计的模型(比如Seed-TTS),GPA的峰值性能还是差点;
  • 长语音推理时,延迟会跟着token长度涨;0.3B的ASR性能偏弱,得靠增大参数改进。
未来方向
  • 打算用强化学习优化,因为GPA的“next-token预测”目标很明确,能直接针对“语音质量”、“指令跟随”这些指标调优,潜力还很大。
总的来说,GPA不是要把每个任务做到“天下第一”,而是靠“统一架构”解决实际部署中的“碎片化”痛点——这才是它最有价值的地方,也给语音基础模型指了个新方向。

06、开源状态

相关代码已经开源:


还有对应的进展和路线图:

感兴趣的同学关注一波。