标题:Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

链接:https://arxiv.org/pdf/2511.21270

作者单位:腾讯

发布日期:2025年12月1日

这篇论文主要解决单码本 TTS LLMs(文本转语音大语言模型)的痛点——比如韵律不稳定、说话人音色漂移、生成语音自然度差这些问题,提出了一个“多奖励 GRPO”框架,用强化学习直接优化模型的 token 生成策略,效果还挺明显。咱们按论文的结构,一步步说清楚~

01、背景与问题(引言部分)

现在 TTS 领域很流行用 LLMs 做自回归生成,把语音变成离散的 codec token 来处理。其中“单码本 TTS LLMs”因为结构紧凑、能直接流式生成,还能同时建模语义和声学信息,算是个热门方向。但它有个大问题:统一建模后,生成策略容易出问题——要么读得没节奏(韵律乱),要么说话人音色变来变去(漂移),有时生成的语音还不自然。
之前也有人用强化学习(RL)优化,但要么依赖大量“偏好标签”(比如让标注者选哪个语音更好),成本高还难扩展;要么像 DiffRO 这种可微分奖励框架,对噪声敏感。而这篇用的 GRPO(Group Relative Policy Optimization)方法,优势是能通过“分组优势归一化”稳定训练,还不用密集的偏好标签,刚好能解决之前的痛点。

02、核心方法:多奖励 GRPO 框架

整个框架的思路很简单:以单码本 TTS LLM 为基础策略,用 GRPO 优化它,关键是设计了5个“互补奖励”,覆盖语音质量、长度、稳定性、韵律等维度。

咱们逐个说:
2.1 整体目标
优化的目标是让生成轨迹(从输入到输出的 token 序列)的“累计奖励”最大,公式就是求期望下的奖励和,这里不用纠结公式细节,知道是最大化整体质量就行。
2.2 基础奖励:保证“能听懂”和“音色对”
  • 可懂度奖励(Rintl) :确保生成的语音能听懂,和输入文本匹配。用预训练的 Whisper ASR 模型把生成语音转成文字,再算“字符错误率(CER)”或“词错误率(WER)”——错误率越低,这个奖励越高。
  • 说话人相似度奖励(Rsim) :保证生成语音的音色和参考说话人一致。用微调过的 WavLM-large 模型提“说话人 embedding”(可以理解成音色特征),然后算生成语音和参考语音 embedding 的“余弦相似度”——越像,奖励越高。
2.3 解决“生成长短失控”:长度惩罚奖励(Rlen)
单码本 TTS 常出现“没说完就停”或“拖太长”的问题。这个奖励会先根据参考文本长度和参考语速,定一个“目标时长”,再设个容忍范围(比如±10%):如果生成语音的时长在范围内,奖励正常;超出就扣分,这样就能稳定生成长度,避免截断或拉长。
2.4 解决“解码不稳定”:熵正则奖励(Rent)
生成 token 时,如果“熵”太高(可以理解成模型对下一个 token 选什么太犹豫,随机性太强),语音就会忽快忽慢、韵律乱。这个奖励会先从高质量样本里定一个“目标熵”,如果生成时的平均熵离目标太远(太高或太低)就扣分,鼓励模型生成更平稳的 token 序列。
2.5 核心创新:LLM 标注的韵律对齐奖励(Rpro)
这是最关键的创新点,专门解决“韵律不自然”的问题,分两步走:
  • 离线标注 :用一个推理型 LLM(比如 DeepSeek-R1)给输入文本标“停顿结构”——中文用#1-#4表示不同长度的停顿(#1短,#4长),英文用“韵律词(PW)”和“韵律短语(PPH)”标注,相当于让 LLM 教模型“该在哪停、停多久”,贴合人类说话习惯。
  • 在线对比 :训练时,先把模型生成的音频用 Whisper 解析出停顿时间,再转成和标注对应的“停顿符号”,如果和 LLM 标注的某一个结构匹配,就给1分,不匹配给0分。这样模型就会主动学习“自然的停顿节奏”。

03、实验部分:怎么测、结果怎么样

实验做得很细致,从配置到对比、消融都有,咱们挑重点说:
3.1 先交代实验配置(保证结果可信)
  • 硬件 :8张 H20 GPU,用混合精度训练;
  • GRPO 参数 :batch size 16,学习率 1e-6,分组大小 12;
  • 解码配置 :用 vLLM 加速,top-k=75,top-p=0.9,温度=1.1,重复惩罚=1.1(这些是控制生成多样性的参数);
  • 数据集 :中英双语,从 Emilia 和 libriheavy 选的——100万条文本、100万条语音,中英各占一半,总音频时长约 5115 小时。
3.2 主要结果:比很多开源模型都好(表1)

实验在 SEED 基准数据集上测,对比了一大堆主流模型(比如 Seed-TTS、FireRedTTS、CosyVoice 系列,还有自己的 LLaSA 基线模型),重点看“LLaSA+RL”(加了本文框架的模型)的表现:
  • 中文测试集(test-zh):CER 从基线的 1.59 降到 1.10(错误率少了近30%),说话人相似度(SIM)从 0.684 升到 0.758;
  • 英文测试集(test-en):WER 从 2.97 降到 2.12,SIM 从 0.574 升到 0.672;
  • 难例集(test-hard):CER 直接从 11.09 砍到 6.04,说明复杂场景下更稳定;
  • 主观评分(MOS,满分5):LLaSA+RL 拿到 4.12,比 CosyVoice3(数据量是本文的4倍,100万小时 vs 25万小时)还高,甚至加了“Flow Matching(FM,一种声学优化模块)”后,MOS 冲到 4.21,CER 再降0.02——这说明咱们的 RL 是优化了核心的 AR 生成策略,和后续的声学优化能互补,不是重复劳动。
3.3 可扩展性:模型越大、数据越多,效果越好(图2)

他们还测了不同模型规模(1B、3B、8B 参数)和不同数据量(1K 到 100万条样本)的效果,图2能看明白两个趋势:
  • 模型规模:同样数据量下,8B 模型的 CER 比 1B 低一大截,SIM 高很多——模型越大,越能捕捉韵律和音色细节;
  • 数据量:同样模型规模下,从 1K 样本涨到 100万样本,CER 一路下降,SIM 一路上升;哪怕只用 1万条样本做 RL,效果也比纯监督训练(SFT)好——说明这个框架的数据效率很高,不用海量数据也能出效果。
3.4 消融实验:每个奖励都有用,韵律奖励最关键(表2)

为了看每个奖励的作用,他们做了“逐步加奖励”的实验:
  1. 只加“可懂度+说话人相似”:CER 从 1.59 降到 1.31,MOS 3.77(比基线3.68好);
  2. 再加“长度惩罚”:CER 1.23,MOS 3.81(解决了长短问题,自然度略升);
  3. 再加“熵正则”:CER 1.12,MOS 4.01(解码稳定了,自然度跳涨);
  4. 最后加“韵律对齐奖励”:CER 1.10,MOS 4.12(所有指标到顶,尤其是 MOS 提升最明显)——这直接证明,“让 LLM 教停顿”这个创新点,是提升自然度的核心,没它还真不行。

04、结论

简单说,这篇论文的核心贡献就是:用 GRPO 强化学习,搭了个“多奖励”框架,专门治单码本 TTS LLMs 的“韵律乱、音色飘、长短失控”毛病;尤其是用 LLM 标韵律这个点子,让模型能学人类的说话节奏,效果又好又省数据。最后还证明了,这个框架能和后续的声学优化配合,不管模型大小、数据多少,都能稳定提升——算是给单码本 TTS 的工业化应用提供了个靠谱方案。