近几年 TTS 发展极快,而我的技术直觉还停留在 FastSpeech 阶段。最近项目重新需要用到 TTS,我便选取了一些近期在资料、仓库和讨论中反复出现,且本地相对容易接入的模型,做了一次面向实际使用的梳理和评测。
需要说明的是,这不是传统 MOS 测试,也不试图给出学术 Benchmark 式结论。我更关心工程使用中会反复遇到的问题:
中文断句是否合理
专有名词读法是否准确
中英混读是否自然
数字和符号处理是否完整
情绪表达是否克制恰当
长文本是否截断、漏段或乱序
推理成本与显存占用
因此,本文的评分带有明确的任务偏好,难免有失偏颇,更适合作为一次个人视角的选型记录,而不是通用排行榜。最终进入 No-prompt 纯文本 TTS 核心横评的 6 个模型:
CosyVoice·GLM-TTS·MAGIC-TTS·OmniVoice·Qwen3-TTS·VoxCPM2
其余模型定位:Kimi-Audio/VibeVoice属语音基础模型/长音频方向,暂不可比;NaturalSpeech 3本地仍为占位。
01 模型分组与核心特点
02 核心技术对比
模型 架构类型 情感控制 Zero-shot 关键功能 CosyVoice Codec + LLM ✅ ✅ 情绪/风格控制 Qwen3-TTS LLM-based Codec ✅ ✅ 多语言 VoiceDesign、流式生成 Kimi-Audio 多模态 LLM - - 音频理解 + ASR GLM-TTS LLM + Flow ✅ ✅ 音素级控制、流式 OmniVoice Diffusion LM ✅ ✅ 600+ 语言、批量推理 NaturalSpeech 3 Diffusion + Latent ✅ ✅ 因子化解编解码 MAGIC-TTS Flow Matching ✅ 待验证 停顿/时长控制
03 数据透明度与开源等级
数据透明度(T0-T4):T4 为最高(来源/规模/流程全公开)
开源完整度(O0-O4):O4 为最高(代码/权重/脚本齐全)
04 训练过程与推理成本
三条技术路线简析:
1、Codec LM(CosyVoice / Qwen3 / GLM):
路线: 波形 → 离散 Token → LM 预训练 → 多说话人训练 → Instruction Tuning
验证重点:流式延迟、控制粒度、音色稳定性
2、Diffusion/Flow(NaturalSpeech 3 / MAGIC-TTS):
路线:学习连续隐空间 → 条件生成训练 → Reference Conditionin
验证重点:自然度、音色细节、推理成本
3、Speech Agent(Kimi-Audio / VibeVoice):
Audio-Text 多模态预训练 → Dialogue Alignment
验证重点:语音助手体验、长音频理解
本地评测硬件环境
RTF(实时率):生成耗时 / 音频时长,越低越好
CER(字符错误率):ASR 转写 vs 原文
峰值显存:运行期间 GPU 显存采样峰值
06 评测方法与样本设计
No-prompt 设置:模型仅输入正文text,考验"裸读"能力,而非显式指令跟随。
Core 样本集(31 条)
07 No-prompt Core 实测结果
运行完成情况,全部186 条(6 模型 × 31 样本)成功率 100%。
RTF 与显存实测
人工听测汇总(0-5 任务完成度)
各样本目标不同(P 看断句、E 看情绪克制、TN 看信息完整性),分数只在同一能力组内横向比较。
1、韵律/停顿
08 关键结论
1、普通场景主观结论
参考文献:
[1]. Zhihao Du et al.CosyVoice 3. arXiv:2505.17589, 2025.
[2]. Hangrui Hu et al.Qwen3-TTS. arXiv:2601.15621, 2026.
[3]. Jiayan Cui et al.GLM-TTS. arXiv:2512.14291, 2025.
[4]. Kimi Team et al.Kimi-Audio. arXiv:2504.18425, 2025.
[5]. Zhiliang Peng et al.VibeVoice. arXiv:2508.19205, 2025.
[6]. Zhiliang Peng et al.VIBEVOICE-ASR. arXiv:2601.18184, 2026.
[7]. Han Zhu et al.OmniVoice. arXiv:2604.00688, 2026.
[8]. Zeqian Ju et al.NaturalSpeech 3. arXiv:2403.03100, 2024.
[9]. Jialong Mai et al.MAGIC-TTS. arXiv:2604.21164, 2026.
[10]. Yixuan Zhou et al.VoxCPM2. arXiv:2606.06928, 2026.
