Cartesia 发布 Sonic-3.6 TTS 模型,重点提升 44 种语言下的语音自然度,并称这是其目前最逼真的 TTS 版本。
相比三个月前发布的 Sonic-3.5,新版本根据开发团队反馈进行了底层模型改进,并在 Artificial Analysis 的 Provider Voice Streaming 和 Controlled Voice Streaming 两项榜单中均排名第一。
此外,在 Voice of India 的印地语 General TTS 榜单中,上一代 Sonic-3.5 当前排名第 3,Bradley-Terry Elo 为 1072,Win Rate 为 59%。目前 Sonic-3.6 已开放 Beta 测试。


核心能力
1. 拟人化自然度
Sonic 3.6 能生成自然的停顿和填充词(filler words),并支持笑声与情绪表达。官方演示中,英文语音带有真人对话般的呼吸感和节奏变化。
2. 跨语言混读(Code-Switching)
支持 40+ 语言(英语、印地语、西班牙语、法语、德语、日语等),官方重点演示了 Hinglish 场景:印地语和英语在同一段话内无缝切换,无需任何标注。
3. 生成速度
每秒生成 136.1 个字符,约为 ElevenLabs Eleven v3(46.7 字符/秒)的 3 倍、Google Gemini 3.1 Flash TTS(24.2 字符/秒)的 5.6 倍。Sonic 系列的实时流式首包延迟在 90ms 以内(Turbo 变体约 40ms),面向语音 Agent 场景设计。
快速上手(云端 API)
1. 获取 API Key
到 play.cartesia.ai 注册,在控制台生成 API Key。免费层即可试用。
2. 安装 SDK
pip install cartesia
# WebSocket 流式支持
pip install 'cartesia[websockets]'3. 最小可用示例(WebSocket 流式)
import os
from cartesia import Cartesia
client = Cartesia(api_key=os.getenv("CARTESIA_API_KEY"))
with client.tts.websocket_connect() as ws:
ctx = ws.context(
model_id="sonic-3.6", # Beta;生产可用 "sonic-3.5"
voice={"mode": "id",
"id": "6ccbfb76-1fc6-48f7-b71d-91ac6298247b"},
output_format={
"container": "raw",
"encoding": "pcm_f32le",
"sample_rate": 44100,
},
language="zh",
)
# 边生成边推送文本(适合接 LLM 输出流)
for part in ["你好,", "我是 Sonic 3.6,",
"目前最先进的语音合成模型。"]:
ctx.push(part)
ctx.no_more_inputs()
withopen("output.pcm", "wb") as f:
for response in ctx.receive():
if response.type == "chunk"and response.audio:
f.write(response.audio)
elif response.type == "done":
break关键参数说明:
4. 语音 Agent 集成
Sonic 已内置进主流实时语音框架,配置 model_id 即可切换:
LiveKit Agents
livekit.plugins.cartesia.TTS(model="sonic-3.6", ...)
Pipecat
CartesiaTTSService(model="sonic-3.6", ...)
Twilio/电话
输出格式选 pcm_mulaw + 8000Hz
相关链接
测试链接:https://www.cartesia.ai/sonic
Voice of india:https://voiceofindia.ai/leaderboards
