分享一款开源 TTS 模型:NeuTTS Air,它是一款免费、开源、轻量级的超逼真语音合成模型。
仅 0.5B 参数,但实际体验几乎媲美市面上许多商用 TTS 引擎。更关键的是,它能在手机、笔记本甚至树莓派这样的低功耗设备上流畅运行,真正把 AI 语音合成从云端拉到了我们身边。
基于Qwen 0.5B LLM构建,自带数字水印,端侧TTS声音听起来没有生硬感,语气和节奏相对自然。生成的语音媲美真人,支持仅用3秒音频就能完成声音克隆。
项目地址:https://github.com/neuphonic/neutts-air
核心亮点
超逼真语音合成:产生自然、超现实的声音,听起来像人类的声音。
即时声音克隆:只需 3 秒音频参考,即可快速定制专属语音。
完全本地运行:无需网络,保护隐私,支持手机/树莓派低功耗运行。
轻量高效:0.5B参数,实时生成,中等设备流畅。
内置安全:数字水印嵌入输出,责任追溯,降低滥用风险。
实时性能:针对中端硬件优化,响应迅速的用户体验。
这几个特性结合起来,让它不仅仅是一款 TTS,更是一种可随身携带的语音引擎。
快速入手
NeuTTS Air 的上手难度很低,基本只需要几个步骤:1、克隆项目:
git clone https://github.com/neuphonic/neutts-air.git
cd neutts-air 2、安装依赖(需要 espeak):
# Mac OS
brew install espeak
# Ubuntu/Debian
sudo apt install espeak 其中 Mac 用户可能需要将以下几行放在 neutts.py 文件的顶部。
from phonemizer.backend.espeak.wrapper import EspeakWrapper
_ESPEAK_LIBRARY = '/opt/homebrew/Cellar/espeak/1.48.04_1/lib/libespeak.1.1.48.dylib' #use the Path to the library.
EspeakWrapper.set_library(_ESPEAK_LIBRARY) Windows 用户可能需要运行:
$env:PHONEMIZER_ESPEAK_LIBRARY = "c:\Program Files\eSpeak NG\libespeak-ng.dll"
$env:PHONEMIZER_ESPEAK_PATH = "c:\Program Files\eSpeak NG"
setx PHONEMIZER_ESPEAK_LIBRARY "c:\Program Files\eSpeak NG\libespeak-ng.dll"
setx PHONEMIZER_ESPEAK_PATH "c:\Program Files\eSpeak NG" 3、安装Python依赖
pip install -r requirements.txt
pip install llama-cpp-python #(可选)
pip install onnxruntime #(可选) 4、运行示例,合成语音
python -m examples.basic_example \
--input_text "My name is Dave, and um, I'm from London" \
--ref_audio samples/dave.wav \
--ref_text samples/dave.txt 代码用法:
from neuttsair.neutts import NeuTTSAir
import soundfile as sf
tts = NeuTTSAir(
backbone_repo="neuphonic/neutts-air", # or 'neutts-air-q4-gguf' with llama-cpp-python installed
backbone_device="cpu",
codec_repo="neuphonic/neucodec",
codec_device="cpu"
)
input_text = "My name is Dave, and um, I'm from London."
ref_text = "samples/dave.txt"
ref_audio_path = "samples/dave.wav"
ref_text = open(ref_text, "r").read().strip()
ref_codes = tts.encode_reference(ref_audio_path)
wav = tts.infer(input_text, ref_codes, ref_text)
sf.write("test.wav", wav, 24000) 如果需要克隆需要两个参数:参考音频样本(.wav文件)及文本字符串。然后该模型会将文本合成为参考音频风格的语音。这便是 NeuTTS Air 即时语音克隆功能的原理。
应用场景
AI 语音助手:在手机或电脑上跑一个本地语音助手,完全用自然语音和你交互,不依赖任何云端服务。 个性化配音工具:视频博主可以快速生成解说音频,还能克隆成自己的声音,保持统一的品牌风格。 实时翻译配音:结合翻译模型,可以做到“边听边翻译边用真人声音说出来”,应用于跨语言交流。 游戏与虚拟角色语音:在游戏中给 NPC 添加更自然的对话声音,甚至克隆玩家自己的声音用于角色扮演。 无障碍应用:为视障人士提供即时的本地语音阅读,完全离线运行,更安全可靠。
写在最后
过去开源 TTS 常常停顿僵硬、韵律不顺畅。但 NeuTTS Air 的语音合成加入了更细腻的节奏处理,听上去就像一个人真正地在思考后开口。
而且它的完全本地运行和内置水印特性,不论对内对外都非常安全。
轻量化、本地化、个性化 —— 这是我认为的未来方向。
它不仅仅在技术上做到了轻量化,还在安全性(本地 + 水印)和易用性(简单部署)上给出了完整方案。
对个人开发者而言,它是一个低门槛进入 AI 语音的工具;对企业应用来说,它是一个可扩展、安全的语音引擎。
如果你和我一样,对语音交互、智能助手或者个性化配音感兴趣,那我强烈推荐你动手试试 NeuTTS Air。
GitHub 项目地址:https://github.com/neuphonic/neutts-air
