F5-TTS是一款基于流匹配的全非自回归文本到语音转换系统,由上海交通大学、剑桥大学和吉利汽车研究院的研究团队联合开发。该系统无需复杂设计,如持续时间模型、文本编码器和音素对齐,能够实现快速训练,并达到RTF(实时因素)0.15的推理速度,明显优于当前基于扩散的TTS模型。

F5-TTS在公共的100K小时多语言数据集上进行训练,展现出高自然性和表现力的零样本能力、无缝代码切换能力和速度控制效率。项目提出了一种推理时的摇摆采样策略,显著提高了模型的性能和效率。


论文:https://arxiv.org/abs/2410.06885

模型下载:https://huggingface.co/SWivid/F5-TTS

Demo:https://huggingface.co/spaces/mrfakename/E2-F5-TTS

项目地址:https://github.com/SWivid/F5-TTS


模型特点
  • 零样本 (Zero-shot) 声音克隆
  • 速度控制(基于总时长)
  • 可以控制合成语音的情感表现
  • 长文本合成
  • 支持中文和英文多语言合成
  • 在 10 万小时数据上训练
  • 最重要的是支持商用


技术优势

F5-TTS 独特的架构使得它与传统 TTS 系统相比更具优势:
  • 并行处理:不像传统系统那样依赖逐步生成语音,F5-TTS 能够同时处理多个步骤,从而显著加快了生成速度。
  • 多场景支持:无论是智能助手、在线教育、语音阅读器,还是其他需要 TTS 支持的场景,F5-TTS 都能够提供自然流畅的语音输出。
  • 大规模数据训练:F5-TTS 在超过 100K 小时的多语言数据集上进行训练,这让它能够在不同语言和语境下提供卓越的语音生成能力。


DEMO

使用方法

1、自定义本地部署服务

本地部署,需要保证GPU资源(算力)充足及Python环境。

  • 克隆项目

git clone https://github.com/SWivid/F5-TTS.git
cd F5-TTS
  • 安装项目依赖包

pip install -r requirements.txt
  • 安装合适的CUDA包(英伟达显卡必须)

pip install torch==2.3.0+cu118 --extra-index-url https://download.pytorch.org/whl/cu118
pip install torchaudio==2.3.0+cu118 --extra-index-url https://download.pytorch.org/whl/cu118
  • 准备数据集并训练、推理、运行项目

python gradio_app.py

2、在线使用

通过官网直接体验其多语言语音生成和速度、情感控制功能。


  • 上传原始音色音频,最好是说话的音频,也可以录制自己的声音上传。

  • 然后输入需要转成语音的文本。

  • 同步生成,最后就可生成带预期音色的音频了。


总结

F5-TTS 是继Chat-TTS后有一款强大的TTS开源工具,尤其是在多语言处理、情感表达和语音生成速度上都实现了突破。