TTS 开源项目
汇集 GitHub 上优秀的 TTS 开源项目,持续更新。
Bark
Suno AI 开源的 Transformer 文本转音频模型,不仅能合成语音,还能生成笑声、叹息、音乐和背景音效。
ChatTTS
专为对话场景设计的 TTS 模型,支持细粒度韵律控制和多说话人,2026 年 4 月持续更新。
Coqui TTS
知名端到端 TTS 框架,提供 XTTS 多语言语音克隆能力,支持模型训练与微调,社区生态丰富。
CosyVoice
阿里通义实验室开源的流式 TTS 大模型,CosyVoice 2 中文 MOS 4.7 登顶评测,支持方言和指令控制。
F5-TTS
基于 Flow Matching 的新一代非自回归 TTS 模型,推理速度极快,音质出色。
Fish Speech
基于 VQ-GAN 和语言模型的 TTS 框架,最新 S2 Pro 版本拥有 4B 参数,支持 80+ 种语言,覆盖 1000 万小时训练数据。
GPT-SoVITS
少样本语音克隆的里程碑项目,融合 GPT 和 SoVITS 架构,仅需 1 分钟音频即可克隆语音。
Kokoro-82M
仅 82M 参数的高性能多语言 TTS 模型,Apache 2.0 可商用,4GB VRAM 即可运行。
MeloTTS
MyShell 开源的轻量级中文 TTS 模型,支持 CPU 实时推理,特别适合端侧部署。
OpenVoice
MyShell 开源的语音克隆框架,支持细粒度的音色和风格控制,只需短音频即可克隆。
Qwen3-TTS
阿里通义 Qwen 团队开源的多语言语音合成系列模型,支持语音克隆、声音设计、流式生成和自然语言指令控制。
Spark-TTS
港科大与出门问问联合开发的轻量级零样本语音克隆模型,基于 Qwen2.5 架构,仅 0.5B 参数即可实现高质量语音合成。
VibeVoice
微软开源的项目,最初为 1.5B 长音频 TTS 模型。2025 年 9 月起 TTS 训练/推理代码已移除,项目转向 ASR 与语音处理。
VITS
经典的端到端 TTS 模型,单阶段 VAE 架构,直接文本到波形输出,是后续众多 TTS 项目的基础。
VoxCPM2
OpenBMB 推出的 VoxCPM2 无分词器语音合成模型,2B 参数,支持 30 种语言和 8 大方言,48kHz 录音棚级音质输出,具备语音编辑与声音设计能力。