跳到主要内容

TTS 开源项目

汇集 GitHub 上优秀的 TTS 开源项目,持续更新。

Bark

Suno AI 开源的 Transformer 文本转音频模型,不仅能合成语音,还能生成笑声、叹息、音乐和背景音效。

2023年4月1日⭐ 37000

ChatTTS

专为对话场景设计的 TTS 模型,支持细粒度韵律控制和多说话人,2026 年 4 月持续更新。

2024年6月1日⭐ 34000

Coqui TTS

知名端到端 TTS 框架,提供 XTTS 多语言语音克隆能力,支持模型训练与微调,社区生态丰富。

2023年1月15日⭐ 2282

CosyVoice

阿里通义实验室开源的流式 TTS 大模型,CosyVoice 2 中文 MOS 4.7 登顶评测,支持方言和指令控制。

2024年7月1日⭐ 20000

F5-TTS

基于 Flow Matching 的新一代非自回归 TTS 模型,推理速度极快,音质出色。

2024年8月1日⭐ 12000

Fish Speech

基于 VQ-GAN 和语言模型的 TTS 框架,最新 S2 Pro 版本拥有 4B 参数,支持 80+ 种语言,覆盖 1000 万小时训练数据。

2024年4月1日⭐ 20000

GPT-SoVITS

少样本语音克隆的里程碑项目,融合 GPT 和 SoVITS 架构,仅需 1 分钟音频即可克隆语音。

2024年1月1日⭐ 40000

Kokoro-82M

仅 82M 参数的高性能多语言 TTS 模型,Apache 2.0 可商用,4GB VRAM 即可运行。

2025年11月20日⭐ 12000

MeloTTS

MyShell 开源的轻量级中文 TTS 模型,支持 CPU 实时推理,特别适合端侧部署。

2024年2月1日⭐ 6000

OpenVoice

MyShell 开源的语音克隆框架,支持细粒度的音色和风格控制,只需短音频即可克隆。

2023年11月1日⭐ 32000

Qwen3-TTS

阿里通义 Qwen 团队开源的多语言语音合成系列模型,支持语音克隆、声音设计、流式生成和自然语言指令控制。

2025年12月1日⭐ 12294

Spark-TTS

港科大与出门问问联合开发的轻量级零样本语音克隆模型,基于 Qwen2.5 架构,仅 0.5B 参数即可实现高质量语音合成。

2025年10月1日⭐ 11000

VibeVoice

微软开源的项目,最初为 1.5B 长音频 TTS 模型。2025 年 9 月起 TTS 训练/推理代码已移除,项目转向 ASR 与语音处理。

2026年1月20日⭐ 6200

VITS

经典的端到端 TTS 模型,单阶段 VAE 架构,直接文本到波形输出,是后续众多 TTS 项目的基础。

2021年6月1日⭐ 9000

VoxCPM2

OpenBMB 推出的 VoxCPM2 无分词器语音合成模型,2B 参数,支持 30 种语言和 8 大方言,48kHz 录音棚级音质输出,具备语音编辑与声音设计能力。

2026年3月1日⭐ 12000