Fish Speech
基于 VQ-GAN 和语言模型的 TTS 框架,最新 S2 Pro 版本拥有 4B 参数,支持 80+ 种语言,覆盖 1000 万小时训练数据。
80+ languages
多语言高质量实时语音克隆零样本S2 Pro
Fish Speech 是 Fish Audio 团队推出的新一代开源 TTS 框架,融合了 VQ-GAN 离散化编码与自回归语言模型的强大生成能力。VQ-GAN 将连续语音信号压缩为离散 token 序列,再交给 LLM 进行自回归预测,最后通过解码器恢复为高质量音频。这种 “音频 token 化 + 语言模型” 的路径,赋予了模型极强的泛化能力和多语言适应性。模型原生覆盖 80+ 种语言,且能够通过少量参考音频完成高质量的零样本语音克隆,在消费级 GPU 上即可实现接近实时的推理速度。
2025 年,Fish Audio 推出了重大升级 Fish Speech S2 Pro。S2 Pro 拥有 4B 参数,基于 1000 万小时多语言训练数据构建,在多项基准测试中达到业界领先水平——在跨语言语音克隆的自然度和音色相似度上显著超越前代模型与同类竞品。S2 Pro 支持 80+ 种语言,覆盖范围从主流语言扩展至小语种和方言,进一步巩固了 Fish Speech 在多语言 TTS 领域的领先地位。模型权重采用 Fish Audio Research License,需注意其使用条款与 Apache 2.0 有所不同。
Fish Speech 提供了 Hugging Face Space 在线演示和本地一键部署方案,配合活跃的 Discord 社区和完善的 WebUI 界面,极大地降低了开源 TTS 技术的使用门槛。目前 GitHub Stars 超过 2 万,社区活跃度持续高涨。
标签:多语言高质量实时语音克隆零样本S2 Pro
分享:X