跳到主要内容

Spark-TTS

GitHub ⭐ 11000许可:Apache 2.0模型类型:Zero-shot TTS / Voice Cloning

港科大与出门问问联合开发的轻量级零样本语音克隆模型,基于 Qwen2.5 架构,仅 0.5B 参数即可实现高质量语音合成。

ChineseEnglish
零样本语音克隆港科大推荐

Spark-TTS 是由香港科技大学(HKUST)与出门问问(Mobvoi)联合研发的高效文本转语音系统,合作机构还包括上海交通大学、南洋理工大学和西北工业大学。该项目由 SparkAudio 团队主导,论文发表于 arXiv(2503.01710)。Spark-TTS 完全基于 Qwen2.5 大语言模型构建,模型参数量仅为 0.5B,去除了传统 TTS 系统中常见的流匹配(flow matching)等额外生成模块,通过单流解耦语音令牌(Single-Stream Decoupled Speech Tokens)直接从 LLM 预测的编码重建音频,实现了极简高效的架构设计。

在功能方面,Spark-TTS 支持零样本语音克隆——仅需数秒参考音频即可精准复现目标说话人的音色,并能够处理跨语言和语码切换场景。模型同时支持中文和英语双语合成。此外,Spark-TTS 还提供了可控语音生成能力,用户可通过调节性别、音高和语速等参数创建虚拟说话人,无需任何参考音频。这种“语音创建”(Voice Creation)能力在内容创作和个性化语音助手等场景中具有独特的实用价值。

Spark-TTS 以 Apache 2.0 开源协议发布,在 GitHub 上已获得超过 11,000 颗星标。模型权重可在 Hugging Face(SparkAudio/Spark-TTS-0.5B)下载,项目同时提供了完整的推理代码、Gradio WebUI 以及 Nvidia Triton 推理服务部署方案。凭借轻量化设计、零样本克隆能力和宽松的开源许可,Spark-TTS 在学术研究、个性化语音合成、辅助技术和跨语言语音应用中展现出广阔的应用前景。

标签:零样本语音克隆港科大推荐
分享:X