跳到主要内容

Qwen3-TTS

GitHub ⭐ 12294许可:Apache 2.0模型类型:Multilingual TTS / Voice Cloning

阿里通义 Qwen 团队开源的多语言语音合成系列模型,支持语音克隆、声音设计、流式生成和自然语言指令控制。

ChineseEnglishJapaneseKoreanFrenchGermanSpanishPortugueseRussianItalian
Qwen阿里多语言语音克隆推荐

Qwen3-TTS 是阿里云通义实验室 Qwen 团队开源的新一代多语言语音合成(TTS)模型系列,于 2026 年 1 月正式发布。模型采用创新的离散多码本语言模型(Discrete Multi-codebook LM)架构,基于自研的 Qwen3-TTS-Tokenizer-12Hz 实现高效的声学压缩与高维语义建模。系列提供 0.6B1.7B 两种参数规模的模型,包含 CustomVoice(定制语音)、VoiceDesign(声音设计)和 Base(语音克隆与微调)多个版本,全面覆盖从轻量部署到高质量合成的不同场景需求。

Qwen3-TTS 在功能完备性上树立了开源 TTS 的新标杆。语音克隆——Base 模型仅需 3 秒参考音频即可精准复刻说话人音色,支持跨语言克隆和说话人嵌入复用;声音设计——VoiceDesign 模型支持通过自然语言描述自定义声音风格(如“撒娇稚嫩的萝莉女声”),实现“所想即所听”的创意语音生成;流式合成——基于 Dual-Track 混合流式架构,端到端合成延迟最低仅 97ms,首个音频包可在单个字符输入后即刻输出,满足实时对话场景的严苛要求;指令控制——支持通过自然语言指令灵活控制音色、情感、语速和韵律,模型深度理解文本语义并自适应调整表达方式。

Qwen3-TTS 支持 10 种主流语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语,同时提供多种方言音色配置以满足全球化应用需求。模型基于 Apache 2.0 协议开源,提供完整的 Python 包(qwen-tts)、WebUI 演示和 DashScope API 服务,并已获得 vLLM-Omni 的官方 Day-0 支持。项目在 GitHub 上已获得超过 1.2 万星标,可广泛应用于智能语音助手、有声内容创作、虚拟数字人、跨语言配音和实时语音交互等场景。

标签:Qwen阿里多语言语音克隆推荐
分享:X