2026 TTS 开源爆发:开源模型全面逼近商业方案
声网 2026 年 5 月评测显示,CosyVoice 2、Kokoro-82M 等开源模型在中文场景 MOS 已接近 Azure TTS。
阅读原文 →TTS 领域最新动态、产品发布与行业热点。
声网 2026 年 5 月评测显示,CosyVoice 2、Kokoro-82M 等开源模型在中文场景 MOS 已接近 Azure TTS。
阅读原文 →Boson AI 开源 Higgs Audio V2,基于 1000 万小时训练,支持情感识别、零样本声音克隆和多角色对话。
阅读原文 →VoxCPM2 采用 Tokenizer-Free 架构,支持多语言语音生成和真实感语音克隆。
阅读原文 →微软发布 VibeVoice-1.5B,MIT 协议开源,支持最长 90 分钟连续语音生成和 4 说话人并发。
阅读原文 →阿里云通义实验室 Qwen 团队开源 Qwen3-TTS 系列模型,支持语音克隆、声音设计、流式合成和自然语言指令控制,覆盖 10 种语言。
阅读原文 →Kokoro-82M 以 82M 参数实现高质量多语言 TTS,Apache 2.0 协议,4GB VRAM 即可运行。
阅读原文 →香港科技大学与出门问问联合开源的零样本语音克隆模型 Spark-TTS,基于 Qwen2.5 架构,0.5B 参数即可实现高质量语音合成。
阅读原文 →阿里通义实验室 CosyVoice 2 在中文 TTS 评测中 MOS 达 4.7,支持粤语和上海话,Apache 2.0 开源。
阅读原文 →CosyVoice 2.0 在流式语音合成、零样本语音克隆和情感控制方面取得重大突破,已在 GitHub 上开源。
阅读原文 →Fish Speech 1.4 版本在多说话人音色一致性、中文韵律自然度和推理速度上均有显著提升。
阅读原文 →GPT-4o 实时语音模式支持端到端语音对话,延迟降低至 200ms 级别,标志着 AI 语音交互进入全新阶段。
阅读原文 →ChatTTS 在 GitHub 上持续获得大量关注,其对话式语音合成能力引领中文开源 TTS 发展。
阅读原文 →OpenAI 在 GPT-4o 中集成了原生 TTS 能力,支持多语言语音合成和情感表达,API 正式上线。
阅读原文 →