跳到主要内容

行业资讯

TTS 领域最新动态、产品发布与行业热点。

2026年5月26日·声网

2026 TTS 开源爆发:开源模型全面逼近商业方案

声网 2026 年 5 月评测显示,CosyVoice 2、Kokoro-82M 等开源模型在中文场景 MOS 已接近 Azure TTS。

阅读原文 →
2026年3月15日·Boson AI

Higgs Audio V2 开源发布:李沐团队带来最强情感 TTS

Boson AI 开源 Higgs Audio V2,基于 1000 万小时训练,支持情感识别、零样本声音克隆和多角色对话。

阅读原文 →
2026年3月1日·OpenBMB

OpenBMB 发布 VoxCPM2:无分词器多语言语音合成

VoxCPM2 采用 Tokenizer-Free 架构,支持多语言语音生成和真实感语音克隆。

阅读原文 →
2026年1月20日·Microsoft Research

微软开源 VibeVoice-1.5B:单次生成 90 分钟长音频

微软发布 VibeVoice-1.5B,MIT 协议开源,支持最长 90 分钟连续语音生成和 4 说话人并发。

阅读原文 →
2025年12月1日·阿里通义实验室

阿里通义开源 Qwen3-TTS:多语言语音合成新标杆

阿里云通义实验室 Qwen 团队开源 Qwen3-TTS 系列模型,支持语音克隆、声音设计、流式合成和自然语言指令控制,覆盖 10 种语言。

阅读原文 →
2025年11月20日·hexgrad

Kokoro-82M:仅 82M 参数的极轻量开源 TTS 引擎

Kokoro-82M 以 82M 参数实现高质量多语言 TTS,Apache 2.0 协议,4GB VRAM 即可运行。

阅读原文 →
2025年10月1日·SparkAudio

Spark-TTS 开源发布:港科大与出门问问联合打造轻量级语音克隆模型

香港科技大学与出门问问联合开源的零样本语音克隆模型 Spark-TTS,基于 Qwen2.5 架构,0.5B 参数即可实现高质量语音合成。

阅读原文 →
2025年8月15日·阿里通义实验室

CosyVoice 2 中文 TTS 评测登顶:阿里通义开源模型持续进化

阿里通义实验室 CosyVoice 2 在中文 TTS 评测中 MOS 达 4.7,支持粤语和上海话,Apache 2.0 开源。

阅读原文 →
2024年9月1日·阿里巴巴

阿里通义实验室 CosyVoice 2.0 开源,流式语音克隆能力大幅提升

CosyVoice 2.0 在流式语音合成、零样本语音克隆和情感控制方面取得重大突破,已在 GitHub 上开源。

阅读原文 →
2024年8月1日·Fish Audio

Fish Speech 1.4 发布,中文 TTS 质量再上新台阶

Fish Speech 1.4 版本在多说话人音色一致性、中文韵律自然度和推理速度上均有显著提升。

阅读原文 →
2024年7月1日·OpenAI

OpenAI 发布 GPT-4o 实时语音模式,TTS 交互进入新纪元

GPT-4o 实时语音模式支持端到端语音对话,延迟降低至 200ms 级别,标志着 AI 语音交互进入全新阶段。

阅读原文 →
2024年6月15日·GitHub

ChatTTS 持续霸榜,中文 TTS 开源项目热度不减

ChatTTS 在 GitHub 上持续获得大量关注,其对话式语音合成能力引领中文开源 TTS 发展。

阅读原文 →
2024年5月13日·OpenAI

OpenAI 发布 GPT-4o TTS 功能

OpenAI 在 GPT-4o 中集成了原生 TTS 能力,支持多语言语音合成和情感表达,API 正式上线。

阅读原文 →