VibeVoice
微软开源的项目,最初为 1.5B 长音频 TTS 模型。2025 年 9 月起 TTS 训练/推理代码已移除,项目转向 ASR 与语音处理。
中文英语
微软长音频MIT多说话人ASR
VibeVoice 是微软研究院开源的一款 1.5B 参数的大规模 TTS 模型,专为长音频生成场景设计。与传统的 TTS 模型不同,VibeVoice 可以在单次推理中生成最长 90 分钟的连续语音,无需分段拼接,从而保证了长文本下语音的自然度和连贯性。
在架构设计上,VibeVoice 采用连续语音分词结合扩散生成架构,突破传统自回归模型在长序列生成上的瓶颈。该模型支持最多 4 个说话人的音色切换,适合需要多角色演绎的内容创作场景。其长音频一致性评测 MOS 达到 4.6 分,显著优于同类模型。
⚠️ 项目状态变更: 2025 年 9 月,微软移除了 VibeVoice 仓库中的 TTS 训练和推理代码。目前项目已转向聚焦 ASR(自动语音识别)和语音处理方向。原始 TTS 模型的权重和论文仍可获取,但不再通过此仓库进行维护。查看 VibeVoice GitHub 仓库 了解最新状态。
标签:微软长音频MIT多说话人ASR
分享:X