跳到主要内容

Higgs Audio V2 开源发布:李沐团队带来最强情感 TTS

Boson AI 开源 Higgs Audio V2,基于 1000 万小时训练,支持情感识别、零样本声音克隆和多角色对话。

·Boson AI
阅读原文 →

Higgs Audio V2 是目前开源 TTS 中情感表达能力最强的模型,由李沐团队开发。使用统一音频分词器+残差向量量化,2kbps 压缩率保持 24kHz 音质。中文 MOS 4.6,英文 4.5,情感表达 MOS 4.7 业界最高。

零样本克隆只需 5 秒参考音频。推荐场景:虚拟主播、对话助手、有声读物。

该模型在声网 2026 年 5 月评测中获得 5 星推荐,是当前开源 TTS 领域情感维度表现最突出的模型。

分享:X