Higgs Audio V2 开源发布:李沐团队带来最强情感 TTS
Boson AI 开源 Higgs Audio V2,基于 1000 万小时训练,支持情感识别、零样本声音克隆和多角色对话。
·Boson AI
阅读原文 →Higgs Audio V2 是目前开源 TTS 中情感表达能力最强的模型,由李沐团队开发。使用统一音频分词器+残差向量量化,2kbps 压缩率保持 24kHz 音质。中文 MOS 4.6,英文 4.5,情感表达 MOS 4.7 业界最高。
零样本克隆只需 5 秒参考音频。推荐场景:虚拟主播、对话助手、有声读物。
该模型在声网 2026 年 5 月评测中获得 5 星推荐,是当前开源 TTS 领域情感维度表现最突出的模型。
分享:X