VoxCPM2
OpenBMB 推出的 VoxCPM2 无分词器语音合成模型,2B 参数,支持 30 种语言和 8 大方言,48kHz 录音棚级音质输出,具备语音编辑与声音设计能力。
30 languages and 8 dialects
Tokenizer-Free多语言语音克隆语音编辑
VoxCPM2 是 OpenBMB 推出的第二代无分词器架构语音合成模型,创新性地直接对原始音频波形进行建模,彻底摒弃了传统 TTS 系统中依赖分词器的中间步骤。模型拥有 2B 参数,这种端到端的设计避免了分词误差的累积,使模型能够更精准地捕捉语音信号中的细微特征,输出极其自然的合成语音。
在能力覆盖上,VoxCPM2 支持多达 30 个国家和地区的语言以及 8 种主要方言,是目前开源 TTS 模型中语言覆盖面最广的方案之一。模型输出可达 48kHz 录音棚级别音质,满足专业音频制作需求。更为突出的是,VoxCPM2 不仅支持语音克隆与可控情感表达,还引入了语音编辑和声音设计能力——用户可以对已有语音进行精细编辑,或从零开始设计全新的声音特征,极大地拓展了创作空间。
VoxCPM2 采用 Apache 2.0 许可证开源,对商业使用友好。项目在 GitHub 上已获得超过 12,000 颗星标,社区活跃度持续攀升。无论需要跨语言语音合成、个性化声音定制,还是富有情感的语音生成与编辑,VoxCPM2 都提供了强大的技术基础。了解更多请访问 VoxCPM GitHub 仓库。
标签:Tokenizer-Free多语言语音克隆语音编辑
分享:X