VoxCPM2 采用 Tokenizer-Free 架构,支持多语言语音生成和真实感语音克隆。
VoxCPM2 是无分词器(Tokenizer-Free)TTS 模型,直接建模原始音频,避免了传统分词器带来的信息损失。支持多语言语音生成、创意语音设计和真实感语音克隆。
覆盖 30 国语言 8 大方言,输出 48kHz 录音棚级音质。GitHub 更新活跃,社区反馈积极。
该模型代表了 TTS 架构演进的重要方向——脱离对离散分词器的依赖,在更高采样率下实现更自然的语音合成。