VoxCPM
VoxCPM

VoxCPM

面壁智能联合清华推出的开源语音克隆模型,端到端生成48K高保真语音,支持三十种语言和中文方言,Apache-2.0商用许可

访问官网
收录: 2026-09-08·更新: 2026-09-08·音频工具

详细介绍

产品定位
VoxCPM 是面壁智能(ModelBest)联合清华大学深圳国际研究生院推出的开源语音生成模型,采用词元化(tokenizer-free)架构,直接从文本端到端生成连续语音表示,跳过传统 token 拼接流程,在拟真度和情感自然度上达到行业领先水平。

核心功能
VoxCPM 支持零样本音色克隆,只需提供短至几秒的目标音色参考音频,即可复现该音色朗读任意文本;同时支持通过自然语言描述直接创建原创音色,无需参考音频。最新版 VoxCPM2 具备 2B 参数、48KHz 高保真输出、30 种语言(含粤语、四川话、吴语等中文方言),并新增 Voice Design 功能。

技术亮点
采用扩散自回归(Diffusion Autoregressive)架构,结合分层语言建模与 FSQ 约束、因果 VAE 等组件,在 NVIDIA RTX 4090 上实时因子(RTF)低至约 0.17,8G 显存即可本地部署,显卡、Mac、CPU 均可运行。

部署方式
pip 一键安装(pip install voxcpm),Python API 简洁易用:from voxcpm import VoxCPM; model = VoxCPM.from_pretrained("openbmb/VoxCPM2")。还支持 llama.cpp-omni(CPU/Metal 推理)、VoxCPM.cpp(GGML/GGU 量化)、ComfyUI 节点等多种生态。

许可与商用
采用 Apache-2.0 许可证,允许商业免费使用,适用于播客、有声书、产品语音配音、企业客服等各类语音合成场景。

版本沿革
VoxCPM-0.5B(2025.09)为首版,VoxCPM1.5(2025.12)新增 SFT 与 LoRA 微调,VoxCPM2(2026.04)为当前推荐版本,参数量 2B,新增 Voice Design 创意音色设计功能。