VoxCPM2在线
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪
常见问题
VoxCPM2在线
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪

VoxCPM 是什么?VoxCPM2 开源模型介绍与在线使用

最后更新:2026-08-05数据来源:VoxCPM 官方 GitHub / 技术报告阅读约 6 分钟

VoxCPM 是面壁智能(OpenBMB)开源的语音生成大模型系列,采用 tokenizer-free(无分词器)架构,直接建模连续语音表征,主打零样本声音克隆与富有表现力的语音合成。系列目前包含三代:VoxCPM(约 0.6B)、VoxCPM1.5(约 0.8B)与最新一代 VoxCPM2(约 2B)。

只需一段参考音频,VoxCPM 即可克隆出对应音色并朗读任意文字,无需针对说话人单独训练。使用它有两条路:自己在本地部署(需要 NVIDIA 显卡),或通过 VoxCPM2在线 这类在线平台打开网页直接用。下文把系列演进、参数、评测与两种使用方式一次讲清。

VoxCPM 系列演进

2025.09

VoxCPM(0.5B 系)

系列首发,约 0.6B 参数,在约 180 万小时中英语音上训练,确立 tokenizer-free 架构与续写式零样本声音克隆,输出 16kHz。

2025.12

VoxCPM1.5

参数提升到约 0.8B,音质升级至 44.1kHz,克隆稳定性改进,仍以中英双语为主。

2026

VoxCPM2(最新一代)

基于 MiniCPM-4 底座扩到约 2B 参数,训练数据超 200 万小时(官方文档约 236 万小时),语言扩展到 30 种 + 9 种中文方言,新增 Voice Design 与 Style Control,输出 48kHz。

三代参数对比表

对比项VoxCPMVoxCPM1.5VoxCPM2(最新)
发布时间2025.092025.122026
参数规模约 0.6B约 0.8B约 2B
底座模型MiniCPM-4
训练数据约 180 万小时约 180 万小时超 200 万小时(约 236 万)
语言支持中文、英文中文、英文30 种语言 + 9 种中文方言
声音克隆续写式零样本续写式零样本独立参考音频 / 续写
音色设计Voice Design
风格控制Style Control
输出采样率16kHz44.1kHz48kHz

数据来自 VoxCPM 官方 GitHub 与技术报告 · 核对于 2026-08-05

技术特点:为什么 VoxCPM 不一样

Tokenizer-free 架构。传统 TTS 通常先把语音离散成 token 再生成;VoxCPM 直接在连续语音表征上端到端建模,减少离散化带来的信息损失,这是其自然度与韵律表现的基础。

零样本克隆。无需为每个说话人训练模型,一段参考音频即可复刻音色;VoxCPM2 进一步支持不带参考文本的独立参考音频克隆。

可控生成。VoxCPM2 引入 Voice Design(用自然语言描述凭空生成音色)与 Style Control(控制情绪、语速、能量)。官方技术报告同时提示:可控生成的稳定性仍在持续优化,同一文本在不同指令下效果可能有差异。

VoxCPM2 官方评测数据

指标数值说明
英文 WER1.84%Seed-TTS-Eval 零样本克隆,越低越好
中文 CER0.97%Seed-TTS-Eval 零样本克隆,越低越好
中文 SIM79.5%说话人相似度,越高越好
N-MOS 自然度4.78 / 5主观评测,零样本克隆
S-MOS 相似度4.74 / 5主观评测,零样本克隆
I-MOS 指令遵循4.50 / 5可控生成主观评测

数据来自 VoxCPM2 技术报告 · 核对于 2026-08-05

怎么用 VoxCPM:本地部署 vs 在线使用

路线一 · GitHub 本地部署

  • 适合:开发者、二次开发、离线大批量、数据敏感场景
  • 要求:NVIDIA 显卡 + Python 环境
  • 步骤:克隆 OpenBMB/VoxCPM 仓库 → 按 README 安装依赖 → 下载模型权重(Hugging Face / ModelScope)→ 运行推理
git clone https://github.com/OpenBMB/VoxCPM
cd VoxCPM && pip install -r requirements.txt
# 下载权重后按 README 运行推理脚本

路线二 · VoxCPM2在线(免部署)

  • 适合:想直接出配音的创作者,无需显卡,手机可用
  • 步骤:打开 voxcpmai.com → 上传一段清晰参考音频 → 输入文案、按需设定情绪语速 → 生成试听并下载 WAV/MP3
  • 注册即送免费额度;生成音频含 AI 标识;克隆仅限本人或已授权声音
免费在线体验 VoxCPM2

VoxCPM 常见问题

VoxCPM 是什么?
VoxCPM 是面壁智能(OpenBMB)开源的语音生成大模型系列,采用 tokenizer-free 架构,主打零样本声音克隆与富有表现力的语音合成。系列包含 VoxCPM(约 0.6B)、VoxCPM1.5(约 0.8B)与最新一代 VoxCPM2(约 2B)。
VoxCPM 是哪家公司开发的?
面壁智能(OpenBMB)开源发布,代码在 GitHub 的 OpenBMB/VoxCPM 仓库,模型可从 Hugging Face 与 ModelScope 下载。VoxCPM2 基于其 MiniCPM-4 底座构建。
VoxCPM 免费吗?
模型本身开源,可按官方开源协议免费下载部署,商用条款以官方协议为准。不想配环境可用本站 VoxCPM2在线:注册即送免费额度,打开网页即可体验。
VoxCPM 和 VoxCPM2 哪个好?
日常使用推荐 VoxCPM2:参数约 2B、30 语言 + 9 方言、新增 Voice Design 与 Style Control、输出 48kHz。早期 VoxCPM 的优势是模型更小、部署更轻。
VoxCPM 本地部署需要什么配置?
需要 NVIDIA 显卡 + Python 环境,从 GitHub 获取代码、装依赖、下载权重后推理。没有显卡就用 VoxCPM2在线,浏览器打开即用。
VoxCPM 的克隆效果怎么样?
VoxCPM2 官方数据:英文 WER 1.84%、中文 CER 0.97%、SIM 79.5%;主观 N-MOS 4.78/5、S-MOS 4.74/5,处于开源第一梯队。
VoxCPM 支持中文方言吗?
VoxCPM2 覆盖 9 种中文方言:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话。早期 VoxCPM 仅中英。
不部署能用 VoxCPM 吗?
可以。本站 VoxCPM2在线基于 VoxCPM 开源模型搭建,免下载免显卡,打开网页上传参考音频即可克隆与配音。本站为第三方平台,与模型方无官方隶属或背书关系。

不想部署?在线直接用 VoxCPM2

免下载、免显卡,注册即送免费额度,打开网页克隆你的第一个声音。

免费开始

相关页面

首页
声音模型
声音克隆