OpenBMB 开源的免分词端到端 TTS 模型,VoxCPM2 为 2B 参数、支持 30 种语言,可用文字描述凭空设计音色、短样本克隆声音,并直接输出 48kHz 录音棚级音频,本地自部署。
适合有独显的本地 AI 玩家 · 有声书与播客制作者 · 游戏与动画开发者
亮点
文字描述直接造音色
Voice Design 模式无需参考音频,用性别、年龄、语气、情绪、语速的自然语言描述就能生成全新声音
三档克隆精度可选
可控克隆保音色改情绪,Ultimate Cloning 配上参考文本后连呼吸、口音、节奏细节一并复刻
免分词连续表征生成
扩散自回归架构绕过离散 token,靠上下文推断韵律,长句情感起伏比多数开源 TTS 自然
48kHz 直出 + 实时推理
AudioVAE V2 内置超分,16kHz 参考音也能出 48kHz;4090 上 RTF 约 0.3,Nano-vLLM 加速可到 0.13
取舍
选它的理由
- 文字描述造音色,不用找真人素材
- 48kHz 直出,成品可直接进剪辑轨
- 三种克隆模式覆盖粗调到极致复刻
- Apache-2.0 授权,可商用可微调
先想清楚
- 只有集显或低显存笔记本
- 完全不想碰命令行
- 要克隆他人声音做商用内容
- 2B 模型吃显存,低配显卡跑不动或很慢
安全警示
- 声音克隆能力可被用于伪造他人语音进行诈骗,未经授权克隆真人声音可能触犯肖像权、人格权相关法律
- PyPI 上 voxcpm 包状态标注为 3 - Alpha,属早期版本,生产环境使用前需自行评估稳定性
- 网络上存在 voxcpm.net 等多个非 OpenBMB 官方的同名站点,下载模型与代码请以 GitHub/OpenBMB 与 Hugging Face 官方渠道为准
基于公开资料与 AI 分析整理,仅供参考,请自行核实。
同类推荐
查看全部更多「音视频工具」软件
MediaInfoKeeper
音视频工具开源MediaInfoKeeper 是面向 Emby 服务端的第三方插件,主打 STRM 直链播放,通过单个 DLL 部署,并按 Emby 版本区间限制自动更新。
Pireel Studio
音视频工具开源Pireel Studio 是面向口播、长视频拆条和产品演示的开源网页视频编辑器,特色是让对话指令与手动时间线编辑共用项目状态,并在一个项目里维护多个成片版本。
Faster Whisper transcription with CTranslate2
音视频工具开源基于 CTranslate2 重实现 Whisper 的 Python 语音转写库,通过量化和批处理降低推理耗时与资源占用,适合搭建转写流水线,而非开箱即用的桌面应用。
Buzz
音视频工具开源Buzz 是将音视频和麦克风语音转成文字与字幕的桌面应用,特色是可离线运行多种识别模型,并结合显卡加速、说话人识别和回放工具完成转录校对。
宇宙无敌表达训练系统
音视频工具开源一款面向口语练习的桌面工具,用离线语音识别和词库标记口头禅、犹豫词与笼统表达,并可接入云端或本地AI生成改进报告。
FFmpegFreeUI
音视频工具开源FFmpegFreeUI 是面向 Windows 进阶用户的 FFmpeg 图形外壳,将可视化设置、自由参数和批量任务结合,适合想摆脱重复命令、又不愿牺牲编码控制权的人。
AI 整理的软件知识库
AI 整理软件资料、版本动态、更新通知、订阅权益与对比分析,沉淀可复用的工具知识。