本地运行的开源 AI 语音工作室,集成 7 个 TTS 引擎的语音克隆、Whisper 全局听写、多轨故事编辑和本地 REST API,音频与模型全程不出本机,替代 ElevenLabs 和 WisprFlow。
适合做视频、播客的内容创作者 · 重度语音输入用户 · 游戏或应用开发者
亮点
七个 TTS 引擎自由换
Qwen3-TTS、Chatterbox、LuxTTS、Kokoro 等各有侧重,可按硬件和音质需求切换,3 秒样本即可零样本克隆。
音频不出本机
模型、声音样本、录音全部留在本地,转写清理用的也是内置本地 LLM,无账号、无上传。
本地 REST API 无限调用
每个下载的引擎都变成 localhost 接口,没有 API Key、限流和按字符计费,可接游戏 NPC 或脚本批量生成。
MCP 让 Agent 有声音
一个 voicebox.speak 工具调用,Claude Code、Cursor、Cline 就能用你克隆的音色说话,还能按客户端绑不同声音。
取舍
选它的理由
- 3 秒样本即可克隆,上手几乎零配置
- 本地跑,无按字符计费和限流
- 七引擎可换,音质不满意就换一个
- 全局听写 + Agent 语音,输入输出一条链
先想清楚
- 设备是低配笔记本或核显机型
- 只想偶尔生成几段配音
- 需要商用授权明确的音色
- 模型体积大,无独显机器生成很慢
安全警示
- 官网 voicebox.sh 在 Scam Detector(评分 13.4)与 Gridinsoft(信任度 21/100)等自动化信誉扫描中被标为可疑站点,属机器评级、非确证事件,建议只从官方 GitHub Release 下载校验。
- GitHub 上已出现大量 voicebox 同名派生仓库,注意辨认 jamiepine/voicebox 官方源,避免下载被改动的第三方构建。
- 官网推广 Solana 上的 $VOICEBOX 代币,虽声明与软件使用无关,但加密代币关联易被套利或仿冒项目利用,不建议参与。
- 语音克隆技术本身存在被用于伪造他人声音的滥用风险,未经授权克隆真人音色可能涉及法律责任。
基于公开资料与 AI 分析整理,仅供参考,请自行核实。
同类推荐
查看全部更多「音视频工具」软件
WhisperSubTranslate
音视频工具开源本地运行的桌面字幕工具:用 whisper.cpp 把视频语音转成 SRT 字幕,再用内置腾讯 Hy-MT2 模型离线翻译成 15 种语言,也可接 DeepL、GPT、Gemini 等在线引擎,视频全程不上传。
mpv-Yaozhi
音视频工具开源面向 Windows 的 mpv 第三方整合包,自编译 mpv/FFmpeg/SDL2 核心,专攻 Dolby Vision、HDR Vivid、AV3A 沉浸声、5.1.4 至 9.1.6 具名多声道 PCM 与 HDR 图形字幕,并深度汉化 uosc 界面、内置弹幕与网盘直链播放。
ComfyUI-RH-MiniMax-H3
音视频工具开源把 MiniMax-H3 音视频联合生成模型接入 ComfyUI 的插件,支持文生视频+音频、首尾帧驱动和多模态参考三种任务,靠 INT8 量化与分层卸载在单张 24GB 显卡上跑完整流程。
Stash-Jellyfin Proxy
音视频工具开源一款 Python 代理服务器,通过模拟 Jellyfin HTTP API,让 Infuse、Swiftfin 等兼容播放器直接浏览与串流 Stash 媒体库,实现无缝的媒体消费体验。
Shutter Encoder
音视频工具开源由视频剪辑师开发的开源转码工具,用图形界面封装 FFmpeg,支持几乎所有音视频图像格式,并能对部分编码做无重编码剪切、字幕烧录与批量队列输出。
JAVM
音视频工具开源基于 Tauri 2 + Vue 3 + Rust 的桌面端 JAV 媒体库管理器,把本地扫描入库、番号刮削、下载队列和内置播放截图串成一条流水线,数据存本地 SQLite。
AI 整理的软件知识库
AI 整理软件资料、版本动态、更新通知、订阅权益与对比分析,沉淀可复用的工具知识。