
之前介绍过一些关于语音的Skill 和 自己写代码语音转文字的开发过程:
107 分钟的会议录音,免费转文字+自动标注说话人
开源语音 AI:3 秒克隆声音,支持 9 种语言 — Voxtral TTS
我的 OpenClaw 可以开口说话|NoizAI 技能安装使用教程
今天给朋友们介绍一款可以直接上手用的语音工具: Voicebox。

Voicebox — 开源 AI 语音工作室
克隆任意声音、生成语音、向任意应用口述输入、用你自己的声音与 AI 对话。完整的语音输入输出技术栈,在你自己的机器上本地运行。
Voicebox 是一个本地优先的 AI 语音工作室,将 ElevenLabs 和 WisprFlow 合二为一,免费开源。
用几秒钟的音频就能克隆声音,在 7 个 TTS 引擎上用 23 种语言生成语音,通过全局快捷键向任意文本输入框口述,还能让任何支持 MCP 的 AI Agent 用你选定的声音说话。
ElevenLabs 管语音输出,WisprFlow 管语音输入,两家各占语音环路的一半。Voicebox 两端都做,中间用内置的本地大模型做文本润色和角色性格管理,并且全部在你自己的机器上运行。
核心能力:
[大笑]、[叹气]、[惊讶] 等副语言标签;Qwen CustomVoice 支持自然语言控制说话方式voicebox.speak,任何支持 MCP 的 Agent(Claude Code、Cursor、Cline 等)就能用你克隆的声音跟你说话Q: 这个工作室是编译好的 App 吗?
Voicebox 同时提供预编译安装包和完整源码。
macOS DMG、Windows MSI、Docker 镜像均可直接下载安装使用;对于想自行构建或二次开发的用户,仓库包含全部源码(backend/、app/、web/、tauri/),按开发指南中的步骤即可从源码构建。
和常规开源桌面应用一样,仓库内容不是编译产物,而是完整的工程源码。
Q: 内部引擎使用的开源模型是内置的吗?
所有 TTS、STT、LLM 模型均为开源(Qwen3-TTS、Chatterbox、Kokoro、Whisper、Qwen3 等),应用启动后自动从 HuggingFace 下载到本地,随后所有推理在本地完成,不需要网络。
Docker 部署时通过 huggingface-cache 卷持久化模型缓存,避免重复下载。这些模型不是编译进安装包的(否则安装包会高达数十 GB),而是在首次使用时按需下载。
Q: 它本质上是一个语音常用使用场景的工程封装项目?
是的。
Voicebox 不训练新模型,它的核心价值是:把多个开源语音模型集成到一个统一的桌面应用中,覆盖"语音克隆 + 语音合成 + 口述输入 + Agent 语音输出"这条完整链路,再配上音频后期效果、多轨故事编辑器、全局快捷键等工程化功能,大幅降低普通用户使用这些模型的门槛。
可以理解为"语音领域的全家桶工程封装"。
7 个 TTS 引擎各有所长,每次生成可切换:
多引擎声音克隆
只有 Chatterbox Turbo 能解读 [大笑]、[叹气] 这类副语言标签。Qwen3-TTS、LuxTTS、Chatterbox Multilingual 和 HumeAI TADA 会将这些标签当作普通文字读出来。
选中 Chatterbox Turbo 后,在文本输入框中输入 /,即可打开标签插入器,在语音中内联添加情感标签:
[大笑][轻笑][惊讶][咳嗽][叹气][呻吟][抽鼻子][嘘声][清喉咙]
基于 Spotify 的 pedalboard 库,提供 8 种音频效果。生成后应用,实时预览,可创建可复用的预设方案。
效果 | 描述 |
|---|---|
音高偏移 | 上下最多 12 个半音 |
混响 | 可调节房间大小、衰减、干湿比例 |
延迟 | 可调节时间、反馈量、混合比例的回声 |
合唱/镶边 | 调制延迟,产生金属质感或丰富纹理 |
压缩 | 动态范围压缩 |
增益 | 音量调节(-40 到 +40 dB) |
高通滤波 | 去除低频 |
低通滤波 | 去除高频 |
内置 4 个预设方案(机器人、收音机、回音室、低沉嗓音),也支持自定义预设。效果可以为每个声音配置单独设默认值。
文本在句子边界自动切分,每个片段独立生成,然后交叉淡入淡出拼接。所有引擎通用。
[标签]每次生成支持多个版本,含来源追溯:
生成不阻塞。提交后马上可以开始输入下一段。
多声音时间线编辑器,适合对话、播客、故事叙述。
语音输入输出环路的另一半。
在系统任何位置按住快捷键,说话,松手,macOS 上转写结果会自动粘贴到当前焦点文本框中。
或者点击 Voicebox 任意文本输入框上的麦克风直接口述到应用内。
录音中、转写中、润色中、朗读中 状态。Agent 说话时用同样的指示器,输入输出环路的视觉体验一脉相承Voicebox 使用 OpenAI Whisper 做转写,口述功能、录音标签页、/transcribe API 背后都是同一个模型。
根据平台自动选用 MLX(Apple Silicon)或 PyTorch(CUDA / ROCm / DirectML / CPU)。
模型大小 | 说明 |
|---|---|
Base/Small/Medium/Large | 标准 Whisper 质量梯度 |
Turbo | 比 Whisper Large 快约 8 倍,质量损失极小 |
每次口述、应用内录音和上传的音频文件都会进入录音标签页,原始音频与转写文本配对保存,始终保留。
每个 Agent 都可以有声音。一个工具调用,任何支持 MCP 的 Agent 就能用你克隆的声音跟你说话——任务完成、提问、通知都能语音播报。Agent 说话时用的悬浮指示器和口述时一样,你随时看得见机器在说什么。
同时也暴露为 POST /speak,供不支持 MCP 的场景(ACP、A2A、Shell 脚本、自定义框架)使用。
录音中、转写中、润色中、朗读中 都是同一个系统级悬浮窗的状态,口述和 Agent 语音共用同一个视觉界面last_seen_at 时间戳确认绑定已生效voicebox-mcp 二进制文件给任意声音配置附加一段自由格式的性格描述,定义这个声音是谁、怎么说话、关注什么。设置性格后,生成输入框上会出现两个操作按钮,由内置的 Qwen3 大模型本地驱动。
Agent 也能通过 MCP 走同样的改写路径——在 voicebox.speak 中传 personality: true,工具就变成 文本输入 → 性格大模型 → TTS 的管道。口述的润色功能用的也是同一个大模型,整个应用只有一个大模型、一份模型缓存、一份显存占用。
本地大模型选项: Qwen3 0.6B / 1.7B / 4B,与 TTS 共享运行时(Apple Silicon 用 MLX,其他用 PyTorch)。
应用场景: Agent 开发循环(口述提问,听克隆声音回答)、游戏和叙事工具的交互角色、为失语用户提供语音辅助。
Voicebox 提供 REST API,方便把语音输入输出集成到你自己的应用和 Agent 中。主要端点包括:生成语音(POST /generate)、Agent 语音输出(POST /speak)、转写音频文件(POST /transcribe)、列出声音配置(GET /profiles)。
POST /speak 接受 profile 参数(名称不区分大小写或 ID),解析优先级与 MCP 工具相同:显式传参 → 按客户端绑定 → capture_settings.default_playback_voice_id。
Voicebox 内置 MCP(Model Context Protocol) 服务器,任何支持 MCP 的 Agent(Claude Code、Cursor、Windsurf、Cline、VS Code MCP 扩展)都能说话、转写、浏览录音和声音配置。
Claude Code 一行安装: 使用 claude mcp add voicebox 命令,指定 HTTP 传输方式,指向 http://127.0.0.1:17493/mcp,并带上 X-Voicebox-Client-Id 头标识客户端身份。
任意 HTTP MCP 客户端(Cursor、Windsurf、VS Code 等):在 MCP 配置中设置 url 为 http://127.0.0.1:17493/mcp,并在 headers 中传入 X-Voicebox-Client-Id 即可。
Stdio 备选方案,适用于不支持 HTTP MCP 的客户端:指向应用内置的 voicebox-mcp 二进制文件(例如 /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp),并设置环境变量 VOICEBOX_CLIENT_ID。
内置四个工具:voicebox.speak、voicebox.transcribe、voicebox.list_captures、voicebox.list_profiles。
按客户端绑定声音在 Voicebox → 设置 → MCP 中管理。voicebox.speak 支持 profile(可选,未传则使用按客户端绑定的声音)和 personality(可选,先通过该声音的性格大模型改写文本)参数。
使用场景:
Agent 开发循环(口述提问,听克隆声音回答)、游戏对话、播客制作、叙事工具的交互角色、为失语用户提供语音辅助、语音助手、内容自动化。
这款语音工具是你需要的吗?
欢迎评论区留言。