如何用开源 Voicebox 把 30 秒录音变成量产旁白本地声音克隆完整实战【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox我过去一直用云端语音接口做配音每次生成都在按量计费更麻烦的是那个声音永远不是我自己的。后来我装了 Voicebox——一个开源声音克隆工作室用 30 秒录音就能克隆出我的声音然后在本机做本地文本转语音模型和音频全程不离开电脑。这篇文章把我用了一个月的真实流程走一遍。先让它跑起来它的硬件门槛比想象中低纯 CPU 都能跑有 GPU 时生成速度快 5-10 倍。桌面版有 macOSApple Silicon / Intel和 Windows 安装包Linux 目前没有官方安装包用 Docker 直接拉起docker compose up启动后本地服务默认监听 17493 端口第一次生成时会自动下载对应引擎的模型文件只有这一步需要联网。Apple SiliconMLX/Metal、NVIDIACUDA、AMDROCm、Intel Arc 都有对应加速没有独立显卡就用纯 CPU只是慢一些。装完先在模型页按用途挑引擎想做声音克隆质量优先选 Qwen3-TTS低配机器选 LuxTTS。安装、模型下载、显卡识别都有专门的排障文档卡住了先查 排障指南比在群里问快。十分钟完整走一遍本地声音克隆 ️最值的功能就是它给 30 秒清晰人声从此这个声音归你生成不花一分钱。打开应用点左侧边栏的Voices标签再点 New Voice。名称填「我的旁白」语言选中文这一步只是建档还没开始克隆。添加参考样本点Record Sample对着麦克风读 10~30 秒。别贪短低于 5 秒的片段质量会很差也别带背景音乐噪音会被一并克隆进去。读完后点Create Profile保存模型会从样本里提取声音特征存成一个声音档案。切到Generate标签下拉框里选刚建的「我的旁白」引擎选 Qwen3-TTS 1.7B——它是综合质量最好的一档。第一次生成因为模型初始化会慢一些属于正常现象第二次就快了。把公众号文章的第一段粘进输入框点Generate。几秒后列表里出现一条新音频点Play试听音色、语速确实是我自己但比我本人念得更稳。不满意可以换种子重录一条 Take每次生成的原始版本都会保留在 History 里还能加星标收藏。整章文章生成完直接Download导出 WAV上架前不用再过任何转换工具。对比一下同样这段文字云端 API 要么按字符收费要么用公版音色这里用我自己的声音成本只有第一次下载模型的那次流量。它还能顺手帮你做这几件事除了声音克隆本体下面三个功能是我每天都在用的。长文一口气生成不断句云端接口的老毛病是单次字数上限一整章小说你得手动拆段、生成、再拼接。Voicebox 的生成框直接吞整章文本它按句子边界自动切分每段独立生成后交叉淡化拼起来连中日韩标点里的省略号都不会切错位置。异步队列意味着你提交完可以接着编辑下一条互不阻塞。多人对话不用另开剪辑软件做播客或有声剧以前是每个角色单独生成再拖进 DAW 里对时间轴。Stories 编辑器把这件事收进了应用内每个角色一条轨道音频片段直接在时间线上拖拽、裁剪、拆分播放头同步走一遍就是成片效果。每段剪辑还能锁定对应的生成版本某条重生成不会打乱整片。输入一个斜杠声音就有了情绪选 Chatterbox Turbo 引擎后在输入框按/会弹出标签插入器[laugh][sigh][gasp]这些会被读成真实的笑声、叹息而不是念出方括号里的字。生成之后还有 8 种后期音效可以叠移调、混响、延迟、压缩等内置 Robotic、Radio 两个预设适合给短视频角色配音时用。如果你是开发者 Voicebox 是 API-first 的本机 17493 端口是一个标准 REST 服务还内置了 MCP 服务器。一条 curl 就能让克隆的声音说话X-Voicebox-Client-Id请求头把不同 Agent 绑定到不同音色——朗读时屏幕会浮现提示气泡标明是谁在说话不会出现后台偷偷发声。工具实现在 backend/mcp_server/朗读接口在 speak.py接进自己的应用前值得看一眼。curl -X POST http://127.0.0.1:17493/speak \ -H X-Voicebox-Client-Id: my-script \ -d {text: 部署完成。, profile: Morgan}装之前先问这几个问题新手犹豫最多的四个问题答案都写在这。要钱吗不。桌面软件免费开源没有账户、订阅和按量计费克隆和生成都本地完成。吃内存吗看引擎。LuxTTS 约 1GB 显存纯 CPU 上也有约 150 倍实时速度专门给低配机器留了位置Qwen3-TTS 1.7B 质量最好但占得多用完可以手动卸载模型释放显存。断网能用吗模型下载完之后能。生成、克隆、Whisper 转写全部离线工作联网只发生在首次拉模型那一下。我的录音去哪了哪儿也不去。参考样本、生成结果、听写录音都存在本机没有云端备份这一说——这点对录音敏感的内容创作者很关键。如果你做内容、手里有台能开浏览器的电脑这周就可以装上试。步骤细节见 声音克隆指南 和 排障指南。【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考