OpenVoice语音克隆实操指南3分钟搭好环境5秒语音样本完成克隆【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice是MIT与MyShell开源的即时语音克隆音频基础模型用几秒参考音频克隆音色并支持零样本跨语言合成MIT协议可商用。适合想在本地搭建TTS音色克隆能力的开发者。一、它是什么 能做什么一句话定位OpenVoice 是一个音色转换器技术栈——基础 TTS 负责生成内容和韵律音色转换器负责把输出换成你指定参考音频的音色。它克隆的是音色tone color不是口音和情绪这一点先记住后面调优会用到。核心能力清单即时克隆3~5 秒清晰人声即可提取音色模板无需训练跨语言零样本参考语音和目标语言都不要求出现在训练集里V2 原生支持英、西、法、中、日、韩风格控制可通过不同 base speaker如 default / whispering调节节奏、停顿、语调可商用V1/V2 均为 MIT License选型视角对比维度传统 TTS 微调方案商业克隆 APIOpenVoice准备成本需数小时以上语音 GPU 训练无需准备按量付费几秒参考音频零训练数据去向自建管线上传至服务商全本地数据不出机器风格自由度训练什么就是什么受限于平台参数可替换 base speaker自由度最高适用对象有训练能力的团队不想写代码的用户开发者/研究者二、3分钟跑通一键安装与首次克隆最短路径是一条命令链按勾选项顺序执行即可conda create -n openvoice python3.9 -y conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .⚙️ 逐项自检Python 用3.9依赖里 numpy1.22.0、gradio3.48.0 是老版本3.10 容易编译失败pip install -e .后确认import openvoice不报错下载官方 checkpoint 并解压到仓库根目录的checkpoints/文件夹V2 模型则解压到checkpoints_v2/解压后应有converter、base_speakers等子目录有 GPU 就设devicecuda:0没有直接写cpu全代码路径通用首次运行不用写代码打开demo_part1.ipynb按 cell 顺序执行最后一步会输出outputs/output_en_default.wav这就是用仓库自带resources/example_reference.mp3克隆出的第一条语音。跑通它说明环境、模型、依赖全部就绪。三、核心玩法拆解场景1基础克隆默认音色 默认风格用途把任意一句文本变成参考人说出来的效果是其他所有玩法的地基。操作流程固定三步最小代码只有关键行from openvoice import se_extractor from openvoice.api import BaseSpeakerTTS, ToneColorConverter # 1. 加载基础TTS与音色转换器路径对应 checkpooints 解压目录 # 2. 从参考音频提取音色向量 target_se, _ se_extractor.get_se(my_reference.wav, tone_color_converter, vadTrue) # 3. 先生成中间音频再转成目标音色 base_speaker_tts.tts(text, outputs/tmp.wav, speakerdefault, languageEnglish) tone_color_converter.convert(outputs/tmp.wav, source_se, target_se, output_pathoutputs/final.wav)效果final.wav的音色与参考音频一致文本语言与参考音频语言可以不同。注意convert默认会嵌入一段隐形水印可传message自定义。场景2风格切换同一个人不同的演法用途不换音色只换说话方式——正常、耳语等。操作换tts的speaker参数和对应的source_se转换器部分一行不改base_speaker_tts.tts(text, outputs/tmp.wav, speakerwhispering, languageEnglish, speed0.9)效果输出仍是你的克隆音色但韵律、停顿变成耳语风格。想看完整写法直接对照demo_part1.ipynb里面有 EN 默认/耳语、ZH 中文三组对照。场景3零样本跨语言V1 路线用途参考音频是中文想让它说西班牙语、日语——且该语言不在训练集内。操作思路是任何能出声的 TTS 都能当 base speaker。仓库示例用 OpenAI TTS 生成中间音频再用转换器换音色见demo_part2.ipynb。你也可以用本地 TTS 替代只要产出一段 wav。效果同一音色说 11 种语言口音由 base speaker 决定与音色解耦。场景4V2 多语言原生合成用途不想自己找 base speaker开箱即用六种语言、音质更好。操作额外装一个 MeloTTSpip install githttps://github.com/myshell-ai/MeloTTS.git python -m unidic download然后按demo_part3.ipynb走MeloTTS 出中间音频 →ToneColorConverter换音色与 V1 流程完全一致只是检查点目录换成checkpoints_v2。效果英/西/法/中/日/韩直接可选中文还支持句中夹杂外文如在这次vacation中去Paris。场景5Gradio 本地演示界面用途不想碰代码网页上传参考音频、输入文本、点按钮。操作python -m openvoice_app --share效果浏览器打开本地 7860 端口即可交互。界面用 langid 自动检测输入文本语言V1 界面目前支持中、英两种其他语言请走 notebook 路线。四、参数与效果调优可调参数不多但每个都有明确手感参数位置范围作用speedtts()约 0.8~1.2语速1 加快1 放慢耳语风格建议 0.9speakertts()模型自带音色名决定风格default / whispering 等languagetts()模型支持的语言决定发音体系tauconvert()默认 0.3音色转换强度官方默认值即可不要乱动参考音频get_se()3~5 秒、单人、无背景音直接决定克隆上限参考音频数量get_se()支持传列表1~3 段多段会自动平均长文本质量更稳 可直接照抄的推荐组合目标组合标准克隆speakerdefault,speed1.0参考音频 5 秒干净人声耳语/低语speakerwhispering,speed0.9正式长文本参考音频传 2~3 段get_se列表speed1.0中文输出languageChinese ZH base speaker仅用 default 风格调优顺序建议先保证参考音频干净最大变量再动speed最后才考虑换 base speaker。五、报错 避坑速查现象原因解法克隆音色的口音/情绪不像参考人OpenVoice 只克隆音色口音和情绪由 base speaker 决定换带目标口音的 base speaker别指望转换器输出音质差、有杂音参考音频带背景音、过短、多人声或长静音换 3~5 秒单人干净录音多段平均换参考文件后结果没变化用了同名文件但旧的processed/缓存未删删除processed文件夹重跑报 Silero 下载失败se_extractor的 VAD 需要拉取 silero-vad 包网络不通手动下载该 zip 并解压到~/.cache/torch/hub/snakers4_silero-vad_master细节见 docs/QA.mdGradio 界面提示语言不支持本地 demo 仅支持 zh/en 检测用 notebook 路线跑其他语言import时报依赖错Python 用了 3.10重建 conda 环境固定 python3.9 通用排查思路音质问题九成出在参考音频先换录音再怀疑代码。六、选型 部署扩展场景推荐方式优势局限快速体验、做 demoopenvoice_appGradio零代码界面直观仅中英V1 模型集成进自己的产品直接调用api.py两个类灵活可控无 UI 开销需自己管检查点与前后处理多语言生产V2 MeloTTS六语言原生音质更好多一个依赖要装不想折腾环境myshell.ai 已部署的在线服务开箱即用非本地数据上云Windows / Docker 部署社区非官方指南省踩坑时间非官方维护周边生态实现基于 VITS 系架构水印用 wavmark跨语言 base speaker 可以替换成任意 TTS包括 OpenAI TTS这是它扩展性的主要来源。七、学习路径 资源建议按这个顺序走从能跑通到能改docs/USAGE.md — 安装与各版本检查点说明demo_part1.ipynb— 基础克隆 风格控制先跑通这个demo_part2.ipynb— 零样本跨语言外部 TTS 当 base speakerdemo_part3.ipynb— V2 多语言原生合成docs/QA.md — 官方 FAQ遇问题先查这里openvoice/api.py— 全部对外 API 就两个类源码不长值得通读参考音频不够用仓库resources/下有demo_speaker0/1/2.mp3和example_reference.mp3可直接练手下一步克隆能力的边界不在这两个类里而在你接什么 base speaker——现在就把demo_part1.ipynb跑通换一段你自己的 5 秒录音听一下效果再决定要不要上 V2。跑不通的地方先翻 docs/QA.md那里覆盖了绝大多数坑。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考