
RVC 变声器使用指南用 10 分钟录音从零训练 AI 音色克隆模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一套基于 VITS 的开源语音转换框架核心用途是 AI 音色克隆给它十几分钟某个人的语音训练出一个语音转换模型再把任何输入音频换成那个人的声音。本文按了解 → 搭建 → 数据 → 训练 → 验证 → 排错的顺序带你完整跑通一遍最终产出是一个可分享的.pth模型文件加一个特征索引文件。一分钟看懂 RVC它凭什么用少量数据就能克隆音色先用大白话讲三件事。定位RVC 是说话人转换器。你的目标音色只需少量语音输入的任意音频经过提音高 → 抽特征 → 检索替换 → 声码器合成后输出就带上目标音色。检索机制是什么传统做法里模型容易偷听输入音频的音色行话叫音色泄露你录个粗嗓门出来的声音就带着粗嗓门。RVC 在推理时会到训练集的特征库里做相似度检索top1 检索把输入特征替换成最接近的训练集特征等于强制以你的训练数据为准从机制上压住泄露。能做到什么程度官方 README 给出的可验证指标是——普通声卡下端到端延迟约 170ms配 ASIO 输入输出可降到 90ms支持实时变声训练侧推荐至少 10 分钟低底噪语音数据且即便在相对较差的显卡上也能快速训练。底模由接近 50 小时的开源 VCTK 数据集训练无版权顾虑。从克隆到启动系统要求、安装与首次运行系统要求很简单Python 3.8 以上Poetry 安装路径建议 3.7–3.10更高版本装llvmlite会冲突、一张 NVIDIA 显卡CPU 也能跑只是慢、ffmpeg。A 卡和 Intel 核显用户可走 DirectML / IPEX 路线。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt注意装完依赖后还要补两样东西推理才能跑预训练底模文件放到assets/下hubert/hubert_base.pt、pretrained/、uvr5_weights/用 v2 底模还需pretrained_v2/仓库tools/里有现成的下载脚本 tools/download_models.py。RMVPE 音高提取模型的权重文件rmvpe.pt放到项目根目录RMVPE 是目前默认且推荐的人声音高提取算法效果最好且比 crepe 快、更省资源。首次启动python infer-web.pyWindows 用户直接双击go-web.bat即可首次会打开浏览器并进入 Gradio 界面。界面共 6 个选项卡选项卡干什么用模型推理单次/批量用训练好的模型转换音频调 index rate 等参数伴奏人声分离集成 UVR5从歌曲里快速分离人声和伴奏训练数据集处理、音高与特征提取、训练模型与索引ckpt处理提取小模型、模型融合ckpt-mergeOnnx导出导出 ONNX 模型供端侧推理常见问题解答内置 FAQ代码结构上训练逻辑在 infer/modules/train/推理与合成管道在 infer/modules/vc/全局参数显存自适应、采样率配置集中在 configs/config.py。录音与数据准备数据决定上限这一步比训练本身更重要。模型学的是你喂给它的那点声音底噪大、音色杂后面调参都救不回来。音质底线安静环境录制底噪尽量低目标 10–50 分钟总时长数据精致且音色有特色时 5–10 分钟也能出活采样率建议 48kHzv2 底模支持 32k/48kv1 底模支持 32k/40k/48k见configs/下的 jsonWAV / MP3 均可每段 5–10 秒为宜避免过长的单文件清洗与分割步骤用 UVR5 选项卡或提前在外部工具里分离人声、去掉混响切掉静音和杂音片段统一音量切成 5–10 秒小段文件名避免中文和空格ffmpeg 读这类路径容易报错写入文件列表时也可能出 utf8 错误过一遍目检把明显坏掉的片段删掉参数与训练跑通你的第一个音色在训练选项卡里把文件夹路径填好点一键训练就会自动走完数据集切片 → 提取音高和特征 → 训练模型 → 训练索引。新手配置以 v2 48k 为例默认值即可用采样率48k音高算法rmvpe默认batch_size4默认显存紧张就降到 1–2total_epoch按数据质量定下面有对照唱歌场景务必勾选模型是否带音高指导按情况调优你的情况建议数据高音质、底噪低、时长足epoch 拉到 100–200模型会更稳音色泄露更少数据音质一般、底噪偏大epoch 20–30 就够调得再高也带不上去显存不足约 6GB 及以下batch_size 降到 1–2程序会自动按显存切 fp32 并降低切片参数想加速音高提取从 rmvpe 换 pm / dio质量略降但快很多一个简短案例15 分钟高质量清唱数据RTX 306012GB48k rmvpebatch_size 4、epoch 100训练约一小时出模型随后生成索引用同一句人声做前后对比音色替换干净、无明显哑音。训练脚本本身在 infer/modules/train/train.py。验证与调参索引生成和 Index Rate模型训练完不是终点还有两件事生成特征索引一键训练会顺手做如果结束后assets/indices/里没有added_开头的.index文件常见于大训练集卡住索引步骤回到训练选项卡单独再点一次训练特征索引即可。调 Index Rate这是检索机制的总阀门范围 0–1默认 0.75。调高 更死板地贴近训练集音色抑制泄露但音质跟着训练集走调低 更多利用输入源和底模音质可能更好但音色开始往输入源靠。训练集优质、时长够时这个参数没那么重要训练集一般时0.6–0.8 之间小步试。效果对比方法固定同一段输入音频分别用 index_rate 0.5 / 0.75 / 1.0 各跑一次重点听三点——音色像不像、有没有哑音和电流声、高频是否被抹平。其他常用参数protect默认 0.33防音色过度替换的保护系数、filter_radius默认 3对音高结果做中值滤波削弱哑音、音调f0_up_key半音偏移唱歌调音域用。排错速查安装、训练、推理各几条安装类报错llvmlite.dll加载失败装 Windows 的 VC 运行库VC Redistributable x64重启 WebUI。ffmpeg / utf8 报错先怀疑路径——带空格、括号或中文的路径都会坑音频文件挪到纯英文路径再试。CUDA OOM训练就缩小batch_size缩到 1 还不够只能换卡推理就调小 configs/config.py 末尾的x_pad、x_query、x_center。4GB 以下显存基本无解。训练类一键训练结束但没索引点训练特征索引补一次FAQ 里说明过这类假报错。张量尺寸不匹配的 RuntimeError去wavs16k/里找明显偏小的音频文件删掉再训练另外训练中途别改采样率要改就换新实验名重来。找不到能分享的模型logs/实验名/里的数百 MB pth 是训练状态存档真正用来推理和分享的是weights/下 60MB 的 pth如果只有大文件用 ckpt 处理选项卡提取小模型。推理类训练完推理里没这个音色先点刷新音色还没有的话看logs/实验名/下的训练日志确认是否真的训完。实时变声延迟高换 ASIO 声卡驱动官方数据170ms → 90ms或降低采样率、换更快的音高算法。更细的问题可以直接查 docs/cn/faq.md英文训练技巧见 docs/en/training_tips_en.md。用它做什么游戏与直播实时变声go-realtime-gui.bat启动实时界面麦克风进、人声出。AI 歌手清唱数据训练 带音高指导输入伴奏或他人演唱即可换声演唱。影视/有声书配音批量推理选项卡一次处理整段音频统一角色音色。多语言本地化同一音色模型跨语言推理产出音色一致的各语种版本。歌曲制作先用 UVR5 分轨再对人声做音色替换。硬件与进阶三档配置怎么选档位显卡参考显存用法建议入门GTX 1060 / RTX 20606GBbatch_size 1–2epoch 20–50能训能推进阶RTX 306012GBbatch_size 4–8epoch 100–200主流玩法高配RTX 3090 / 409024GB大 batch、多模型并行、批量实时应用进阶玩法一笔带过批量训练可用tools/infer_batch_rvc.py之类的脚本跑批模型融合在 ckpt 处理选项卡里用 ckpt-merge 把两个音色按权重混合得到新音色。导出 ONNXinfer/lib/onnx_inference.py有推理演示可把推理搬到无 NVIDIA 显卡的机器上。资源导航中文 FAQdocs/cn/faq.md英文训练技巧docs/en/training_tips_en.md全局配置显存自适应、切片参数configs/config.py各采样率训练配置在 configs/v1/ 与 configs/v2/训练代码infer/modules/train/推理与合成管道infer/modules/vc/预训练模型下载脚本tools/download_models.py命令行推理入口tools/infer_cli.py不依赖 WebUI 做批量处理结语RVC 的门槛在数据而不在参数先录一份干净的低底噪声音默认设置一键训练再用 index_rate 把音色对齐到满意为止。剩下的是持续迭代——多换几批数据、多对比几次输出模型效果会稳定地往你预期的方向走。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考