RVC AI变声器从零基础到30分钟训出可用音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI双击go-webui.bat先报No module named torch装完依赖黑窗又崩WebUI 终于打开时推理音色列表是空的——这是绝大多数人第一次跑 RVC 时的真实开场。RVCRetrieval-based-Voice-Conversion-WebUI是一个语音音色转换训练框架10 分钟低底噪音频、4GB显存的普通显卡就能训出一个可反复使用的 AI 变声模型全程在网页界面点按钮。这篇文章带你把第一个模型完整跑通。 开工前硬件与版本自检这节解决我的机器能不能跑、版本会不会装错的问题。RVC 当前分支只面向Python 3.12 x64装错解释器版本后面会连环报错。组件推荐值踩坑说明Python3.12x643.10/3.11 都不是目标版本依赖按 3.12 锁死操作系统Ubuntu 24.04 x86_64 / Windows 10Ubuntu 服务器记得带--noautoopen显卡显存4GB起显存低于 4GB 或 SM 低于 5.3 的卡会被自动判为不可用程序退回 CPU4GB 以下的卡如 1060 3G建议直接放弃推理精度自动新卡自动 fp16Pascal/GTX 16 系自动降 fp32不用你操心FFmpeg系统自带 / Windows 放根目录Windows 需把ffmpeg.exe和ffprobe.exe放到项目根目录否则音频解码全线报错依赖隔离venv用系统 Python 直装会污染全局环境重装很难受最快自检命令装系统依赖前跑一遍python --version ffmpeg -version nvidia-smipython --version必须落在 3.12nvidia-smi能看到显卡和显存就说明驱动正常。 安装最短路径装完这节只给能跑起来的最短命令序列每步一句说明。平台差异一句话带过Windows 全程用 PowerShell命令相同source换成.venv\Scripts\activate。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI克隆仓库后面所有命令都在仓库根目录执行。python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip setuptools wheel创建并激活虚拟环境升级打包三件套防止后面的安装踩 setuptools 的坑。按显卡类型装依赖三选一# CPU / AMD / Intel 独显Windows 上 AMD 独显走 DirectML python -m pip install -r requirments_cpu_py312.txt一条命令装完CPU 与 DirectML 环境都是单阶段。# NVIDIA RTX 50 系以前两阶段先装 CUDA 11.8 的 torch 2.7.1 python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 \ --index-url https://download.pytorch.org/whl/cu118 \ --extra-index-url https://pypi.org/simple python -m pip install -r requirments_cu118_py312.txtRTX 50 系以前用 CUDA 11.8 配对RTX 50 系把上面两处cu118换成cu128、依赖文件换成requirments_cu128_py312.txt顺序不变。torch 版本不能自己往上抬第二阶段的依赖文件是按 2.7.1 锁的。装完验证 PyTorch 能不能看见你的卡python -c import torch; print(torch:, torch.__version__); print(cuda:, torch.version.cuda); print(cuda available:, torch.cuda.is_available())cuda available: True才算装对。补齐预训练底模和音高权重从 Hugging Face 模型仓库拉取路径必须保持如下结构python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main \ --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \ --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main \ --include pretrained/* pretrained_v2/* --local-dir assets hf download lj1995/VoiceConversionWebUI mute.zip --revision main \ --local-dir .model-downloads python -m zipfile -e .model-downloads/mute.zip logshubert_base/是特征提取器rmvpe.pt是音高提取权重pretrained/与pretrained_v2/是 v1/v2 训练的底模logs/mute/是静音样本——缺任何一块对应环节都会罢工。只做人声伴奏分离的话再补--include uvr5_weights/* --local-dir assets这一条。 首次跑通最小必要步骤这节列能出第一段变声音频的最少动作每步都给成功标志。假设你已有一个装着 WAV 的素材文件夹总时长10~50分钟。启动 WebUIpython webui.py成功标志黑窗打印当前设备cuda:0 | 推理精度torch.float16CPU 环境则是cpu/torch.float32浏览器自动打开7865端口的 RVC 页面。端口被占时程序会沿 7865 往上自动找空闲端口以浏览器实际打开的地址为准。「训练」页签实验名填mi-test训练文件夹路径填素材目录说话人 id 保持0点「处理数据」。成功标志状态窗显示【数据切分】已完成logs/mi-test/0_gt_wavs/下出现切片后的 WAV。点「特征提取」音高算法默认 rmvpe不用动。成功标志logs/mi-test/2a_f0/和3_feature768/下生成.npy文件。「是否仅保存最新的ckpt文件以节省硬盘空间」选「是」防爆盘点「训练模型」。成功标志日志出现Training is done. The program is closed.。这句话之后紧跟的报错是假的直接忽略。训练默认不会把小模型落到assets/weights/。进「ckpt处理」页签最下面「模型提取」模型路径填logs/mi-test/下G_开头的大文件点路径会自动带出采样率、是否带音高、版本保存名填mi-test点「提取」。成功标志assets/weights/下出现60MB的mi-test.pth。「训练」页点「训练特征索引」。成功标志assets/indices/下出现added_开头的.index文件。回「模型推理」页点「刷新音色列表」下拉框选中mi-test传一段你自己的音频点「转换」。成功标志页面下方出现可播放、可下载的输出音频音色变成了训练集里那个人的声音。到这一步RVC 的完整闭环就走通了一次。 核心流程主线怎么走主线就是「数据准备 → 训练 → 推理」三段。理解一次后面反复调参才有底气。️ 数据准备切片参数怎么设这步在干嘛把素材文件夹里所有音频按静音切段、响度归一化输出训练用 WAV 和 16k 降采样版。切片由train/preprocess.py驱动阈值-42dB、单片默认约3.7秒都是写死的合理值你主要管三个入口参数参数推荐值为什么这么设目标采样率默认40k追求音质选48k必须与 configs/ 下的模型配置对齐训练中途换采样率等于白训模型是否带音高指导唱歌选True纯语音可 False带音高的模型唱歌时音准更稳语音场景关掉能省一步特征提取素材总时长10~50分钟太短学不到音色音质高、音色统一可以更多1 分钟以下基本不可复现️ 训练关键参数对照这步在干嘛基于底模微调出你的音色同时生成特征索引。训练入口在 train/ 目录WebUI 会自动拼命令行。参数默认值为什么这么设版本v2参数更大、效果更好底模在assets/pretrained_v2/batch_size自动 最小显存 / 2显存紧张就往下压最低1别手填 40 赌运气total_epoch默认20高质数据可到200低质底噪大的训练集 20~30 轮足够拉太高只会过拟合底噪保存频率 save_every_epoch5每隔几轮留一个 ckpt方便事后挑中间模型缓存所有训练集至显存小数据10min选「是」加速训练大数据会炸显存选「否」每次保存时输出小模型到 weights建议「是」训练中途崩了也能拿到可用的小模型少一次手工提取 推理索引与模型两个文件缺一不可这步在干嘛用训练好的小模型 检索索引把输入音频换成目标音色。单次推理页的参数值得逐个认识参数默认值作用检索特征占比 index_rate单次0.75/ 批量1调高保音色、调低保音质后面进阶节细讲音高提取算法rmvpe效果最好最省资源pm作备选fcpe是 CPU 场景变调0半音数男转女常见 -3~-5女转男 3~5保护清辅音和呼吸声 protect0.33防电音撕裂调低保护更狠但索引效果变差后处理重采样0不重采样输出采样率与训练采样率一致最稳 排障记录按阶段对号入座先看症状定位阶段再照解法走。以下均来自 docs/cn/faq.md 收录的真实高频问题。️ 环境类装不上、起不来症状可能原因解法优先级llvmlite.dll缺失Could not load shared object file缺 VC 运行库安装 VC 2015-2022 可再发行包x64后重启 WebUI高WebUI 弹Expecting value: line 1 column 1 (char 0)系统/全局代理干扰关闭本地与远端代理服务器配了 http_proxy 的要 unset 掉再试中Connection Error/ 页面打不开黑窗控制台被关了或端口异常保持启动窗口常开确认浏览器地址与窗口打印的端口一致中ffmpeg error/utf8 error路径带空格、括号或中文训练集和实验名改用纯英文、无空格路径高️ 训练类跑一半崩症状可能原因解法优先级Cuda out of memory显存不够batch_size 往下压到 14GB 以下换卡高The expanded size of the tensor ... must match16k 文件夹里有异常小的坏音频找出1_16k_wavs/里显著偏小的文件删掉重新点训练模型中文件页面 / 内存 errorCPU 进程开太多把内存撑爆拉低「CPU 进程数」手动把长音频切短中训练成功但assets/indices/没有added_索引大训练集把内存式加索引卡住了再点一次「训练特征索引」中 产出类训好了却用不了症状可能原因解法优先级推理页看不到新音色没刷新 / 小模型不在assets/weights/先点「刷新音色列表」没有则去 ckpt处理提取小模型高推理报f0、tgt_sr等 key 不存在把logs/下几百 MB 的训练 ckpt 当推理模型用用 ckpt处理页签提取 60MB 小模型后再推理中音色对但偶尔怪索引占比或保护参数不合适调 index_rate 与 protect 对比试听见进阶节低️ 进阶调优把效果再拉一档index_rate 的取舍训练集音质高于推理源时拉到0.8~1保音色理论上1可完全杜绝源音色泄露但音质会向训练集靠拢训练集音质偏低时反而应降到0~0.4保清晰。代价是两端跷跷板要么更像要么更干净。长而优质的训练集本身不易泄露音色此时索引几乎可以不建。ckpt-merge 融合音色在「ckpt处理」页签把两个.pth按权重揉成新音色新手从0.5 : 0.5起步。适合A 的咬字 B 的音色这类需求代价是每次融合要重新试听对比且两个模型采样率与是否带音高必须一致。用保存频率挑中间模型把 save_every_epoch 设5训完不一定要用最后一个 epoch。对logs/实验名/下不同轮次的G_文件分别做模型提取、同一素材对比试听常能发现中期某轮最自然。代价是磁盘占用变多用「仅保存最新 ckpt」可对冲。❌ 误区澄清一句话戳破❌ 直接把logs/下几百 MB 的 ckpt 发给别人用 / ✅ 分享assets/weights/下 60MB 小模型 对应.index大文件是实验状态存档拿去推理会报 key 不存在❌ 低质底噪大的训练集硬拉 200 轮 / ✅ 20~30 轮就停底模音质带不动低质训练集多训只会把底噪也学进去❌ 训练中途改采样率接着跑 / ✅ 换实验名从头训想省事就把上次的0/1/2/2b特征目录拷过去加速❌ 随手装最新版 torch 再装依赖 / ✅ N 卡先装2.7.1cu118/cu128配对再装依赖文件顺序不能反❌ 4GB 显存按界面上限填 batch_size40 / ✅ 用自动推荐值显存/2OOM 了就压到1 验收清单 继续深挖三条全部满足才算真正跑通训练日志出现Training is done. The program is closed.且assets/weights/下多出60MB的.pth小模型。assets/indices/下有added_开头、与本实验对应的.index文件。推理页刷新音色后能选到新模型转换出声音色与训练集对得上。差哪条就回对应章节定位第 1 条查训练类排障第 2 条补点「训练特征索引」第 3 条先确认模型是不是提取过的小模型。继续深挖的入口官方常见问题全表docs/cn/faq.mdWebUI 里也有「常见问题解答」页签内容同源训练超参底模配置configs/v1/与v2/按采样率分文件训练主脚本与切分逻辑train/推理管线infer/人声伴奏分离工具链tools/uvr5/素材含伴奏时先用它分离出干净人声多语言文档docs/ 下按 en/jp/kr/pt 等分目录存放第一次跑通只是及格线。把素材切干净、参数对着表改、报错按阶段查RVC 的调音过程比想象中可控——慢慢听、慢慢调好声音值得多花几次对比试听。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考