5秒音频克隆一个人的声音GPT-SoVITS零样本语音克隆实战记录【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本语音克隆 TTS 项目5 秒参考音频零样本合成1 分钟干净录音即可微调中、英、日、韩、粤五种语言可跨语言推理。下面是实际跑通一遍的流程以及大多数人会卡住的三处。️ 一条命令装好少样本语音克隆环境传统 TTS 流水线要先录几十分钟干净素材再等几个小时训练出第一条样本。GPT-SoVITS 把素材门槛降到 5 秒参考音频1 分钟录音就能微调出一个稳定模型。硬件不用高端install.sh 支持 CUDA 12.6/12.8、ROCM、MPS、CPU 五种 device 选项测试环境覆盖 Python 3.10-3.12 与 PyTorch 2.5.1没有独显也能跑 CPU 版。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 -y conda activate GPTSoVits bash install.sh --device CU128 --source HF # CUDA 版本按驱动选国内网络可换 HF-Mirror 或 ModelScope脚本会自动拉好底模和 G2PW 中文拼音模型不用手动搬。Windows 用户直接下整合包双击启动脚本就行不用进终端。10秒录音零样本几秒出新声音python webui.py # 终端打印地址后浏览器打开 9874 端口页面顶部是四个页签数据集获取、文本处理、模型训练、推理。先尝鲜直接进推理页签填好参考音频文本上传一段 10 秒录音输入要念的文字点合成。几秒后听到的音色已经是那个人的全程没做任何训练。参考音频带噪的话先用内置 UVR5 把嗓音抠出来9873 端口别直接喂原音零样本效果会干净不少。 效果不对先查这三处合成语音出现错字、变调→ 训练文本和音频对不上或语言标签标错 → 把识别文本和音频逐条对照改错后重训 s1。音频带噪、有底噪→ 参考音频本身不干净 → 先用 UVR5 分离出人声或者换个安静环境重录。训练时显存爆掉→ 切片过长一次塞太多帧 → 在数据集获取页签把切片时长调短或把is_half设为True走半精度减少显存占用。用1分钟录音做微调两种用法对一下想更稳补一轮少样本微调顺序严格是数据集获取页签UVR5 分离人声 → 切片 → ASR 自动识别文本 → 逐条校对文本处理页签一键生成 hubert、说话人向量、语义特征三种特征模型训练页签先训 GPTs1再训 SoVITSs2。两个跑完回推理页签选新模型差别一听就知道。不想过界面训练列表格式每行一条、竖线分隔./vocal/a.wav|说话人A|zh|这条音频的文字两种用法摆在一起对比维度零样本模式1分钟微调素材要求5 秒参考音频1 分钟干净录音出结果时间直接推理一句几秒s1s2 训练完成后稳定产出音色贴合度受参考音频质量限制贴合度与稳定性都上一档适用场景快速试听、一次性内容长文朗读、播客化产出跨语言是最有意思的玩法只有中文音色时把目标文本切到英文拿回的仍是这个音色念英文不用另录英文底稿。源码从哪看起以及第一步做什么GPT_SoVITS/AR/— GPT 侧自回归生成音素序列的实现GPT_SoVITS/module/— SoVITS 声学模型结构与 VQ 量化GPT_SoVITS/TTS_infer_pack/— 推理主流程与多语言切换GPT_SoVITS/prepare_datasets/— ASR、特征提取、语义特征三步预处理docs/cn/README.md — 中文文档参数速览先用自己 5 秒人声跑一遍零样本听音色差在哪。不满意再把数据加到 1 分钟做一次微调比反复调参数更实在。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考