
RVC 零基础实战用 10 分钟语音训练专属 AI 变声音色一次跑通【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI社区通称 RVC是基于 VITS 架构的检索式语音转换框架4GB 显存、10 分钟低底噪语音就能训出一个可用的 AI 音色模型。本文把从克隆仓库到浏览器里出声的全程拆成三个里程碑照做即可完成首次训练。成果预览完成后浏览器打开 RVC WebUI默认 http://localhost:7865在「模型推理」选项卡选中自己训练的音色拖入任意音频即可一键转换assets/weights/下生成的 60MB.pth模型文件可直接分享给他人。 开始前的前置条件清单动手前先花 5 分钟核对下表全部通过再进下一步。检查项通过标准自查方法Python 解释器3.12 64 位python --version输出 3.12.x显卡显存N 卡 ≥ 4GBnvidia-smi或显卡设置FFmpeg能打印版本号ffmpeg -version有正常输出项目路径纯英文、无空格、无中文检查 clone 目录训练素材10~50 分钟低底噪语音统计总时长网络可访问 PyPI 与 Hugging Face试下载任意文件⬇️ 里程碑 1安装依赖与下载权重文件在仓库根目录建虚拟环境python -m venv .venv再激活Windows 执行.venv\Scripts\activateLinux 执行source .venv/bin/activate。按硬件安装依赖两阶段执行先装与显卡匹配的 Torch 2.7.1再装对应 requirements 文件文件顶部已内置国内镜像源。CPU/AMD/Intel 卡用requirments_cpu_py312.txtRTX 50 系以前装 CUDA 11.8 版 Torch 配requirments_cu118_py312.txtRTX 50 系装 CUDA 12.8 版 Torch 配requirments_cu128_py312.txt。python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 python -m pip install -r requirments_cu118_py312.txt用python -c import torch; print(torch.cuda.is_available())确认输出True。从 Hugging Face 上的lj1995/VoiceConversionWebUI模型仓库下载权重放到固定位置assets/hubert_base/config.json、preprocessor_config.json、pytorch_model.bin 三个文件、assets/rmvpe/rmvpe.pt音高提取权重、assets/pretrained/与assets/pretrained_v2/v1/v2 底模、assets/uvr5_weights/仅 UVR5 人声分离需要、logs/mute/训练静音样本。通过标准启动后终端打印「当前设备cuda:0」一行且无缺文件告警即环境就绪。️ 里程碑 2启动 RVC WebUI 服务与端口自查全篇必须手动执行的命令只有一条python webui.pyWindows 也可以直接双击go-webui.bat走内置 runtime 解释器监听 7897 端口。服务默认监听端口7865换端口加--port 7866。启动成功后浏览器自动打开注意那个黑色控制台窗口关掉的瞬间服务就断了。现象动作浏览器报 Connection Error服务其实没崩控制台黑窗被关了重新执行启动命令7865 端口被其他程序占用程序会自动顺延到下一个可用端口并打印警告需固定端口就用--port指定️ 里程碑 3从 48k 数据到首个音色模型「一键训练」按 数据切分 → F0 与 HuBERT 特征提取 → 模型训练 → 索引训练 四步自动执行下面按「输入 → 操作 → 输出」拆解。数据准备对齐 48k 规格输入10~50 分钟低底噪清唱统一转 wav每段剪成 5~10 秒放入纯英文目录。操作在一键训练页填训练集目录与实验名纯英文模型版本选 v2采样率48k音高算法选 rmvpe点「一键训练」。输出切分完成后logs/实验名/0_gt_wavs与1_16k_wavs两个目录有文件若状态区显示「失败」先查路径是否含中文空格。参数推荐值说明采样率48k与configs/v2/48k.json对齐中途改必须换新实验名重训单段时长5~10 秒过长增加切分内存压力总时长10~50 分钟音色统一可更长低于 5 分钟难以稳定底噪越低越好目标 -60dB 以下底噪大就压低 total_epoch训练盯住 batch_size 与 total_epoch输入实验名、版本 v2、采样率 48k。操作batch_size保持默认 44~6GB 显存降到 1~2total_epoch按数据质量给——低质 20~30、高质可到 200fp16 半精度由硬件自动判定不用手动改。输出assets/weights/出现60MB的.pth可分享的成品logs/实验名/留有大训练状态 pth 与train.log日志末尾出现Training is done. The program is closed.即训练完成。参数默认调整方向batch_size4报 Cuda out of memory 就降到 1total_epoch20~200低质 20~30高质 200采样率48k全程固定不要中途换版本v2v1 只支持 40k/48kv2 多出 32k音高算法rmvpe速度快、资源省无需更换推理索引与模型缺一不可输入assets/weights/下的.pth 训练流程自动生成的assets/indices/下的added_*.index。操作进「模型推理」页先点「刷新音色列表」再选自己的音色上传 10 秒测试音频变调 0检索特征占比保持0.75点「转换」。输出输出音频区出现转换结果想更贴训练集音色就调高占比想更贴源音频就调低。参数推荐值作用Index Rate0.6~0.8权衡「音色像不像」与「音质高不高」音高提取rmvpe效果最好、最省资源变调0男转女 -12、女转男 12半音数protect0.33保护清辅音与呼吸声电音撕裂就调高 常见卡点按症状走先回答三个问题项目与音频路径是否纯英文无空格7865 端口是否被占、黑窗是否还开着解释器是否 3.12、显存是否 4GB 以上多数「跑不动」都在这三项里。仍解决不了时按下表对症状类别症状解法环境llvmlite.dll缺失安装 VC 2015-2022 运行库后重启环境Expecting value: line 1 column 1 (char 0)关闭本地与服务端的全局代理环境ffmpeg error / utf8 error项目与训练集路径改为纯英文无空格训练Cuda out of memorybatch_size 降到 1仍不行即显存不足 4GB训练Tensor sizes (17280) must match (0)删掉1_16k_wavs里异常小的音频重训推理看不到新音色 / 报 key 不存在点「刷新音色列表」再点一次「训练索引」推理只用assets/weights/的.pthlogs 下大模型走 ckpt 选项卡提取小模型 让音色更对味参数取舍逻辑如果训练集音质高于推理源把 Index Rate 拉到 0.8~1 保住训练集音色代价是结果贴向训练集音质低质训练集不要拉到 1。如果训练集音质低于推理源Index Rate 保持 0.6~0.75拉满只会让输出更糊。如果训练集长且优质模型本身很少泄漏源音色Index Rate 权重下降可以调低甚至不用索引。如果单个模型音色不满意进 ckpt 处理选项卡用 ckpt-merge 把两个.pth按 0.5:0.5 起步融合用不同素材对比记下最好听的比例。如果想要泛化能力可对训练集做轻增强±3 个半音、轻微混响、±3dB 音量注意录音时压低环境底噪远比后期降噪划算。⏱️ 投入多少时间与成本账阶段动作预估耗时环境 权重建 venv、装依赖、下五个权重目录0.5~1 小时视网速数据准备降噪、切 5~10 秒段、对齐 48k约 1 小时训练15 分钟数据、v2、batch_size 4、150 epoch数小时8GB 以上显存推理测试生成索引、换不同素材试、调 Index Rate约 1 小时验收按顺序检查三个信号一键训练状态区四步全部显示「已完成」且assets/weights/新增一个几十 MB 量级的.pth。assets/indices/下出现与实验同名的added_*.index文件。单次推理上传 10 秒原声首次出声即为目标音色同一文件第二次转换结果可复现。 继续深挖常见问题docs/cn/faq.md中文文档目录docs/cn/训练源码train/主入口train/train.py推理核心infer/模型配置configs/v2 48k 对应configs/v2/48k.jsonUVR5 人声分离工具tools/uvr5/下一步挑 10~15 分钟手头现成的清唱素材把「数据切分 → 一键训练 → 索引 → 单次推理」完整走一遍卡住时带上logs/实验名/train.log和控制台截图到项目的 Issue 区提问。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考