
3 个阶段跑通 RVC 变声器从新手环境自检到首个音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一套基于 VITS 架构的检索式语音转换框架也就是社区常说的 RVC 变声器喂10 分钟低底噪素材就能在普通显卡上训出一个可用的专属 AI 音色模型。这篇教程按三件事推进把 RVC WebUI 跑起来、把素材喂给模型、生成索引并试听。读完照做你手里会多出一个能反复调参的音色模型以及一套出问题时按图排查的速查表。开跑自检先查三类前置条件RVC 安装教程里九成翻车不在代码在前置条件没打齐。先过下面这份清单缺哪条补哪条再动终端。硬件与版本显卡显存≥ 4GB—— 4GB 以下训练基本跑不动能训但会反复爆显存Python3.8~3.1064 位—— 3.11 容易触发llvmlite依赖冲突报错位置绕、不好修FFmpeg5.0—— 切音频、转采样全靠它Windows 用户可把ffmpeg.exe直接放项目根目录PyTorch2.0版本必须和系统 CUDA 匹配 —— 对不上会训练慢、推理怪排查成本很高环境隔离用venv或 poetry 隔离依赖 —— 装进系统 Python 会污染全局环境日后卸载和升级都是事故现场素材手头有至少10 分钟同音色、低底噪的音频 —— 现在没有可以先记着阶段二前补上即可两条命令验证地基都能正常打印版本信息就合格python --version ffmpeg -version阶段一配置 RVC 环境并启动 WebUI完成标志浏览器能打开 RVC WebUI 界面。按显卡装依赖先装 PyTorch 全家桶匹配你的显卡再拉一份依赖清单。N 卡用requirements.txtA 卡、I 卡用仓库里对应的-dml/-ipex变体——装错变体RVC 运行时找不到加速路径训练会慢一个量级。pip install -r requirements.txtCUDA 对不上时RTX30 系最常见装 PyTorch 这一步指定cu117源。装完看一眼终端输出torch相关包没有红色报错再往下走。补齐预模型与音高权重训练和推理都依赖assets/下的一批预模型assets/hubert/特征提取、assets/pretrained底模、assets/uvr5_weights人声分离要用 v2 底模再补assets/pretrained_v2。缺哪一份流程就会卡在哪一步不如一次补全。想要最好的音高提取效果把rmvpe.pt放到项目根目录。tools/里附了下载脚本照着跑一遍即可自动填好目录。启动 WebUI 并验证端口启动命令只有一条默认监听7865端口想换用--port传参python infer-web.py浏览器打不开时先确认7865是否被别的进程占了netstat -ano | findstr :7865占了就换个空闲端口重启另外注意那个黑色控制台窗口它一关 WebUI 立刻断训练期间尤其别碰。完成标志浏览器能打开 WebUI文件管理选项卡能正常加载。阶段二训练首个 RVC 音色模型完成标志weights/目录出现 60MB 的.pth模型文件。素材规格48k 统一单段 5~10 秒把素材统一转成 WAV采样率对齐48k剪掉首尾静音和明显底噪再切段。质量优先于数量总量10~50 分钟最稳——太短学不到音色太长只是拖慢训练。项目建议值不达标会怎样格式 / 采样率WAV、48k与训练配置configs/v1/48k.json对不齐会中途报错采样率中途不可改改就得换实验名重训单段时长5~10 秒过长容易爆显存、报张量尺寸错总时长10~50 分钟低于 10 分钟音色不稳音质高、音色统一可以再多底噪越低越好底噪大时别把训练轮数拉高会连噪声一起学进去训练关键参数先看三个训练选项卡里先认准这三个参数再点开始batch_size默认4—— 每次迭代处理几段音频显存紧张就先降它最低到1先跑通再谈速度total_epoch—— 按素材质量定低质20~30轮够用高质可到200轮数过多会过拟合声音发死learning_rate默认1e-4支持fp16的显卡默认开启 —— fp16 省一半显存、提速明显不用手动干预训练代码入口在infer/modules/train/参数就定义在那里你不需要读源码知道去哪查就行。显存自适应这四个参数别手改RVC 会按实际显存自动收缩configs/config.py末尾的x_pad/x_query/x_center/x_max——它们控制单次训练序列的长度显存越小序列越短。知道它们存在即可手动改会打破它算好的平衡4GB 显存手动拉满就是直接 OOM。完成标志日志显示训练完成weights/里多出一个60MB的.pth。注意别把logs/下几百 MB 的大.pth当模型——那是训练存档不是能直接推理的成品。阶段三生成索引并试听完成标志出声且音色对得上。模型和索引缺一不可一个可用音色由两个文件组成模型是weights/下的.pth检索索引是assets/indices/下的added_*.index。模型决定像谁索引决定音色保多少——缺索引推理页刷不出你的新音色这是新手最常见的一步卡点。训练索引→刷新音色→试听按顺序做三步点训练索引生成索引 → 到推理选项卡点刷新音色看到新模型 → 选中它、设好参数、点转换。生成后回assets/indices/确认有同名的added_*.index。推理参数抓三个重点Index Rate推荐0.6~0.8—— 它在音色像不像和音质高不高之间做取舍拉满1理论上完全杜绝源音色泄露但声音会贴向训练集本身的音质。训练集音质高于推理源就调高反过来调高只会更糊音高提取选RMVPE—— 效果最好、最省资源和阶段一放根目录的rmvpe.pt配套采样率与训练保持一致 —— 不一致会直接掉音质别省事完成标志转换出的音频出声、音色和目标对得上无明显机械感与杂音。故障速查四类情况对号入座按装不上 / 起不来 / 训崩了 / 听不出分组先看症状再执行动作别乱试分组症状原因与动作优先级装不上llvmlite.dll缺失缺 VC 运行库装 VC 2015-2022 运行库后重启高装不上ffmpeg / utf8 报错项目路径含中文或空格移到纯英文无空格路径高起不来浏览器连接失败端口被占或控制台被关查7865--port换端口保持黑窗中起不来Expecting value(char 0)系统/全局代理干扰关本地与远端代理再试中训崩了Cuda out of memory显存不够降batch_size4GB 以下考虑换卡高训崩了tensor 尺寸不匹配wavs16k里混了异常小的坏音频删掉重训中听不出看不到新训练的音色索引没生成或没刷新点训练索引再点刷新音色高听不出推理报 key 不存在把logs/大.pth当模型用了用 ckpt 选项卡提取 60MB 小模型中听不出中途加数据后声音错乱采样率被改过换新实验名从头训或拷贝已提取特征加速中进阶提色从能听到好听跑通只是及格线下面几处能让成品明显更耐听。录音与剪辑细节录音时盯底噪目标低于-60dB—— 环境安静比后期降噪省心得多剪掉首尾静音响度大致归一让每段能量接近训练更稳想做泛化能力增强音高±3 个半音、适度混响、音量±3dB—— 别过量加多了音色发脏用 ckpt-merge 混音色RVC 支持把多个.pth按权重揉成一个新音色进 ckpt 处理选项卡选好要融合的模型新手从0.5 : 0.5起步用不同风格素材对比融合前后把最好听的那个比例记下来下次直接复用。资源地图卡住之后去哪找答案中文常见问题docs/cn/faq.md训练配置configs/依赖配置requirements.txt、pyproject.toml推理核心infer/lib/训练核心infer/modules/train/报错先搜项目Issue与Wiki搜不到再提问附截图和logs/里对应实验的日志先跑通再谈好听。第一个稳定的音色出来之后提色技巧才有用武之地——好声音是调出来的不是猜出来的。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考