
10分钟录音跑通语音转换RVC实战【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI刚录完一段音想换成目标歌手的声线但调音软件学不动。Retrieval-based-Voice-Conversion-WebUIRVC是基于 VITS 的语音转换框架10 分钟低底噪录音就能训出一个能用的变声模型。用 10 分钟录音换 5 种变声玩法场景对应能力量化指标短视频换声线WebUI 批量推理一键转换10 分钟低底噪数据即可开训训一个固定音色一键训练 top1 检索替换源特征推荐训练集 10–50 分钟机制上杜绝音色泄漏直播、游戏实时变声独立实时变声界面端到端 170msASIO 设备下 90ms人声伴奏分离内置 UVR5 分离模型6 个预置权重 1 个 onnx低显存机器跑推理按显存档位自动降级配置4G 显存可推理自动切 fp32与多数同类方案最大的差异RVC 用 top1 检索把输入源特征直接替换成训练集特征音色泄漏在机制层面被解决而不是靠调参硬压。底模用接近 50 小时的 VCTK 开源训练集训成无版权顾虑。训练推理界面训练、批量转换python infer-web.pyWindows 也可双击 go-web.bat。实时变声界面直播、游戏双击 go-realtime-gui.bat。从 clone 到打开网页的一条线装法a. 系统要求Python 3.8torch 2.0、gradio 4.11 系见 pyproject.tomlN 卡、A 卡或 I 卡显卡推荐 4G 显存起步系统里可用 FFmpeg 与 FFprobe磁盘预留约 10GBb. 获取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUIc. 按硬件装依赖先执行pip install torch torchvision torchaudio。如果你是 N 卡用户 → 执行pip install -r requirements.txt。如果你是 A 卡或 I 卡用户 → 执行pip install -r requirements-dml.txt。如果你是 Linux 上的 A 卡 ROCM 或 I 卡 IPEX 用户 → 分别装requirements-amd.txt/requirements-ipex.txt。MacOS 用户直接sh ./run.sh即可。d. 下预训练模型# Windows tools\dlmodels.bat # Linux / MacOS先装 aria2 sh tools/dlmodels.sh脚本会把hubert_base.pt、v1/v2 的 G/D 预训练模型、6 个 UVR5 权重和rmvpe.pt全部下到assets/目录A 卡/I 卡用户另备rmvpe.onnx。e. 启动python infer-web.py浏览器打开 http://localhost:7865 configs/config.py 里的默认端口可用--port改Windows 整合包的 go-web.bat 固定用 7897。新手最常碰的 6 个参数怎么调参数默认值什么时候需要动它调优建议x_pad/x_query/x_center/x_maxconfigs/config.py6G3/10/60/655G1/6/38/41≤4G1/5/30/32推理时 CUDA out of memory按显存档位整体下移一档batch_sizeconfigs/v2/48k.json4训练时显存爆掉直接降到 1total_epoch训练页网页自定训练集底噪大20–30 就够硬拉高反而拖音质index_rate推理页0音色往底模跑泄漏0.6 起步拉到 1 基本无泄漏--port启动参数7865端口被占用python infer-web.py --port 8080deviceconfigs/config.pycuda:0多显卡选卡改cuda:后面的卡号显存不足与路径报错的应急排查表报错现象最常见原因一句话解法相关路径ffmpeg error / utf8 error音频路径带空格、括号或中文训练集放全英文路径docs/cn/faq.mdCUDA out of memory显存不够训练降batch_size推理降x_pad等四参数configs/config.py一键训练完没有 added_ 开头的索引训练集太大加索引步骤卡住再点一次训练索引按钮docs/cn/faq.mdllvmlite.dll 加载失败Windows缺 VC 运行库装vc_redist.x64.exe后重启 WebUIdocs/cn/faq.mdExpecting value: line 1 column 1系统代理拦截了请求关掉局域网/全局代理再启动docs/cn/faq.mdtensor 尺寸不匹配17280 vs 0wavs16k 里有坏的小文件删掉显著偏小的音频后重训docs/cn/faq.md第一次变声该从哪几个数入手录音起点先凑 10–30 分钟低底噪 WAV交给一键训练里的自动切片处理别手动切也别用 MP3 做训练源。推理起点index_rate从 0.6 开始音高算法选 RMVPE其他参数先不动听感不对只动这两个数。实时变声普通声卡按 170ms 端到端延迟预期接 ASIO 设备后再冲 90ms。参数解释看 docs/cn/faq.md调参细节看 docs/en/training_tips_en.md。命令全粘完你的第一个变声模型今天就能出。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考