
RVC 音色克隆完整指南用 10 分钟录音做出第一个 AI 翻唱【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI是一个开源语音转换工具录一段 10 分钟的干净人声训练出专属的音色克隆模型再把任意音频换成这个音色。它支持网页界面一键操作也能做到端到端 90ms~170ms 的实时变声。RVC 能帮你解决什么问题AI 翻唱过去想克隆一个歌手的音色得收集数小时无伴奏干音再慢慢调参现在 10 分钟左右的录音就能训出可用的模型录歌、上传、试听一个下午就能出第一版翻唱。视频换声创作者想给视频换掉旁白人声过去要么自己重新配音要么花钱请配音员用 RVC 先把目标音色训练好再把视频原声丢进去转一遍语气和节奏保持不变只换音色。有声书配音多角色有声书以前每个角色都要单独找人录用 RVC 给不同角色各训一个小模型同一份稿子批量生成不同演员的声音成本和时间都省下来。RVC 能力一览能力一句话说明适合谁低数据训练10 分钟低底噪录音即可训出可用模型推荐配置 4GB 显存起步新手、个人创作者实时转换离线转换走网页界面实时模式端到端延迟 170ms用 ASIO 声卡可压到 90ms直播、K 歌、变声场景多语言支持文档覆盖中、英、日、韩、法、土、葡等 8 种语言见docs/目录不同语言环境用户社区生态内置 UVR5 人声分离把歌声和伴奏拆开支持 ckpt-merge 混合两个模型音色进阶玩家、模型分享者第一次转换怎么走通第一步RVC 环境安装步骤在 Python 3.8 环境下克隆仓库并安装依赖。NVIDIA 卡用requirements.txtAMD 卡换requirements-amd.txtLinux或requirements-dml.txtIntel 卡用requirements-ipex.txtgit clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt python infer-web.py首次运行前需把预训练底模放进assets/目录hubert/、pretrained/、uvr5_weights/等仓库tools/下有下载脚本并装好 ffmpeg。底模本身用约 50 小时的开源 VCTK 语料训练可放心使用。第二步数据准备 录 10 分钟左右、背景安静的语音存成 WAV。要点只有一个干净——底噪大、混入他人声音或音乐的数据会直接拉低克隆效果。把文件放进一个独立文件夹超过 10 秒的长音频可以先用界面里的切片工具slicer自动把长音频切成小段处理。第三步RVC 训练参数怎么设打开网页界面后按数据集创建 → 一键训练走它会自动完成音高提取F0记录说话时的音调变化、特征提取和训练。默认学习率是 1e-4显存紧张如 4GB就把 batch size 调小牺牲一点速度换稳定采样率选 32k 或 48k训练完会同时产出模型文件.pth和索引文件.index。第四步转换试听进入推理界面选刚训好的 .pth 和 .index上传一段目标音频可以是别人的干声。男声换女声一般把音调pitch调到 4女声换男声调 -12点转换试听不满意就回到音调或索引权重上微调。RVC 转换效果不理想的排查思路现象先查什么怎么调转出来有毛刺、气泡音训练音频里是否混入杂音、笑声、他人声音用内置 UVR5 先把人声分离出来再重训仍不行就换一批更干净的录音音色不像味儿差一截训练数据是否够 10 分钟、是否单一说话人加料重训若只是音调错位先核对 pitch 设置再考虑换音高提取方式RMVPE 默认最稳实时变声有明显延迟音频设备缓冲区是否过大、驱动是否支持 ASIO把缓冲区调到最小可用值换 ASIO 输入输出设备目标压到 90ms 以内 排查时一次只改一个变量改完重听同一句音频对比才能确认是哪一步起了作用。玩熟之后可以尝试什么实时变声Windows 下双击go-realtime-gui.bat启动实时界面麦克风进、变声出直播和 K 歌都能用命令行方式可看tools/rvc_for_realtime.py。模型分享与融合训好的 .pth 可以发给朋友直接使用界面里还有 ckpt-merge 选项卡能把两个模型按权重混合调出介于两人之间的新音色。参数微调推理页的索引率index rate检索匹配参与程度调高会更像目标音色但更紧调低则更自然训练侧的 batch size、学习率默认 1e-4也都可以按显卡情况微调。常用资源预训练底模库在assets/pretrained/中文 FAQ 在 docs/cn/faq.md多语言训练技巧文档在 docs/ 各语言子目录。从 10 分钟录音到第一支 AI 翻唱RVC 把音色克隆压缩成了一次训练—试听—微调的循环——先录上那 10 分钟剩下的交给界面。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考