10分钟训练出你的第一个AI声音模型:RVC变声WebUI完整新手实战指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
想让AI用你的声音翻唱一首歌,或者让喜欢的歌手的音色演唱你写的词?这不再是实验室里才有的黑科技。开源项目Retrieval-based-Voice-Conversion-WebUI(社区简称RVC)就是为此而生的免费AI变声工具:你只需10分钟左右的语音素材,就能在网页界面上训练出一个可用的声音模型,再上传任意音频完成音色转换。准备好了吗?跟着这篇指南,从安装到做出第一首"AI翻唱",一次跑通。
🎯 它是什么 · 为什么值得用
RVC 是一个基于 VITS 的变声(Voice Conversion,即把一段人声"换音色"而不改变唱腔和旋律)框架。它最核心的设计是检索式特征替换:推理时从训练集的声学特征中检索最相似的一段,替换输入源的音色特征,从根本上解决"音色泄漏"(输出音色被原唱带偏)的问题。
这对新手意味着三件实事:一是数据门槛极低,推荐 10 分钟低底噪语音,精简的高质量素材 5~10 分钟也能出好效果;二是显卡不挑剔,普通 4G 显存显卡就能推理,还支持 NVIDIA/AMD/Intel 三种加速路线(对应 N卡、AMD、Intel 三套依赖清单);三是全家桶式功能,网页界面里内置了 UVR5 人声分离(把人声和伴奏拆开)、一键训练、音高提取(默认推荐最新的 RMVPE 算法,显著减少"哑音"问题)、模型融合等能力,全部 MIT 协议免费商用。
🚀 快速上手:从 0 到跑通
以下命令按顺序复制执行即可,全程不需要你改任何代码。
1. 克隆项目
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI2. 安装依赖(要求 Python 3.8+,先装好 PyTorch)
pip install torch torchvision torchaudio然后按你的显卡选一份清单:
- NVIDIA 显卡:
pip install -r requirements.txt - AMD 显卡(Linux/ROCm):
pip install -r requirements-amd.txt - AMD/Intel 显卡(DirectML 方案):
pip install -r requirements-dml.txt - Intel 显卡(Linux/IPEX):
pip install -r requirements-ipex.txt
3. 安装 ffmpeg(RVC 用它读取和切分音频,必装)
sudo apt install ffmpeg # Ubuntu/Debian brew install ffmpeg # macOS # Windows:把 ffmpeg.exe / ffprobe.exe 放到项目根目录即可4. 准备预训练模型
RVC 需要几组底模文件(hubert_base.pt、pretrained 底模、RMVPE 音高模型等),存放清单写在了 README.md 的"其他预模型准备"一节,项目 tools/ 目录里也提供了批量下载脚本dlmodels.sh/dlmodels.bat,按清单把文件放进对应目录(assets/hubert/、assets/pretrained/等)。
5. 启动 WebUI
python infer-web.pyWindows 用户直接双击go-web.bat,macOS 用户执行sh ./run.sh均可。浏览器打开后看到带数字编号的选项卡界面,就大功告成了。
🎤 核心功能实操:训练 + 推理一次走完
打开 WebUI 后,界面按流程编号:0-数据集处理 → 1-UVR5人声伴奏分离 → 2-一键训练 → 3-训练索引 → 4-推理 → 5-ckpt。
第一步:备料。把训练用的干声(纯人声、无人声伴奏混入)WAV 放进一个文件夹,在"0-数据集处理"里选择该文件夹作为训练集,点击"一键训练"前的预处理按钮(或直接在 2 号选项卡点"一键训练",它会自动串联所有步骤)。
第二步:训练。关键参数建议如下:
| 参数项 | 推荐值 | 作用说明 |
|---|---|---|
| 训练轮数 total_epoch | 素材含底噪取 20~30;高音质长素材可到 200 | 轮数过高会把底噪"学进去",不是越多越好 |
| 批量大小 batch_size | 按显存调整,4G 显存可从 1~2 起步 | 越大训练越快、越费显存 |
| 音高算法 f0 方法 | rmvpe(默认) | 效果最好且比 harvest 更快、占用更小 |
| 保护程度 protect | 0.33(默认) | 保护辅音等高频成分,值越大越不容易"糊" |
训练成功后,assets/weights/下会生成一个60+MB 的 pth 模型(这才是该分享/推理用的文件),logs/实验名/下还会生成added_xxx.index索引文件(声音检索数据库)。
第三步:推理。切到"4-推理"选项卡,刷新音色、选中刚训练的模型,上传源音频:
| 参数项 | 推荐值 | 作用说明 |
|---|---|---|
| 索引比率 index_rate | 0.3 ~ 0.66 | 越高越贴训练集音色(防泄漏),越低越吃推理源音质 |
| 音高 key | 0 为原调,+12 升八度,-12 降八度 | 男转女常用 +12,女转男用 -12 |
| 输出路径 | assets/logs 下的实验文件夹 | 转换结果会保存在这里 |
点击"转换",几十秒后就能听到成果——如果训练集里有明显的人声痕迹,恭喜,你的 AI 歌手已经会唱歌了。
🎬 实战:把一首歌变成"你的声音"翻唱
给你个有画面感的目标:晚上,你上传一首原唱,几分钟后 AI 用目标音色完整唱出副歌。完整流程如下:
- 拆人声:在"1-UVR5"选项卡里对原唱歌曲做分离,得到干净的人声轨——这是推理质量的地基,混着伴奏的源音频会让音色发虚。
- 选音色:用自己 10 分钟录音训练的模型,或直接选用一个已发布的 pth 模型(放到
assets/weights/后刷新音色)。 - 调参数:
f0 方法选 rmvpe,index_rate从 0.5 起步,音高 key按声线差值设定(男源转女目标就 +12)。 - 转换试听:先转一小段副歌验证音色对不对,满意后再整曲跑完。
- 合体:把 AI 人声和第一步分离出的伴奏在任意音频软件里对齐合并,一首属于你的 AI 翻唱就完成了。
想更进一步玩实时变声?运行go-realtime-gui.bat(实时变声界面源码在 tools/rvc_for_realtime.py),选好转音设备即可边说边变声,端到端延迟已优化至170ms,使用 ASIO 设备可压到90ms,几乎无感。
⚙️ 进阶指南:调优与技巧
基础跑通之后,这些"旋钮"能让你的模型更上一层楼:
- 模型融合:用"5-ckpt"选项卡里的 ckpt-merge,把两个模型按权重混合,能调出更自然、更接近理想音色的结果(比如 70% 真人 + 30% 风格化模型)。
- 批量推理:不想一个个点"转换"?命令行直接跑 tools/infer_batch_rvc.py,一个文件夹全部转完:
python tools/infer_batch_rvc.py --model_name 实验名 --input_path ./input_wavs --f0method rmvpe --f0up_key 0- API 集成:项目自带两套接口,api_240604.py 是推荐的最新版,可以把它嵌进你自己的自动化流程或前端服务里。
- 显存与速度优化:训练爆显存就降 batch_size;推理阶段可在 configs/config.py 里调小
x_pad、x_query等检索窗口参数来省显存;4G 以下显存建议放弃训练、只做推理。 - ONNX 导出:追求推理速度可以用 tools/export_onnx.py 导出 ONNX 模型,配套演示见 tools/onnx_inference_demo.py。
⚠️ 避坑指南:常见问题与排查
以下每一条都来自社区高频问题(完整版见 docs/cn/faq.md),按"现象 → 原因 → 解决"对号入座:
| 现象 | 原因 | 解决 |
|---|---|---|
| 报 ffmpeg error / utf8 error | 音频路径带空格、括号等符号,或含中文 | 把训练集目录改成纯英文、无空格的路径 |
| 训练显示 "Training is done" 却没有索引文件 | 训练集过大导致加索引卡住 | 回"3-训练索引"选项卡手动再点一次"训练索引" |
| 推理列表里找不到新训练的音色 | 音色列表未刷新 | 点"刷新音色";还没有就去logs/实验名/看训练日志 |
| 分享模型后别人用不了 | 分享的是logs/下几百 MB 的训练断点,不是推理模型 | 只分享assets/weights/下 60+MB 的 pth 及对应 index 文件 |
| Cuda out of memory | 显存不足 | 训练降 batch_size;推理调小 config.py 末尾的检索窗口参数 |
| 浏览器 Connection Error | 误关了黑色控制台窗口 | 保持控制台窗口开启 |
| 弹 "Expecting value: line 1 column 1" | 开了局域网/全局代理(含远程主机的 http_proxy) | 关闭客户端与服务端代理后再访问 |
| 训练时报文件/内存 error | CPU 进程开太多、音频切得太长 | 拉低"提取音高和处理数据使用的CPU进程数",手工把长音频切短 |
🎉 现在,轮到你了
你的第一个 AI 歌手只差三步:
- 录一段10 分钟安静的干声素材(手机在安静房间录的即可);
- 按上面的流程装环境、启动 WebUI,跑完一次一键训练;
- 挑一首你熟悉的歌做推理,把结果发到社区听大家挑毛病——迭代两轮,音色相似度会让你自己都惊讶。
想查参数细节,读一读 docs/cn/faq.md 和 docs/en/faq_en.md;想追踪新特性,看 docs/cn/Changelog_CN.md。遇到问题直接在社区提问,RVC 拥有中文、英文、日文、韩文等多语言活跃社区,你的问题大概率已经有人踩过坑并写好了答案。
麦克风准备好了,按下录制键吧——十分钟后,你会听到"另一个自己"在唱歌。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考