☰
10分钟训练出你的第一个AI声音模型:RVC变声WebUI完整新手实战指南
2026/10/7 16:41:20 网站建设 项目流程

10分钟训练出你的第一个AI声音模型:RVC变声WebUI完整新手实战指南

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

想让AI用你的声音翻唱一首歌,或者让喜欢的歌手的音色演唱你写的词?这不再是实验室里才有的黑科技。开源项目Retrieval-based-Voice-Conversion-WebUI(社区简称RVC)就是为此而生的免费AI变声工具:你只需10分钟左右的语音素材,就能在网页界面上训练出一个可用的声音模型,再上传任意音频完成音色转换。准备好了吗?跟着这篇指南,从安装到做出第一首"AI翻唱",一次跑通。

🎯 它是什么 · 为什么值得用

RVC 是一个基于 VITS 的变声(Voice Conversion,即把一段人声"换音色"而不改变唱腔和旋律)框架。它最核心的设计是检索式特征替换:推理时从训练集的声学特征中检索最相似的一段,替换输入源的音色特征,从根本上解决"音色泄漏"(输出音色被原唱带偏)的问题。

这对新手意味着三件实事:一是数据门槛极低,推荐 10 分钟低底噪语音,精简的高质量素材 5~10 分钟也能出好效果;二是显卡不挑剔,普通 4G 显存显卡就能推理,还支持 NVIDIA/AMD/Intel 三种加速路线(对应 N卡、AMD、Intel 三套依赖清单);三是全家桶式功能,网页界面里内置了 UVR5 人声分离(把人声和伴奏拆开)、一键训练、音高提取(默认推荐最新的 RMVPE 算法,显著减少"哑音"问题)、模型融合等能力,全部 MIT 协议免费商用。

🚀 快速上手:从 0 到跑通

以下命令按顺序复制执行即可,全程不需要你改任何代码。

1. 克隆项目

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI

2. 安装依赖(要求 Python 3.8+,先装好 PyTorch)

pip install torch torchvision torchaudio

然后按你的显卡选一份清单:

  • NVIDIA 显卡:pip install -r requirements.txt
  • AMD 显卡(Linux/ROCm):pip install -r requirements-amd.txt
  • AMD/Intel 显卡(DirectML 方案):pip install -r requirements-dml.txt
  • Intel 显卡(Linux/IPEX):pip install -r requirements-ipex.txt

3. 安装 ffmpeg(RVC 用它读取和切分音频,必装)

sudo apt install ffmpeg # Ubuntu/Debian brew install ffmpeg # macOS # Windows:把 ffmpeg.exe / ffprobe.exe 放到项目根目录即可

4. 准备预训练模型

RVC 需要几组底模文件(hubert_base.pt、pretrained 底模、RMVPE 音高模型等),存放清单写在了 README.md 的"其他预模型准备"一节,项目 tools/ 目录里也提供了批量下载脚本dlmodels.sh/dlmodels.bat,按清单把文件放进对应目录(assets/hubert/、assets/pretrained/等)。

5. 启动 WebUI

python infer-web.py

Windows 用户直接双击go-web.bat,macOS 用户执行sh ./run.sh均可。浏览器打开后看到带数字编号的选项卡界面,就大功告成了。

🎤 核心功能实操:训练 + 推理一次走完

打开 WebUI 后,界面按流程编号:0-数据集处理 → 1-UVR5人声伴奏分离 → 2-一键训练 → 3-训练索引 → 4-推理 → 5-ckpt。

第一步:备料。把训练用的干声(纯人声、无人声伴奏混入)WAV 放进一个文件夹,在"0-数据集处理"里选择该文件夹作为训练集,点击"一键训练"前的预处理按钮(或直接在 2 号选项卡点"一键训练",它会自动串联所有步骤)。

第二步:训练。关键参数建议如下:

参数项推荐值作用说明
训练轮数 total_epoch素材含底噪取 20~30;高音质长素材可到 200轮数过高会把底噪"学进去",不是越多越好
批量大小 batch_size按显存调整,4G 显存可从 1~2 起步越大训练越快、越费显存
音高算法 f0 方法rmvpe(默认)效果最好且比 harvest 更快、占用更小
保护程度 protect0.33(默认)保护辅音等高频成分,值越大越不容易"糊"

训练成功后,assets/weights/下会生成一个60+MB 的 pth 模型(这才是该分享/推理用的文件),logs/实验名/下还会生成added_xxx.index索引文件(声音检索数据库)。

第三步:推理。切到"4-推理"选项卡,刷新音色、选中刚训练的模型,上传源音频:

参数项推荐值作用说明
索引比率 index_rate0.3 ~ 0.66越高越贴训练集音色(防泄漏),越低越吃推理源音质
音高 key0 为原调,+12 升八度,-12 降八度男转女常用 +12,女转男用 -12
输出路径assets/logs 下的实验文件夹转换结果会保存在这里

点击"转换",几十秒后就能听到成果——如果训练集里有明显的人声痕迹,恭喜,你的 AI 歌手已经会唱歌了。

🎬 实战:把一首歌变成"你的声音"翻唱

给你个有画面感的目标:晚上,你上传一首原唱,几分钟后 AI 用目标音色完整唱出副歌。完整流程如下:

  1. 拆人声:在"1-UVR5"选项卡里对原唱歌曲做分离,得到干净的人声轨——这是推理质量的地基,混着伴奏的源音频会让音色发虚。
  2. 选音色:用自己 10 分钟录音训练的模型,或直接选用一个已发布的 pth 模型(放到assets/weights/后刷新音色)。
  3. 调参数:f0 方法选 rmvpe,index_rate从 0.5 起步,音高 key按声线差值设定(男源转女目标就 +12)。
  4. 转换试听:先转一小段副歌验证音色对不对,满意后再整曲跑完。
  5. 合体:把 AI 人声和第一步分离出的伴奏在任意音频软件里对齐合并,一首属于你的 AI 翻唱就完成了。

想更进一步玩实时变声?运行go-realtime-gui.bat(实时变声界面源码在 tools/rvc_for_realtime.py),选好转音设备即可边说边变声,端到端延迟已优化至170ms,使用 ASIO 设备可压到90ms,几乎无感。

⚙️ 进阶指南:调优与技巧

基础跑通之后,这些"旋钮"能让你的模型更上一层楼:

  • 模型融合:用"5-ckpt"选项卡里的 ckpt-merge,把两个模型按权重混合,能调出更自然、更接近理想音色的结果(比如 70% 真人 + 30% 风格化模型)。
  • 批量推理:不想一个个点"转换"?命令行直接跑 tools/infer_batch_rvc.py,一个文件夹全部转完:
python tools/infer_batch_rvc.py --model_name 实验名 --input_path ./input_wavs --f0method rmvpe --f0up_key 0
  • API 集成:项目自带两套接口,api_240604.py 是推荐的最新版,可以把它嵌进你自己的自动化流程或前端服务里。
  • 显存与速度优化:训练爆显存就降 batch_size;推理阶段可在 configs/config.py 里调小x_pad、x_query等检索窗口参数来省显存;4G 以下显存建议放弃训练、只做推理。
  • ONNX 导出:追求推理速度可以用 tools/export_onnx.py 导出 ONNX 模型,配套演示见 tools/onnx_inference_demo.py。

⚠️ 避坑指南:常见问题与排查

以下每一条都来自社区高频问题(完整版见 docs/cn/faq.md),按"现象 → 原因 → 解决"对号入座:

现象原因解决
报 ffmpeg error / utf8 error音频路径带空格、括号等符号,或含中文把训练集目录改成纯英文、无空格的路径
训练显示 "Training is done" 却没有索引文件训练集过大导致加索引卡住回"3-训练索引"选项卡手动再点一次"训练索引"
推理列表里找不到新训练的音色音色列表未刷新点"刷新音色";还没有就去logs/实验名/看训练日志
分享模型后别人用不了分享的是logs/下几百 MB 的训练断点,不是推理模型只分享assets/weights/下 60+MB 的 pth 及对应 index 文件
Cuda out of memory显存不足训练降 batch_size;推理调小 config.py 末尾的检索窗口参数
浏览器 Connection Error误关了黑色控制台窗口保持控制台窗口开启
弹 "Expecting value: line 1 column 1"开了局域网/全局代理(含远程主机的 http_proxy)关闭客户端与服务端代理后再访问
训练时报文件/内存 errorCPU 进程开太多、音频切得太长拉低"提取音高和处理数据使用的CPU进程数",手工把长音频切短

🎉 现在,轮到你了

你的第一个 AI 歌手只差三步:

  1. 录一段10 分钟安静的干声素材(手机在安静房间录的即可);
  2. 按上面的流程装环境、启动 WebUI,跑完一次一键训练;
  3. 挑一首你熟悉的歌做推理,把结果发到社区听大家挑毛病——迭代两轮,音色相似度会让你自己都惊讶。

想查参数细节,读一读 docs/cn/faq.md 和 docs/en/faq_en.md;想追踪新特性,看 docs/cn/Changelog_CN.md。遇到问题直接在社区提问,RVC 拥有中文、英文、日文、韩文等多语言活跃社区,你的问题大概率已经有人踩过坑并写好了答案。

麦克风准备好了,按下录制键吧——十分钟后,你会听到"另一个自己"在唱歌。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询