☰
10 分钟语音训练变声模型:RVC 最短上手路径
2026/9/27 4:52:05 网站建设 项目流程

10 分钟语音训练变声模型:RVC 最短上手路径

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

手机备忘录里只有十几分钟自己的录音,就想做出一个能以你声音说话的模型?Retrieval-based-Voice-Conversion-WebUI(下称 RVC)就是冲这个场景来的:10 分钟语音数据训练变声模型,网页界面点几下就能出活。读完这篇,你会在自己电脑上把它从零跑起来,并拿到一个能试听的音色。

top1 检索堵漏音:RVC 凭什么用 10 分钟数据出活

把变声想成修音师的工作:先把"说了什么"从原始录音里剥出来,再给内容套一层目标音色的"皮肤"。RVC 在推理时会做 top1 检索——从训练集里找与输入最接近的源特征,直接替换掉你输入的特征。这一下把"模型顺带学会你原本音色"的泄漏通道堵死了,也是项目名里 Retrieval 的含义。

拿它跟同类方案比,有三点值得留意:

  • 多数音色克隆工具要几小时录音才稳,RVC 十分钟就能出可用效果,数据门槛低一个量级;
  • 消费级显卡就能完成训练,不用租服务器;
  • 工具链是打包的:UVR5 人声/伴奏分离、RMVPE 音高提取(专治哑音)都在项目里,不用自己接三套工具。

RVC 环境搭建:从 clone 到预模型就位

依赖装在 Python 3.8 以上环境(poetry 路线建议 3.7–3.10,新版会跟 llvmlite 冲突,pip 路线则没有这个限制)。

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI

PyTorch 单独先装,装过就跳过:

pip install torch torchvision torchaudio

Windows + RTX 30 系(Ampere 架构)建议给这条命令加上 cu117 源,CUDA 版本对不上会白查半天。然后按你的显卡选一份依赖清单:

pip install -r requirements.txt # N 卡 # A 卡 / I 卡(DirectML): pip install -r requirements-dml.txt # A 卡 ROCm(Linux): pip install -r requirements-amd.txt # I 卡 IPEX(Linux): pip install -r requirements-ipex.txt

ROCm 用户记得确认当前用户已加入 render 和 video 组,个别卡号还需设置 HSA_OVERRIDE_GFX_VERSION,这些细节 README.md 里有原文。

ffmpeg 是硬依赖,缺了切片和转码全废:

sudo apt install ffmpeg # Ubuntu/Debian # macOS: brew install ffmpeg # Windows: 把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录

最后是预模型,仓库里 tools/download_models.py 有现成下载脚本,对着这张清单核对是否就位即可:

文件放置位置用途
hubert_base.ptassets/hubert/内容特征提取
pretrained、pretrained_v2assets/ 下训练底模,v2 需额外下载
uvr5_weightsassets/uvr5_weights/人声伴奏分离
rmvpe.pt项目根目录RMVPE 音高提取

macOS 用户有偷懒路线:直接sh ./run.sh装依赖;IPEX 的 I 卡用户启动前记得先 source Intel oneapi 的 setvars.sh。

启动 WebUI 后第一次训练的点击顺序

python infer-web.py

poetry 装的依赖就写成poetry run python infer-web.py。浏览器打开 WebUI 后,别先进"模型推理",第一次直接走"训练"页签:

  1. 填实验名(如 my-voice),采样率选 40k,版本选 v2;要拿去唱歌就保持"带音高"为是,纯语音可以不要。
  2. 把十几分钟录音放进一个单独文件夹,step2 填这个路径,点"处理数据",它会自动切片和归一化。
  3. 点"特征提取",音高算法保持默认 rmvpe 即可。
  4. 点"一键训练"——它会把处理数据、特征提取、训练模型、建索引四步连起来跑,默认 20 个 epoch。
  5. 切到"模型推理"页签,选刚出的 .pth 和 added 索引,传一句干声,点推理试听。

⚠️ 报 ffmpeg error 或 utf8 error,九成是路径的锅:音频路径带空格、括号,或训练集文件夹名含中文。先改路径,再怀疑软件。

⚠️ 日志显示 "Training is done" 但推理页找不到 added 开头的索引文件,是索引那一步卡住了,回训练页签再点一次"训练特征索引"就好。

想再抠效果的话:v1 和 v2 底模可以在"训练"页签的版本项里切换、重训对比;"ckpt处理"页签支持模型融合,把两个音色按权重混出中间值;Onnx 导出则面向实时变声场景,配合 tools/rvc_for_realtime.py 走低延迟链路。

手机里那十几分钟录音,现在够你交付一个能用的音色了。建议的下一步:拿同一批数据,把 epoch 从 20 拉到 40 各训一次,对比听感差异——参数上的微调,常常比换底模更值。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询