☰
RVC WebUI 里做 UVR5 人声提取的完整指南
2026/10/7 20:44:30 网站建设 项目流程

RVC WebUI 里做 UVR5 人声提取的完整指南

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

翻唱缺伴奏、播客录音混响重?Retrieval-based-Voice-Conversion-WebUI(RVC WebUI)是一个免费开源的 AI 音频项目,它集成的 UVR5 引擎能把人声和伴奏一键拆开、还能去掉混响,也就是 AI 音频分离。照下面的步骤走,10 分钟内你能拿到第一份人声文件。

🧩 一分钟看懂 UVR5 能干什么

UVR5 是 RVC WebUI 内置的一套分离模型:你丢进去一首完整的歌,它就猜出哪些频段是人声、哪些是伴奏,然后拆成两个文件。你不用碰任何代码,全程在网页界面点选。

你放进去的它能分出来的结果存在哪
一首完整歌曲(放一个文件夹里)人声文件 + 伴奏文件,各一份界面指定的输出文件夹,默认opt
带混响、回声的录音去过回声/混响的干净人声同上

界面里它藏在「伴奏人声分离&去混响&去回声」选项卡,输入框支持整个文件夹或一次拖多个文件进来,天然就是批量干活。

🔧 搭环境三步走:拿代码、装依赖、开界面

先确认你的 Python 版本高于 3.8。

第一步:获取项目代码

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI

第二步:按你的显卡装依赖(先装 PyTorch,已装可跳过)

你的硬件依赖文件说明
NVIDIA 显卡requirements.txt最常用的一条路
AMD 显卡requirements-amd.txtLinux 下的 ROCM 环境
Intel 显卡requirements-ipex.txtLinux 下的 IPEX 环境
A 卡 / I 卡(Windows)requirements-dml.txt走 DirectML 路线
pip install -r requirements.txt

(把文件名换成上表对应你硬件的那份即可)

第三步:启动界面

  • Windows:双击项目根目录的go-web.bat
  • macOS / Linux:
sh ./run.sh

浏览器会自动打开 RVC WebUI 主界面。

🎯 主流程实战:从选模型到验收结果

1. 先把分离模型备齐

UVR5 模型是一批.pth文件,统一放在项目的assets/uvr5_weights/目录。跑一次下载脚本就能全齐:

python tools/download_models.py

它会顺带把assets/uvr5_weights/下的人声分离模型和去混响的 onnx 模型都拉下来。下载慢的话,也可以手动把同名单文件放进该目录。

2. 选对模型:按素材特点挑,而不是按名字挑

进入「伴奏人声分离&去混响&去回声」选项卡,下拉框里选模型。对照你的素材特点:

你的素材选哪个模型一句话说明
普通歌曲,想拆人声/伴奏HP2_all_vocals不带和声时的默认选择,主人声保留最稳
同上,想再精细一点HP3_all_vocals主人声保留略好于 HP2,可能轻微漏进伴奏
带和声的音频,只要主唱HP5_only_main_vocal和声会被当背景滤掉,主人声可能略被削弱
立体声录音有房间回声onnx_dereverb_By_FoxJoy(MDX-Net 去混响)只治双声道混响,单声道不行
录音带延迟/回声VR-DeEchoNormal/VR-DeEchoAggressiveAggressive 去得更狠
既要去回声又要去混响VR-DeEchoDeReverb能治单声道混响,但耗时约为前两者的 2 倍

3. 配参数:一套新手默认值

参数建议值白话解读
输入待处理音频文件夹路径例:D:\todo-songs直接把文件管理器地址栏的路径粘过来
导出文件格式flac无损,留给后期处理;要发平台可换mp3
输出主人声文件夹opt人声和伴奏各一个文件夹,默认都叫 opt
人声提取激进程度(agg)10可以理解为"下手轻重":数值越高抠得越狠,默认 10 是平衡点,别一上来就拉满

填完点「转换」,下方输出信息框会滚动进度。

4. 验成果:对着勾

  • ✅opt目录下出现了人声和伴奏两组文件
  • ✅ 人声文件里听不出明显的鼓点、贝斯残留
  • ✅ 伴奏文件里听不出"空口唱歌"的残影
  • ✅ 时长与原曲一致,没有缺头少尾

不满意别急着换参数,优先换模型重跑一轮,比动 agg 更见效。

⚡ 提速指南:批量、硬件与磁盘

  • 批量就是主业:这个选项卡本身就吃整个文件夹,把一期播客或一整张专辑放进同一个目录,一次点「转换」全跑完,不用循环调用别的东西。
  • 确认 GPU 真的在干活:装了正确版本 PyTorch 且显卡驱动正常时,分离会走 GPU;日志里如果显示cpu,说明依赖装错了路线,回第二步按硬件表重装。
  • 慢是有原因的:onnx_dereverb(MDX-Net)和VR-DeEchoDeReverb天生就是慢档,日常去回声用VR-DeEchoNormal能快近一倍;CPU 进程数相关默认值在 configs/config.py 里,一般不用动。
  • 磁盘习惯:原始音频、opt输出都建议放 SSD;处理一张完整专辑会多出约同体积的输出文件,提前留出空间。长歌可以按段落切成几段再跑,失败了好重跑,不心疼。

🩺 故障速查:照着现象找动作

现象可能原因解决动作
模型下拉框是空的assets/uvr5_weights/里一个.pth都没有跑python tools/download_models.py,或手动放入模型文件后重启界面
界面打不开、报缺模块依赖没装全,或装错了硬件路线按第二步的表格重装对应 requirements 文件
处理速度慢得离谱走了 CPU,或选了慢档模型确认 GPU 生效;把 MDX-Net / DeReverb 换成 DeEchoNormal 试试
人声后面拖着回声尾巴只做了一次分离,没跑去混响模型先 MDX-Net 去立体声混响,再用VR-DeEchoAggressive过一遍,这是公认最干净的组合
拆出来的人声里夹着和声选了 HP2/HP3,但素材本身带和声换HP5_only_main_vocal重跑
中途崩溃、内存爆掉文件太长、后台程序占内存把长文件分段处理,关掉吃内存的后台程序

更细的报错对照见 常见问题文档。

🎤 四个能立刻用起来的玩法

玩法一:翻唱伴奏

  1. 把原曲放进待处理文件夹,选HP2_all_vocals跑一遍
  2. 拿出来的伴奏进录音软件,录自己的嗓
  3. 人声轨与伴奏轨混到一起,一首新翻唱

玩法二:播客去混响

  1. 原始录音丢进文件夹,选VR-DeEchoNormal
  2. 对比前后干声段落
  3. 还觉得空就追加一次VR-DeEchoAggressive

玩法三:视频重配音

  1. 从视频导出的音轨里提取人声
  2. 清掉背景乐后重新配音
  3. 新配音替换回视频音轨

玩法四:声乐学习材料

  1. 提取外语歌的主唱人声
  2. 用音频软件放慢到 0.75 倍速
  3. 循环跟唱,当听力练习用

收尾

现在就挑一首你翻过无数遍的歌,跑完你的第一次 UVR5 人声提取,结果多半会超出预期。接下来可以试试:

  1. 用HP2和HP3各跑一次同一首歌,对比主人声保留的差异
  2. 双击go-realtime-gui.bat,体验低延迟的实时变声界面
  3. 翻一翻 api_240604.py,看看怎么把这套分离和变声能力接到自己的脚本里

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询