RVC WebUI 里做 UVR5 人声提取的完整指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
翻唱缺伴奏、播客录音混响重?Retrieval-based-Voice-Conversion-WebUI(RVC WebUI)是一个免费开源的 AI 音频项目,它集成的 UVR5 引擎能把人声和伴奏一键拆开、还能去掉混响,也就是 AI 音频分离。照下面的步骤走,10 分钟内你能拿到第一份人声文件。
🧩 一分钟看懂 UVR5 能干什么
UVR5 是 RVC WebUI 内置的一套分离模型:你丢进去一首完整的歌,它就猜出哪些频段是人声、哪些是伴奏,然后拆成两个文件。你不用碰任何代码,全程在网页界面点选。
| 你放进去的 | 它能分出来的 | 结果存在哪 |
|---|---|---|
| 一首完整歌曲(放一个文件夹里) | 人声文件 + 伴奏文件,各一份 | 界面指定的输出文件夹,默认opt |
| 带混响、回声的录音 | 去过回声/混响的干净人声 | 同上 |
界面里它藏在「伴奏人声分离&去混响&去回声」选项卡,输入框支持整个文件夹或一次拖多个文件进来,天然就是批量干活。
🔧 搭环境三步走:拿代码、装依赖、开界面
先确认你的 Python 版本高于 3.8。
第一步:获取项目代码
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI第二步:按你的显卡装依赖(先装 PyTorch,已装可跳过)
| 你的硬件 | 依赖文件 | 说明 |
|---|---|---|
| NVIDIA 显卡 | requirements.txt | 最常用的一条路 |
| AMD 显卡 | requirements-amd.txt | Linux 下的 ROCM 环境 |
| Intel 显卡 | requirements-ipex.txt | Linux 下的 IPEX 环境 |
| A 卡 / I 卡(Windows) | requirements-dml.txt | 走 DirectML 路线 |
pip install -r requirements.txt(把文件名换成上表对应你硬件的那份即可)
第三步:启动界面
- Windows:双击项目根目录的
go-web.bat - macOS / Linux:
sh ./run.sh浏览器会自动打开 RVC WebUI 主界面。
🎯 主流程实战:从选模型到验收结果
1. 先把分离模型备齐
UVR5 模型是一批.pth文件,统一放在项目的assets/uvr5_weights/目录。跑一次下载脚本就能全齐:
python tools/download_models.py它会顺带把assets/uvr5_weights/下的人声分离模型和去混响的 onnx 模型都拉下来。下载慢的话,也可以手动把同名单文件放进该目录。
2. 选对模型:按素材特点挑,而不是按名字挑
进入「伴奏人声分离&去混响&去回声」选项卡,下拉框里选模型。对照你的素材特点:
| 你的素材 | 选哪个模型 | 一句话说明 |
|---|---|---|
| 普通歌曲,想拆人声/伴奏 | HP2_all_vocals | 不带和声时的默认选择,主人声保留最稳 |
| 同上,想再精细一点 | HP3_all_vocals | 主人声保留略好于 HP2,可能轻微漏进伴奏 |
| 带和声的音频,只要主唱 | HP5_only_main_vocal | 和声会被当背景滤掉,主人声可能略被削弱 |
| 立体声录音有房间回声 | onnx_dereverb_By_FoxJoy(MDX-Net 去混响) | 只治双声道混响,单声道不行 |
| 录音带延迟/回声 | VR-DeEchoNormal/VR-DeEchoAggressive | Aggressive 去得更狠 |
| 既要去回声又要去混响 | VR-DeEchoDeReverb | 能治单声道混响,但耗时约为前两者的 2 倍 |
3. 配参数:一套新手默认值
| 参数 | 建议值 | 白话解读 |
|---|---|---|
| 输入待处理音频文件夹路径 | 例:D:\todo-songs | 直接把文件管理器地址栏的路径粘过来 |
| 导出文件格式 | flac | 无损,留给后期处理;要发平台可换mp3 |
| 输出主人声文件夹 | opt | 人声和伴奏各一个文件夹,默认都叫 opt |
| 人声提取激进程度(agg) | 10 | 可以理解为"下手轻重":数值越高抠得越狠,默认 10 是平衡点,别一上来就拉满 |
填完点「转换」,下方输出信息框会滚动进度。
4. 验成果:对着勾
- ✅
opt目录下出现了人声和伴奏两组文件 - ✅ 人声文件里听不出明显的鼓点、贝斯残留
- ✅ 伴奏文件里听不出"空口唱歌"的残影
- ✅ 时长与原曲一致,没有缺头少尾
不满意别急着换参数,优先换模型重跑一轮,比动 agg 更见效。
⚡ 提速指南:批量、硬件与磁盘
- 批量就是主业:这个选项卡本身就吃整个文件夹,把一期播客或一整张专辑放进同一个目录,一次点「转换」全跑完,不用循环调用别的东西。
- 确认 GPU 真的在干活:装了正确版本 PyTorch 且显卡驱动正常时,分离会走 GPU;日志里如果显示
cpu,说明依赖装错了路线,回第二步按硬件表重装。 - 慢是有原因的:
onnx_dereverb(MDX-Net)和VR-DeEchoDeReverb天生就是慢档,日常去回声用VR-DeEchoNormal能快近一倍;CPU 进程数相关默认值在 configs/config.py 里,一般不用动。 - 磁盘习惯:原始音频、
opt输出都建议放 SSD;处理一张完整专辑会多出约同体积的输出文件,提前留出空间。长歌可以按段落切成几段再跑,失败了好重跑,不心疼。
🩺 故障速查:照着现象找动作
| 现象 | 可能原因 | 解决动作 |
|---|---|---|
| 模型下拉框是空的 | assets/uvr5_weights/里一个.pth都没有 | 跑python tools/download_models.py,或手动放入模型文件后重启界面 |
| 界面打不开、报缺模块 | 依赖没装全,或装错了硬件路线 | 按第二步的表格重装对应 requirements 文件 |
| 处理速度慢得离谱 | 走了 CPU,或选了慢档模型 | 确认 GPU 生效;把 MDX-Net / DeReverb 换成 DeEchoNormal 试试 |
| 人声后面拖着回声尾巴 | 只做了一次分离,没跑去混响模型 | 先 MDX-Net 去立体声混响,再用VR-DeEchoAggressive过一遍,这是公认最干净的组合 |
| 拆出来的人声里夹着和声 | 选了 HP2/HP3,但素材本身带和声 | 换HP5_only_main_vocal重跑 |
| 中途崩溃、内存爆掉 | 文件太长、后台程序占内存 | 把长文件分段处理,关掉吃内存的后台程序 |
更细的报错对照见 常见问题文档。
🎤 四个能立刻用起来的玩法
玩法一:翻唱伴奏
- 把原曲放进待处理文件夹,选
HP2_all_vocals跑一遍 - 拿出来的伴奏进录音软件,录自己的嗓
- 人声轨与伴奏轨混到一起,一首新翻唱
玩法二:播客去混响
- 原始录音丢进文件夹,选
VR-DeEchoNormal - 对比前后干声段落
- 还觉得空就追加一次
VR-DeEchoAggressive
玩法三:视频重配音
- 从视频导出的音轨里提取人声
- 清掉背景乐后重新配音
- 新配音替换回视频音轨
玩法四:声乐学习材料
- 提取外语歌的主唱人声
- 用音频软件放慢到 0.75 倍速
- 循环跟唱,当听力练习用
收尾
现在就挑一首你翻过无数遍的歌,跑完你的第一次 UVR5 人声提取,结果多半会超出预期。接下来可以试试:
- 用
HP2和HP3各跑一次同一首歌,对比主人声保留的差异 - 双击
go-realtime-gui.bat,体验低延迟的实时变声界面 - 翻一翻 api_240604.py,看看怎么把这套分离和变声能力接到自己的脚本里
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考