人声分离5分钟跑通:UVR Ultimate Vocal Remover 新手完整教程
2026/9/14 5:54:15 网站建设 项目流程

人声分离5分钟跑通:UVR Ultimate Vocal Remover 新手完整教程

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

Ultimate Vocal Remover(UVR)是一款免费的开源人声分离工具:它把 MDX-Net、VR 和 Demucs 三类深度学习模型装进一个图形界面,把一首歌拆成人声、伴奏、鼓、贝斯等独立音轨,全程本地运行,文件不上传。适合翻唱练习、混音采样和音频修复的场景,也适合不想碰代码的新手。

第一次使用:三条最短路径

三种系统都能跑,差异只在第一步。选对路径后,剩下的操作是一样的:选输入文件 → 选模型 → 点 Start Processing。

平台最短路径关键差异
Windows 10/11 64位下载官方安装包UVR_v5.6.0_setup.exe必须装到C 盘根目录,装到其他盘会不稳定;AMD Radeon / Intel Arc 显卡改下 OpenCL 版安装包
macOS 11 (Big Sur) 及以上下载 DMG 拖入 ApplicationsM1/M2 选 arm64 包,Intel 选 x86_64 包;首次启动初始化约 5–10 分钟
Linux(Debian/Ubuntu/Arch)装好系统依赖后运行python3 UVR.py需要ffmpegpython3-tk两个系统包

🔧 想走源码路线(需要改参数、换模型文件时更灵活),四个命令即可:

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui pip install -r requirements.txt python UVR.py

三个平台的两个注意点:

  • Python 版本:源码方式建议 Windows 用 3.9.8、macOS 用 3.10,安装时勾选 “Add python.exe to PATH”。
  • NVIDIA 显卡:默认的 PyTorch 不带 CUDA 内核,需单独升级到 cu117 轮子版;没有 NVIDIA 卡的机器跳过这一步,纯 CPU 也能跑,只是慢。

场景一:只要人声或只要伴奏

这是 90% 的用例。主界面里 “Choose Process Method” 下拉选MDX-Net(质量上限高)或VR(速度快、占资源少),模型选带 “VocHQ / InstVoc” 字样的即可(如 MDX23C-InstVoc HQ)。界面上有三个复选框直接控制产出:

  • Vocals Only:只输出人声轨,省一半时间;
  • Instrumental Only:只输出伴奏轨;
  • GPU Conversion:有独立显卡就勾上,NVIDIA 卡生效,AMD/Intel 卡靠 OpenCL 版安装包。

输出格式在 WAV / FLAC / MP3 里三选一:WAV 无损但大,MP3 方便分享。处理前先勾Sample Mode (30s)试跑 30 秒,确认效果再放开整曲,这是避免白等半小时的最便宜保险。

场景二:要鼓点、贝斯等多轨分离

Demucs 系列是 UVR 内置的多轨引擎,一次出 4 轨(人声/鼓/贝斯/其他),v4 版本另有 6 轨配置。流程与 MDX-Net 相同,只是 “Choose Process Method” 改选Demucs,然后勾选需要的 stems。它的特点:

  • 速度比 MDX-Net 慢,但鼓和贝斯的定位更干净,做 remix 首选;
  • 可以叠加一个“二次模型”对某个轨再精修一次,默认参数(voc/inst 比例 0.9)先不动,听出偏差再调;
  • M1/M2 的 Mac 上 Demucs v4 和全部 MDX-Net 模型都支持 MPS 加速,不用降级到 CPU。

处理非 WAV 文件(MP3、FLAC 等)依赖 FFmpeg;用Time Stretch / Change Pitch功能则还需要 Rubber Band 可执行文件放进程序目录。两者都是系统级小工具,缺哪个哪个功能就报红。

避坑指南:现象 → 原因 → 解法

现象原因解法
Windows 版打不开或运行中闪退装在了非 C 盘重装到 C:\ 根目录
拖入 MP3/FLAC 报错没装 FFmpegsudo apt install ffmpeg;Windows 下载预编译版,把ffmpeg.exe放进程序目录
勾了 GPU 仍走 CPUPyTorch 是纯 CPU 版,或显卡不支持先跑一条命令验证:python -c "import torch; print(torch.cuda.is_available())",False 就重装 cu117 轮子;AMD/Intel 卡换 OpenCL 版
macOS 提示“已损坏/无法打开”Gatekeeper 隔离属性终端执行sudo spctl --master-disable,再sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app,开完记得spctl --master-enable恢复
首次启动卡住很久自动下载模型 + 初始化Mac 上 5–10 分钟属正常;模型下载慢时可按 gui_data/model_manual_download.json 列的地址手动下载后放进models/对应子目录
Time Stretch 功能灰掉没装 Rubber Band下载对应系统可执行文件放入程序目录(Linux 下install_packages.sh只装 pip 依赖,不含它)

⚠️ 排查顺序建议:先看应用内置的错误日志面板,再看上表;大多数“应用无法启动”最终都是缺依赖,重跑一遍pip install -r requirements.txt即可。

进阶调优:真正影响体验的 3 条

  1. Segment Size 与 Overlap:默认分段 256ms、overlap 8。长音频吃显存时把分段调小(如 128),重叠率保持在 8–12 之间,分段边界处的爆音会消失。
  2. 显存碎片:大文件报 OOM 时设置环境变量PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512,多数情况能直接解决。
  3. 模型目录:三类模型分别放在models/MDX_Net_Models/models/VR_Models/models/Demucs_Models/。模型文件是主要体积来源(整个包约 2GB),想精简安装或批量换模型,直接管理这三个目录即可,models/MDX_Net_Models/model_data/ 下的 YAML 即各模型的结构配置。

下一步

装好后跑一首熟悉的歌做基准:记下“人声 + 伴奏”的耗时和产物位置(输出目录在 Select Output 里选)。之后遇到报错先翻应用内日志,再查 README.md 的 Troubleshooting 段落;跟进 install_packages.sh 与 README 的版本更新说明,5.6 系列的补丁安装包支持直接覆盖安装,不用重新配环境。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询