10分钟语音练出专业AI变声模型:RVC WebUI快速上手
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC(Retrieval-based-Voice-Conversion-WebUI)是基于VITS(一种能用语音特征直接生成音频的神经网络模型)的变声框架,10分钟的低噪语音就能训练出专属AI音色。预处理、训练、推理全流程都在网页里完成,中端显卡即可流畅运行。手头语音数据不多、又想快速做出可用于唱歌和换音色的AI声音模型,它可以直接用。
能不能跑起来:环境与硬件对照表
用10秒对照下表确认环境,再选安装路线:
| 检查项 | 要求与建议 | 说明 |
|---|---|---|
| Python | 大于3.8(poetry方式建议3.7~3.10) | 过新的版本安装llvmlite可能出现冲突 |
| N卡(NVIDIA) | 按CUDA版本选匹配的PyTorch | 训练体验最佳 |
| A卡(AMD)/ I卡(Intel) | DML直通;Linux可选ROCm或IPEX | 换一份依赖清单即可 |
| 训练数据 | 推荐10~50分钟 | 音质高、底噪低,5~10分钟也可接受 |
最短路径四步:下载、装依赖、放模型、启动
第一步:获取代码,把仓库克隆到工作目录:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第二步:安装依赖,先装PyTorch,再一次性装RVC的全部依赖:
pip install torch torchvision torchaudio && pip install -r requirements.txt⚠️ 两个常见坑:Windows配RTX30xx(Ampere架构)时,安装PyTorch要指定cu117的whl源,避免CUDA版本错位;A/I卡用户把清单换成requirements-dml.txt。
第三步:放置预训练模型,按下方资源清单把文件下到对应目录,tools/里提供批量下载脚本可省手动查找的功夫。
第四步:启动训练推理网页界面:
python infer-web.py三大亮点拆解:小数据为什么能练好
top1检索替换,从源头杜绝音色泄漏
核心是把训练集做成检索索引。推理时系统对输入语音的每一小段,在训练集里查找最相似的特征(即top1检索),直接拿目标特征替换掉输入特征。模型"看到"的音色永远来自目标本人,无关音色进不来,输出因此稳定统一。
VITS底座,底模已消化近50小时数据
框架底座是VITS,一种主流的语音合成架构。底模在接近50小时的高质量开源数据集上完成训练,你的10分钟音频只用于微调,模型不需要从零学起——这是"小数据也能成"的根本原因。
硬件友好,训练推理都快
架构效率与训练策略保证了它即便在较弱的显卡上也能快速训完。配合内置的UVR5人声分离(把混音拆成人声和伴奏的算法)与RMVPE音高提取(对哑音不敏感、速度更快、占用更小的音高追踪方法),入门级机器也能跑通全流程。
分平台配置:Windows / macOS / Linux
Windows RVC依赖安装
N卡用户按默认清单装,A/I卡换requirements-dml.txt。平台特有坑:Windows不自带ffmpeg,需把ffmpeg.exe与ffprobe.exe两个可执行文件放进项目根目录。走整合包路线更省事,解压RVC-beta.7z后双击go-web.bat即可。
macOS RVC依赖安装
用自带脚本一键装依赖:
sh ./run.sh另外用Homebrew补一个ffmpeg(brew install ffmpeg)。Apple芯片机型可把RMVPE音高模型换成onnx版(rmvpe.onnx)使用。
Linux RVC依赖安装
Ubuntu/Debian先装ffmpeg:
sudo apt install ffmpegA卡ROCm路线需提前装好rocm-hip-sdk等驱动,个别显卡(如RX6700XT)要额外设置HSA_OVERRIDE_GFX_VERSION=10.3.0,并把当前用户加入render、video用户组;I卡IPEX路线启动前先执行source /opt/intel/oneapi/setvars.sh,依赖分别换成requirements-amd.txt与requirements-ipex.txt。
资源准备清单:预训练模型放哪里
| 文件 | 放置位置 | 哪类用户需要 |
|---|---|---|
| hubert_base.pt | assets/hubert/ | 所有人,语音特征提取用 |
| pretrained/ | assets/ | 所有人,v1训练推理用 |
| pretrained_v2/ | assets/ | 使用v2版本模型的用户 |
| uvr5_weights/ | assets/ | 需要人声伴奏分离的用户 |
| rmvpe.pt | 项目根目录 | 所有人,RMVPE音高提取用 |
| rmvpe.onnx | 项目根目录 | A/I卡用户可选 |
| ffmpeg.exe / ffprobe.exe | 项目根目录 | 仅Windows |
实战指南:启动WebUI与训练时长建议
入口是infer-web.py;若依赖走poetry装的,启动命令换成poetry run python infer-web.py。页面内从提取特征到生成索引,一键训练可以串起完整流程,跑完打印Training is done即模型训练成功。
训练时长建议:10~50分钟是甜点区间。⚠️ 想压更短,音色统一、底噪低的"精修"数据集5~10分钟也成立;1分钟以下不建议硬试,成功不可复现。一键训练若还没生成added开头的索引文件,说明索引步骤未完成,再点一次"训练索引"即可。
高频坑点:ffmpeg报错、索引缺失等常见问题
ffmpeg error / utf8 error → 现象是跑任何音频都报错 → 原因多为音频路径含空格、括号或中文,ffmpeg读这类路径会失败,写文件列表时中文路径也会崩 → 解法:把数据集挪到纯英文、无空格的路径下重跑。
一键训练结束没有added开头的索引文件 → 训练集过大,索引步骤卡住或内存吃紧 → 等批量索引流程走完,或再次点击训练索引;此时"程序已关闭"附近的报错是假的,模型本身已训练成功。
训练后推理找不到训练集音色 → 多半是训练环节有报错 → 查看控制台报错,翻logs/下对应实验名的训练日志,按报错定位修复。
A/I卡加速不明显、训练很慢 → 没装DML环境或rmvpe.onnx没放 → 按requirements-dml.txt重装依赖,并下载对应的onnx音高模型到根目录。
一句话总结
RVC把训练AI音色从大工程压缩成10分钟就能完成的小工程。新手第一条行动建议:准备10分钟低噪语音样本,放进训练集目录,先跑通一次一键训练流程。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考