☰
10分钟语音练出专业AI变声模型:RVC WebUI快速上手
2026/9/27 3:14:47 网站建设 项目流程

10分钟语音练出专业AI变声模型:RVC WebUI快速上手

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC(Retrieval-based-Voice-Conversion-WebUI)是基于VITS(一种能用语音特征直接生成音频的神经网络模型)的变声框架,10分钟的低噪语音就能训练出专属AI音色。预处理、训练、推理全流程都在网页里完成,中端显卡即可流畅运行。手头语音数据不多、又想快速做出可用于唱歌和换音色的AI声音模型,它可以直接用。

能不能跑起来:环境与硬件对照表

用10秒对照下表确认环境,再选安装路线:

检查项要求与建议说明
Python大于3.8(poetry方式建议3.7~3.10)过新的版本安装llvmlite可能出现冲突
N卡(NVIDIA)按CUDA版本选匹配的PyTorch训练体验最佳
A卡(AMD)/ I卡(Intel)DML直通;Linux可选ROCm或IPEX换一份依赖清单即可
训练数据推荐10~50分钟音质高、底噪低,5~10分钟也可接受

最短路径四步:下载、装依赖、放模型、启动

第一步:获取代码,把仓库克隆到工作目录:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

第二步:安装依赖,先装PyTorch,再一次性装RVC的全部依赖:

pip install torch torchvision torchaudio && pip install -r requirements.txt

⚠️ 两个常见坑:Windows配RTX30xx(Ampere架构)时,安装PyTorch要指定cu117的whl源,避免CUDA版本错位;A/I卡用户把清单换成requirements-dml.txt。

第三步:放置预训练模型,按下方资源清单把文件下到对应目录,tools/里提供批量下载脚本可省手动查找的功夫。

第四步:启动训练推理网页界面:

python infer-web.py

三大亮点拆解:小数据为什么能练好

top1检索替换,从源头杜绝音色泄漏

核心是把训练集做成检索索引。推理时系统对输入语音的每一小段,在训练集里查找最相似的特征(即top1检索),直接拿目标特征替换掉输入特征。模型"看到"的音色永远来自目标本人,无关音色进不来,输出因此稳定统一。

VITS底座,底模已消化近50小时数据

框架底座是VITS,一种主流的语音合成架构。底模在接近50小时的高质量开源数据集上完成训练,你的10分钟音频只用于微调,模型不需要从零学起——这是"小数据也能成"的根本原因。

硬件友好,训练推理都快

架构效率与训练策略保证了它即便在较弱的显卡上也能快速训完。配合内置的UVR5人声分离(把混音拆成人声和伴奏的算法)与RMVPE音高提取(对哑音不敏感、速度更快、占用更小的音高追踪方法),入门级机器也能跑通全流程。

分平台配置:Windows / macOS / Linux

Windows RVC依赖安装

N卡用户按默认清单装,A/I卡换requirements-dml.txt。平台特有坑:Windows不自带ffmpeg,需把ffmpeg.exe与ffprobe.exe两个可执行文件放进项目根目录。走整合包路线更省事,解压RVC-beta.7z后双击go-web.bat即可。

macOS RVC依赖安装

用自带脚本一键装依赖:

sh ./run.sh

另外用Homebrew补一个ffmpeg(brew install ffmpeg)。Apple芯片机型可把RMVPE音高模型换成onnx版(rmvpe.onnx)使用。

Linux RVC依赖安装

Ubuntu/Debian先装ffmpeg:

sudo apt install ffmpeg

A卡ROCm路线需提前装好rocm-hip-sdk等驱动,个别显卡(如RX6700XT)要额外设置HSA_OVERRIDE_GFX_VERSION=10.3.0,并把当前用户加入render、video用户组;I卡IPEX路线启动前先执行source /opt/intel/oneapi/setvars.sh,依赖分别换成requirements-amd.txt与requirements-ipex.txt。

资源准备清单:预训练模型放哪里

文件放置位置哪类用户需要
hubert_base.ptassets/hubert/所有人,语音特征提取用
pretrained/assets/所有人,v1训练推理用
pretrained_v2/assets/使用v2版本模型的用户
uvr5_weights/assets/需要人声伴奏分离的用户
rmvpe.pt项目根目录所有人,RMVPE音高提取用
rmvpe.onnx项目根目录A/I卡用户可选
ffmpeg.exe / ffprobe.exe项目根目录仅Windows

实战指南:启动WebUI与训练时长建议

入口是infer-web.py;若依赖走poetry装的,启动命令换成poetry run python infer-web.py。页面内从提取特征到生成索引,一键训练可以串起完整流程,跑完打印Training is done即模型训练成功。

训练时长建议:10~50分钟是甜点区间。⚠️ 想压更短,音色统一、底噪低的"精修"数据集5~10分钟也成立;1分钟以下不建议硬试,成功不可复现。一键训练若还没生成added开头的索引文件,说明索引步骤未完成,再点一次"训练索引"即可。

高频坑点:ffmpeg报错、索引缺失等常见问题

ffmpeg error / utf8 error → 现象是跑任何音频都报错 → 原因多为音频路径含空格、括号或中文,ffmpeg读这类路径会失败,写文件列表时中文路径也会崩 → 解法:把数据集挪到纯英文、无空格的路径下重跑。

一键训练结束没有added开头的索引文件 → 训练集过大,索引步骤卡住或内存吃紧 → 等批量索引流程走完,或再次点击训练索引;此时"程序已关闭"附近的报错是假的,模型本身已训练成功。

训练后推理找不到训练集音色 → 多半是训练环节有报错 → 查看控制台报错,翻logs/下对应实验名的训练日志,按报错定位修复。

A/I卡加速不明显、训练很慢 → 没装DML环境或rmvpe.onnx没放 → 按requirements-dml.txt重装依赖,并下载对应的onnx音高模型到根目录。

一句话总结

RVC把训练AI音色从大工程压缩成10分钟就能完成的小工程。新手第一条行动建议:准备10分钟低噪语音样本,放进训练集目录,先跑通一次一键训练流程。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询