RVC AI 变声教程:三步跑通部署,练出你的第一个语音转换模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC 是一个基于 VITS 的开源语音转换项目:喂给它 10 分钟某个人的低底噪录音,训出一个音色模型,之后你说的任何话都能变成那个音色,相当于在家拥有一台 AI 变声引擎。本教程带你依次完成装环境、启动界面、训出第一个模型、变出第一段声音。
效果先睹
按本文做完之后,你能做到这三件事:
- 视频配音:用 10-50 分钟目标人物的干净语音训练后,任意台词都能用该人物音色生成,单次推理几秒出片,不满意可反复重生成。
- 游戏与直播语音:实时变声模式的端到端延迟为 170ms,配 ASIO 声卡可降到 90ms,对方听到你的语气,音色却是目标人物。
- 一句话原理:RVC 用检索式方法,把原声音里的音色特征替换成目标音色的特征。你的语气和情绪保留,换的只是"嗓子的质地"。
效果上限主要看训练数据:录音底噪越低,转换结果越接近本人。
跑起来之前要准备什么
前置项分三组,按顺序检查即可:
系统要求
- Python 3.8 以上(必装)
- 显存 4G 及以上的显卡(推荐):训练、推理都够用;显存更小的卡或纯 CPU 只能做推理,速度较慢
- 操作系统:Windows、Linux、macOS 均支持
模型文件(必装,但无需手动下载)
- 项目自带一键下载脚本,会把语音特征提取、v1/v2 预训练模型、人声分离、音高提取这几类模型自动放到
assets/对应位置,其中 v2 预训练模型是训练时的默认选择
音频工具 FFmpeg(必装)
- 音频切片和格式转换都依赖它。Linux/macOS 用系统包管理器安装即可;Windows 用户把
ffmpeg.exe、ffprobe.exe放到项目根目录也行
安装与启动
Windows 整合包安装步骤
Windows 用户走整合包路线:下载并解压RVC-beta.7z整合包,双击go-web.bat,几秒后浏览器自动打开 Gradio 界面,你会看到左侧排着 UVR5、预处理、训练、推理等选项卡。开发者若坚持源码安装,先装 PyTorch,再按显卡选对应依赖清单(Nvidia 用 requirements.txt,AMD/Intel 用 requirements-dml.txt),装完后的启动方式与下文一致。
Linux 源码安装与启动命令
克隆仓库后,装好 PyTorch 和与显卡匹配的依赖文件(Nvidia 用 requirements.txt,AMD ROCm 用 requirements-amd.txt,Intel IPEX 用 requirements-ipex.txt 并多加载一行 oneapi 环境变量),然后:
python infer-web.py终端会打印本地端口地址,浏览器打开它,界面即就绪。
macOS 单脚本安装与启动
sh ./run.sh这条命令会自动创建 Python 3.8 虚拟环境、装依赖、下载模型文件,最后直接拉起界面,你只需等待进度跑完。
各平台启动前建议先确认模型文件齐全,运行一次:
python tools/download_models.py完成第一次变声
🎙️ 从数据到出声音共三步,每步都有明确的停止标志。
第一步:准备训练数据把 10-50 分钟(最少 5 分钟)的单人录音整理成 WAV,44.1kHz 单声道最理想,底噪尽量低。如果素材是歌曲,先用 UVR5 选项卡把 Vocals 分离出来,你会得到一段只剩人声的干净音频。把所有音频放进同一个文件夹。
第二步:预处理与训练在"预处理"选项卡填入模型名和音频目录路径,点击开始,自动切片和音高提取会依次完成。再到"训练"选项卡选模型版本 v2、采样率 48k,其余参数保持默认即可:total_epoch 默认 1000,batch_size 4(4G 显存可降为 2),learning_rate 0.0001。训练结束时你会看到进度条停在最后一轮,assets/weights/目录里多出一个 .pth 检查点文件。
第三步:推理出声音先点一次"训练索引"生成索引,再切到"推理"选项卡选中刚训好的模型,上传一段录音点击推理,扬声器里出来的就是转换结果:音色变成了目标人物,语气和情绪仍是你自己的。
常见翻车点
显存不足怎么办
- 现象:训练中途报 "CUDA out of memory",进程直接退出。
- 原因:训练需要 4G 及以上显存,小显存显卡搭配过大的 batch_size 容易触顶。
- 怎么办:把 batch_size 降到 2 或 1,并关掉其他占用显存的程序;仍不够就只使用推理选项卡,或借云显卡训练。
训练完成但索引没生成
- 现象:训练结束后输出目录里没有 .index 文件,推理选项卡的索引下拉框是空的。
- 原因:训练集过大导致索引构建时内存溢出,或者漏点了生成按钮。
- 怎么办:在训练选项卡手动点击"训练索引"重新生成;仍失败就减少训练集中的音频数量。
路径含特殊字符导致 FFmpeg 报错
- 现象:启动或预处理时弹 FFmpeg 错误 / UTF-8 解码错误,日志里能看到乱码路径。
- 原因:文件路径中的空格、括号或中文字符干扰了 FFmpeg 的命令行解析。
- 怎么办:把项目和音频都移到纯英文、无空格的路径(例如
D:/rvc/)再重试。
进阶入口
- 实时变声:运行
gui_v1.py(Windows 下双击 go-realtime-gui.bat),麦克风输入、转换、播放的闭环延迟 170ms,适合直播和游戏。 - API 调用:程序化接入参考 api_240604.py,支持传入语音地址和参数,返回转换后的音频。
- 批量推理:整个目录批量转换用 tools/infer_batch_rvc.py。
- 更多资料:疑难问题查 FAQ docs/cn/faq.md,调参技巧看训练指南 docs/en/training_tips_en.md,新功能关注更新日志。
动手清单
- 装好 FFmpeg,跑一次模型下载脚本补齐 assets 目录
- 启动界面:Windows 双击 go-web.bat,其他系统用上述启动命令
- 在 WebUI 里预处理 10 分钟语音,训练 1000 轮并生成索引
- 到推理选项卡完成第一次 AI 变声,听效果
- 遇到问题先查 FAQ,再对照本文排查路径与显存设置
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考