☰
RVC AI 变声教程:三步跑通部署,练出你的第一个语音转换模型
2026/10/4 20:44:12 网站建设 项目流程

RVC AI 变声教程:三步跑通部署,练出你的第一个语音转换模型

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC 是一个基于 VITS 的开源语音转换项目:喂给它 10 分钟某个人的低底噪录音,训出一个音色模型,之后你说的任何话都能变成那个音色,相当于在家拥有一台 AI 变声引擎。本教程带你依次完成装环境、启动界面、训出第一个模型、变出第一段声音。

效果先睹

按本文做完之后,你能做到这三件事:

  • 视频配音:用 10-50 分钟目标人物的干净语音训练后,任意台词都能用该人物音色生成,单次推理几秒出片,不满意可反复重生成。
  • 游戏与直播语音:实时变声模式的端到端延迟为 170ms,配 ASIO 声卡可降到 90ms,对方听到你的语气,音色却是目标人物。
  • 一句话原理:RVC 用检索式方法,把原声音里的音色特征替换成目标音色的特征。你的语气和情绪保留,换的只是"嗓子的质地"。

效果上限主要看训练数据:录音底噪越低,转换结果越接近本人。

跑起来之前要准备什么

前置项分三组,按顺序检查即可:

系统要求

  • Python 3.8 以上(必装)
  • 显存 4G 及以上的显卡(推荐):训练、推理都够用;显存更小的卡或纯 CPU 只能做推理,速度较慢
  • 操作系统:Windows、Linux、macOS 均支持

模型文件(必装,但无需手动下载)

  • 项目自带一键下载脚本,会把语音特征提取、v1/v2 预训练模型、人声分离、音高提取这几类模型自动放到assets/对应位置,其中 v2 预训练模型是训练时的默认选择

音频工具 FFmpeg(必装)

  • 音频切片和格式转换都依赖它。Linux/macOS 用系统包管理器安装即可;Windows 用户把ffmpeg.exe、ffprobe.exe放到项目根目录也行

安装与启动

Windows 整合包安装步骤

Windows 用户走整合包路线:下载并解压RVC-beta.7z整合包,双击go-web.bat,几秒后浏览器自动打开 Gradio 界面,你会看到左侧排着 UVR5、预处理、训练、推理等选项卡。开发者若坚持源码安装,先装 PyTorch,再按显卡选对应依赖清单(Nvidia 用 requirements.txt,AMD/Intel 用 requirements-dml.txt),装完后的启动方式与下文一致。

Linux 源码安装与启动命令

克隆仓库后,装好 PyTorch 和与显卡匹配的依赖文件(Nvidia 用 requirements.txt,AMD ROCm 用 requirements-amd.txt,Intel IPEX 用 requirements-ipex.txt 并多加载一行 oneapi 环境变量),然后:

python infer-web.py

终端会打印本地端口地址,浏览器打开它,界面即就绪。

macOS 单脚本安装与启动

sh ./run.sh

这条命令会自动创建 Python 3.8 虚拟环境、装依赖、下载模型文件,最后直接拉起界面,你只需等待进度跑完。

各平台启动前建议先确认模型文件齐全,运行一次:

python tools/download_models.py

完成第一次变声

🎙️ 从数据到出声音共三步,每步都有明确的停止标志。

第一步:准备训练数据把 10-50 分钟(最少 5 分钟)的单人录音整理成 WAV,44.1kHz 单声道最理想,底噪尽量低。如果素材是歌曲,先用 UVR5 选项卡把 Vocals 分离出来,你会得到一段只剩人声的干净音频。把所有音频放进同一个文件夹。

第二步:预处理与训练在"预处理"选项卡填入模型名和音频目录路径,点击开始,自动切片和音高提取会依次完成。再到"训练"选项卡选模型版本 v2、采样率 48k,其余参数保持默认即可:total_epoch 默认 1000,batch_size 4(4G 显存可降为 2),learning_rate 0.0001。训练结束时你会看到进度条停在最后一轮,assets/weights/目录里多出一个 .pth 检查点文件。

第三步:推理出声音先点一次"训练索引"生成索引,再切到"推理"选项卡选中刚训好的模型,上传一段录音点击推理,扬声器里出来的就是转换结果:音色变成了目标人物,语气和情绪仍是你自己的。

常见翻车点

显存不足怎么办

  • 现象:训练中途报 "CUDA out of memory",进程直接退出。
  • 原因:训练需要 4G 及以上显存,小显存显卡搭配过大的 batch_size 容易触顶。
  • 怎么办:把 batch_size 降到 2 或 1,并关掉其他占用显存的程序;仍不够就只使用推理选项卡,或借云显卡训练。

训练完成但索引没生成

  • 现象:训练结束后输出目录里没有 .index 文件,推理选项卡的索引下拉框是空的。
  • 原因:训练集过大导致索引构建时内存溢出,或者漏点了生成按钮。
  • 怎么办:在训练选项卡手动点击"训练索引"重新生成;仍失败就减少训练集中的音频数量。

路径含特殊字符导致 FFmpeg 报错

  • 现象:启动或预处理时弹 FFmpeg 错误 / UTF-8 解码错误,日志里能看到乱码路径。
  • 原因:文件路径中的空格、括号或中文字符干扰了 FFmpeg 的命令行解析。
  • 怎么办:把项目和音频都移到纯英文、无空格的路径(例如D:/rvc/)再重试。

进阶入口

  • 实时变声:运行gui_v1.py(Windows 下双击 go-realtime-gui.bat),麦克风输入、转换、播放的闭环延迟 170ms,适合直播和游戏。
  • API 调用:程序化接入参考 api_240604.py,支持传入语音地址和参数,返回转换后的音频。
  • 批量推理:整个目录批量转换用 tools/infer_batch_rvc.py。
  • 更多资料:疑难问题查 FAQ docs/cn/faq.md,调参技巧看训练指南 docs/en/training_tips_en.md,新功能关注更新日志。

动手清单

  1. 装好 FFmpeg,跑一次模型下载脚本补齐 assets 目录
  2. 启动界面:Windows 双击 go-web.bat,其他系统用上述启动命令
  3. 在 WebUI 里预处理 10 分钟语音,训练 1000 轮并生成索引
  4. 到推理选项卡完成第一次 AI 变声,听效果
  5. 遇到问题先查 FAQ,再对照本文排查路径与显存设置

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询