如何用免费的 OpenVoice 五分钟克隆出任意声音?一份即时语音克隆完整指南
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
OpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型(MIT 许可证)。给它几秒参考语音,写一句话,它就还你一段"那个人"读出来的声音,情感、口音、节奏还能单独调。跟着走一遍,你能从零跑通一次完整克隆。
🎬 想给播客换个嗓子,又不想重录?
想象一下:播客剪辑到一半,你突然觉得主播的嗓子不合适。重录?麻烦。请配音?贵。最省事的办法就是克隆一个声音。OpenVoice 的卖点正是这个:给它一段 5 到 15 秒的语音,它就能让"那个人"替你读任意你想写的文字,而且你不用会写代码。效果拿去直接做内容都够格。
🧠 60 秒看懂 OpenVoice 语音克隆原理
可以把它理解成"给别人的嘴贴一张音色贴纸"。OpenVoice 先用一个基础 TTS 模型,按你指定的语言、情感和口音生成一段语音;再让音色提取器从你的参考音频里抽出"音色指纹",贴到这段语音上。出来的就是节奏一样、但完全换了一个嗓子的声音。
🚀 5 分钟跑通第一次语音克隆
第 1 步,准备环境和代码:建一个 Python 3.9 环境,把项目拉进来装好依赖。
conda create -n openvoice python=3.9 && conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice && pip install -e .第 2 步,拿模型权重:把检查点文件下载后解压到项目根目录的 checkpoints 文件夹,官方地址在 docs/USAGE.md 里。
第 3 步,备一段参考语音:录 5 到 15 秒,单人说话,没有背景音乐,越干净越好。
第 4 步,一行命令打开本地网页界面:
python -m openvoice_app --share第 5 步,浏览器打开页面,上传参考音频、输入文字、点生成。你听到的就是克隆结果——第一次运行要加载模型,耐心等几分钟。
不想折腾环境?平台上有现成的部署服务:进入工作坊、创建一个机器人、用语音克隆创建声音,三步搞定。
🎯 三个值得试的方向
跑通第一次克隆之后,别急着收工,下面三个方向最值得玩。
- 声音风格微调→ 情感、口音、节奏分开控制,同一个声音读出不同气质 → 看 demo_part1.ipynb,改几个参数就行。
- 跨语言克隆→ 参考语音说一种语言,输出语音说另一种 → 看 demo_part2.ipynb,换基础说话人的语言。
- V2 原生多语言→ 中英日韩等六种语言音质更好 → 看 demo_part3.ipynb,换成 V2 权重即可。
⚖️ 版本怎么选
| 你的情况 | 选哪个版本 | 为什么 |
|---|---|---|
| 要克隆到没见过的语言(如德语) | V1 | 零样本跨语言,语言组合不限 |
| 只用六种主流语言、要更好音质 | V2 | 原生多语言训练,音质更好 |
| 只想先玩玩、不想装环境 | 都行 | 平台上先试部署好的服务 |
新手选 V2 更稳:音质好,六种语言覆盖绝大多数场景;需要冷门语言再回头看 V1。
🔧 效果不对?先看这
- 克隆的声音不像本人→ 参考语音太短或有背景噪音 → 重录一段 5 到 15 秒的干净单人语音。
- 生成的语音发闷、有杂音→ 参考音频采样率偏低或版本旧 → 换 16kHz 以上录音,改用 V2 权重。
- 读外语时腔调奇怪→ 基础说话人模型和目标语言不匹配 → 换对应语言的基础模型,或用 V2 原生支持。
- 首次运行报 VAD 模型下载错误→ 网络访问不了外部模型 → 按 docs/QA.md 的说明手动下载并放置模型文件。
下一步
环境装好的话,先用本地界面把自己的声音克隆一遍,感受最直接。想更进一步,就去平台的 TTS 小部件中心挑个基础声音模型直接用。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考