OpenVoice 即时语音克隆:免安装 3 步体验,附本地部署 4 个避坑点
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
OpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型,MIT 协议、商用免费:上传几秒参考音频,就能生成同音色的朗读语音。本地部署建议有 GPU 的机器(官方文档未给出显存具体数字);不想装环境就直接用官方在线服务,零安装。
先对号入座:OpenVoice 语音克隆适合的 4 类场景
- 🎬 给视频解说换音色,不重录
- 📚 同一音色批量读中英文
- 📱 让设备用熟悉的声音回应
- 🌐 同一"人"读多语言对比发音
如果你的需求是"让 AI 用某个人的声音读一段文字",往下读;如果要克隆情感或口音,最后的能力表会告诉你它停在哪。
免安装 3 步在线体验,本地部署 5 行命令
在线玩法,3 步出结果:
- 进入官方在线服务的 Workshop,点"Create a Bot"创建你的 Bot。
- 在 Setting 里打开 Voice (TTS),到 Widget Center 的 TTS 分类里挑一个基础音色并试听。
- 用 voice cloning 上传几秒参考音频,输入要朗读的文本,等几秒即可试听克隆结果。
语言入口共 9 个:英式英语、美式英语、印度英语、澳洲英语、西班牙语、法语、中文、日语、韩语;参考音频本身可以是任意语言。
本地最小命令(Linux,Python 3.9):
conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完后,把官方 checkpoint 解压到checkpoints(V1)或checkpoints_v2(V2)目录,然后运行python -m openvoice_app --share。验证方法:浏览器打开它给出的 Gradio 页面,输入文本、上传参考音频、勾选同意条款后点 Send,右侧"Synthesised Audio"区域自动播放合成语音即为成功。注意本地 demo 一次最多 200 字符,主推英文,中文仅支持 default 风格。
能力清单:它交付了什么,停在哪里
| 它交付的 | 它停在哪 |
|---|---|
| 几秒干净人声即可克隆音色 | 只克隆音色,不克隆情感与口音 |
| 情感、语调、节奏可单独调 | 换情感或口音得换基础 TTS 模型 |
| V2 原生支持英西法中日韩 6 语 | 基础模型不支持的语言无法直接输出 |
| 参考音频可以是任意语言 | 有噪音、多人同说的音频效果变差 |
| 零样本跨语言克隆,不用训练 | 本地 demo 文本限 200 字符 |
原理三步走:文本如何变成你的声音
输入分两路。第一路:你的文本加风格参数(情感、语调、节奏)进基础 TTS 模型(一个"默认嗓子"的通用朗读模型),先合成一段带目标风格的语音。第二路:音色提取器(把音频压成音色特征向量的"指纹扫描器")分析你上传的参考音频,得到目标人的音色特征。最后,音色转换模块把合成语音的音色替换成参考人的,风格参数不动。输出落到 outputs/output.wav,风格由你指定、音色像那个人,在页面里直接可听。
本地部署最容易踩的 4 个坑及处理办法
- 启动提示找不到模型?漏下权重了:checkpoint 必须解压到
checkpoints(V1)或checkpoints_v2(V2)目录。 - 首次运行卡在下载?openvoice/se_extractor.py 里的 silero-vad 组件首次调用会自动联网下载,断网环境手动下载并解压到
~/.cache/torch/hub/对应目录。 - V2 报缺依赖?除主包外还要装 MeloTTS 组件并下载词典,具体命令以 docs/USAGE.md 为准。
- 生成的声音不像参考人?依次查参考音频:有无背景噪音、是否多人同说、时长是否太短、有无长静音段。
结语
把音色克隆与风格合成解耦,是 OpenVoice 最值得借鉴的设计:音色只从参考音频来,风格完全归你控制。几秒音频、MIT 协议、商用免费,有 GPU 的开发者当天就能接进自己的产品。
延伸阅读:使用文档:docs/USAGE.md · 常见问题:docs/QA.md · 核心源码:openvoice/
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考