本地免费制作口播数字人视频:Duix.Avatar 数字人克隆与视频生成完整教程
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
把一段十秒左右、带人声的正面视频交给 Duix.Avatar,你的电脑会在本地训练出一个属于你的数字形象;之后再输入一段文字,就能得到一段由"你"开口说话的口播视频,口型、音色都来自你本人。这就是 Duix.Avatar 能帮你做出来的东西——一个完全离线运行的开源 AI 数字人视频工具,形象克隆、声音克隆和文本驱动视频合成都发生在你自己机器上,不经过任何第三方服务器。
先认识一下项目:为什么数字人克隆工具值得跑在本地
用过云端数字人服务的人大概都感受过两件事:按月扣费的账单,以及"我的素材要传到对方服务器上"这件事本身。Duix.Avatar 的思路是把这两件事都去掉:项目完全开源,克隆算法和合成框架直接放在代码仓库里,部署之后所有 AI 计算都在本地 GPU 上跑,录制的形象视频和声音样本不会离开你的硬盘。
| 看什么 | 云端数字人服务 | Duix.Avatar 本地部署 |
|---|---|---|
| 持续费用 | 按月订阅,视频越多开销越大 | 部署完成后使用不产生费用 |
| 资料去向 | 视频和声音样本需上传服务商 | 文件始终留在本地磁盘 |
| 生成速度 | 受网络与排队影响 | 直接取决于你的显卡 |
| 能改到什么程度 | 只能用产品提供的功能 | 源码开放,可随需求扩展 |
它还顺手解决了几个容易踩的坑:界面是图形化的,没有技术背景也能上手;支持导入多个形象并统一管理;客户端在英文和中文之间可以自由切换。
动手之前:数字人克隆的硬件与系统环境要求
操作系统:Windows 10(19042.1526 或更高版本),或 Ubuntu 22.04 Desktop。确认命令:Windows 用winver,Ubuntu 用lsb_release -a。
磁盘:Windows 部署要求必须有 D 盘,D 盘(存数字人和项目数据)空闲大于 30GB,C 盘(存镜像文件)空闲大于 100GB;不足的话,装完 Docker 后可以把磁盘镜像位置改到空间更大的盘。
显卡:必须是 NVIDIA 显卡并装好驱动。三个核心容器都声明了runtime: nvidia,没有 NVIDIA 显卡或驱动没装对,服务根本起不来——这一点比 CPU 重要得多。
配置档位参考:
| 档位 | CPU | 内存 | 显卡 | 存储 | 大致表现 |
|---|---|---|---|---|---|
| 入门尝鲜 | 第 10 代酷睿 i5 或同档 AMD | 16GB | RTX 3060(6GB 显存) | 256GB SSD + 1TB HDD | 可完成基础形象训练,合成 720p 视频 |
| 进阶创作 | 第 13 代酷睿 i7-13700F | 32GB | RTX 4070(12GB 显存) | 512GB SSD + 2TB SSD | 训练速度明显更快,合成 1080p 视频 |
| 专业批量 | 第 14 代酷睿 i9-14900K | 64GB | RTX 4090(24GB 显存) | 1TB SSD + 4TB SSD | 大批量任务与 4K 合成 |
选件时优先保显卡显存;如果预算只够加一项,建议加内存到 32GB,训练中途内存不足的报错并不少见。
从 clone 代码到服务全部跑通:安装部署步骤
先拿到代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix.Avatar接着按顺序做四件事:
- 确认系统版本(
winver或lsb_release -a),不达标就先换系统或升级。 - Windows 用户准备 WSL:执行
wsl --list --verbose查看是否已安装,没有或版本旧就执行wsl --update。 - 安装 Docker:Windows 下载 Docker Desktop,首次启动接受协议、跳过登录即可;Ubuntu 执行
sudo apt update后安装docker.io与docker-compose,并安装 NVIDIA Container Toolkit 让 Docker 能用上显卡(详见 README 的 Ubuntu 安装说明)。磁盘镜像位置可以在 Docker 设置里改到空间更大的盘。 - 启动服务:进入
deploy目录,执行docker-compose up -d。这个目录下还有docker-compose-lite.yml、docker-compose-linux.yml等变体,按需选择。
首次启动会下载大约 70GB 的镜像,请留在 WiFi 环境等待约半小时,期间不要反复 Ctrl+C。完成后执行docker ps,看到fun-asr、fish-speech-ziming、duix.avatar三个容器状态都是 Up,即部署成功:
cd deploy docker-compose up -d docker ps三者分别负责语音识别、语音合成和视频合成,对外暴露在http://127.0.0.1的 18180 与 8383 端口上,客户端会自动连接,不需要你手动配置。
一次完整创作:从克隆形象到生成视频
部署完成后打开客户端,首页有「Create Video」和「Create Avatar」两个入口,下方分别是"我的作品"和"我的数字人"列表。一次完整的创作按三步走。
第一步:建数字人形象
进入 Create Avatar,上传一段 10 秒左右的正面视频。注意两个硬性要求:分辨率建议 720p 以上、光线均匀;视频里必须有人声,因为系统要用这段声音做克隆——只有画面没有声音的视频会直接报错。提交后本地开始训练,基础配置大约 30 分钟,训练完成后你会得到一个可反复复用的数字形象。
第二步:声音随形象一起克隆
声音克隆依赖你上传视频里的人声,克隆出来的音色、语调和你本人一致,后续生成的语音都基于它。脚本支持 8 种语言:英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语,语速、音调等参数都可以调。如果只想换音色而不想重录形象,可以在声音样本上单独处理,对应接口走的是 18180 端口的合成服务。
第三步:输入文字,生成口播视频
进入 Create Video,选择已训练好的形象,把口播文案贴进文本框。系统会把文字转成克隆的语音,再驱动形象做出对应的口型与表情,最终输出一条音视频对齐的视频。整个过程就是"文本 → 语音 → 视频"一条线,不需要你在中间手动拼接任何素材。
数字人视频用在哪里:三个真实场景
- 课程与培训录播:录制教师正面视频训练形象,把讲义变成口播稿,语速调到自己讲解时习惯的节奏,一条课程视频不需要反复进棚。
- 企业宣传物料:用代言人的形象批量产出产品介绍、活动预告。声音样本建议在安静环境、用质量好的麦克风录,口播稿统一成品牌口吻后,后续只需替换文字。
- 自媒体批量更新:固定一个虚拟主播的形象和声音,保证账号辨识度;文案批量准备后逐条合成,省去反复拍摄剪辑。
常见问题排查与日常优化
容器起不来。先执行docker ps看是哪几个容器不在 Running;再用netstat -ano | findstr "18180 8383"确认端口没被占用;检查 NVIDIA 驱动是否为最新;最后确认磁盘至少还有 30GB 空闲。多数"服务起不来"最终都落在这四处之一。
训练卡住或报错。最常见的原因还是素材:视频没有人声、分辨率低于 720p、或光线过暗。重录一段,必要时转成 H.264 编码的 MP4 再试;显存吃紧的机器可以适当降低训练参数,或者把其他占显存的程序关掉。另外 asr 服务启动比主服务慢,容器刚起来时别急着提交训练,等几分钟再操作。
合成变慢或卡顿。关掉与合成竞争 CPU 和内存的应用;用系统监控工具观察显存是否被占满;定期清理缓存目录(~/.duix_avatar/cache/)。日常维护上,每月更新一次 Docker 镜像、每周清一次临时文件;训练任务一次只跑一个,多个视频任务集中排队处理,比穿插执行更稳。排障时需要看日志,客户端日志入口在右上角菜单的 "Open Log"(文件位于AppData\Roaming下的 logs 目录),服务端日志则直接打开对应容器的 Logs 页复制即可。
继续探索:源码、接口与文档
想往下挖的话,按目录看代码效率最高:
- 模型训练 / 视频合成 / 声音合成的 API 调用逻辑:src/main/service/
- 端口与服务地址等运行配置:src/main/config/
- 各服务接口实现(f2f、tts):src/main/api/
- 本地数据库与存储:src/main/db/
- 部署编排文件(含 lite 精简版与 Linux 版):deploy/
- 中文排障文档,含镜像源配置、模特报错等常见案例:doc/常见问题.md
遇到问题时,顺序建议是:先读一遍 doc/常见问题.md,再到仓库 Issues 里搜关键词,最后带着复现步骤和容器日志去提问——项目更新比较频繁,很多问题在新版本里已经修掉了。
结尾
从克隆第一个形象开始:找一段十秒、有清晰人声的正面视频,按上面流程把服务跑起来,然后输入你的第一段口播文案。跑通之后,把训练好的模型和项目文件备份到外部存储,剩下的事情就是慢慢扩展你的使用场景了。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考