Duix.Avatar 免费开源数字人完整教程:10秒视频克隆形象,离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
做一条数字人口播视频,传统方案要么按条收费,要么把真人素材上传到云端,成本和隐私都让人纠结。Duix.Avatar 是一个完全开源免费的 AI 数字人工具包,在本地离线完成形象与声音克隆:提交一段约 10 秒的真人视频即可得到数字分身,再输入文案或上传音频,就能自动生成口型同步的播报视频。
它适合谁,能替你做什么
- 内容创作者:一个人、一台电脑就能产出数字人口播内容,不用再出镜、补拍和剪后期。
- 企业用户:素材和成片都在内网机器上生成,全程不联网,降低数据外泄风险。
- 开发者:项目开放了模特训练与视频合成的本地接口,可以把数字人能力直接嵌进自己的业务系统。
部署实操:把三个服务跑起来
Windows 一键部署步骤
先确认硬件满足条件,再动手装环境。
系统要求
- Windows 10 19042.1526 或更高版本
- 必须有 D 盘:存放数字人、作品等数据,空闲空间大于 30G
- C 盘存放 Docker 镜像,空闲大于 100G;空间不够时,装好 Docker 后在设置里把磁盘位置改到别的分区
推荐配置:i5-13400F、32G 内存、RTX 4070。必须有 NVIDIA 显卡且驱动安装正常,这是硬性条件。
安装步骤
- 拉取项目代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar- 检查并更新 WSL(未安装过就先用
wsl --install装一下):
wsl --list --verbose wsl --update- 安装 Docker for Windows,按 CPU 架构选择对应安装包。
- 在仓库的
deploy目录启动服务端,首次拉取约 70G 流量,建议连 WiFi 耐心等待:
cd deploy docker-compose up -d看到 Docker 中出现 3 个服务且全部 Running 即部署成功。磁盘紧张可改用精简版,只启动一个Duix.Avatar-gen-video服务:
docker-compose -f docker-compose-lite.yml up -d- 50 系显卡(5090 已测试通过,30/40 系 CUDA 12.8 用户也可用)换用专用编排文件:
docker-compose -f docker-compose-5090.yml up -d- 客户端从官方构建的发布页下载安装包,双击
Duix.Avatar-x.x.x-setup.exe完成安装。
Ubuntu 22.04 部署步骤
Ubuntu 版本已完成 22.04 Desktop(内核 6.8.0-52-generic)适配验证,客户端界面支持英文。推荐配置同 Windows(i5-13400F / 32G 内存 / RTX 4070 / NVIDIA 驱动),另需硬盘空闲大于 100G。
- 检查 Docker,没装过就补装:
docker --version sudo apt update sudo apt install docker.io docker-compose- 按 NVIDIA 官方文档安装显卡驱动,执行
nvidia-smi能显示显卡信息即成功;再安装让 Docker 调用 GPU 的 NVIDIA Container Toolkit:
sudo apt-get install -y nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker- 启动 Linux 版服务端:
cd deploy docker-compose -f docker-compose-linux.yml up -d- 客户端下载 Linux 版 AppImage,双击即可运行;root 用户需加参数:
./Duix.Avatar-x.x.x.AppImage --no-sandbox核心流程上手 🎬:从克隆形象到导出成片
整条链路分三步:训练模特 → 驱动形象 → 导出成片。
数字人模特训练入口在哪
入口在客户端首页的快速定制(Create Avatar)卡片。输入一段约 10 秒的真人说话视频,程序会自动分离出静音视频与音频,分别用于形象克隆和声音克隆。提交后得到一个可反复使用的数字模特,脚本支持中、英、日、韩、法、德、阿拉伯、西班牙语八种语言。
怎么驱动数字人开口说话
入口是首页的短视频制作(Create Video)卡片。左侧选择已训练好的模特,中间实时预览,右侧填写内容:可以直接输入文案,由系统转成语音驱动口型;也可以直接上传音频文件,数字人会按语音的节奏和语调做动作与表情变化。
成片在哪导出
合成完成后,视频自动进入我的作品列表,支持查看、保存和删除;多个模特可在客户端内统一管理,按场景随时切换。
接入与扩展 ⚡:开放 API 与选型建议
服务端启动后,接口通过http://127.0.0.1在本地暴露。完整调用逻辑可参考src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js三个文件。
模型训练接口
先把视频分离为静音视频 + 音频,音频放入约定目录(与语音合成服务约定,可在 docker-compose 中修改):
D:\duix_avatar_data\voice\data再调用预处理接口,把音频转成克隆所需的参考信息:
http://127.0.0.1:18180/v1/preprocess_and_tran返回中的asr_format_audio_url和reference_audio_text要保存下来,后续合成要用。
音频合成接口
http://127.0.0.1:18180/v1/invoke传入上一步的参考音频、参考文本和要合成的文案,即可输出克隆音色的语音文件。
视频合成接口
提交合成任务:
http://127.0.0.1:8383/easy/submit用任务 code 轮询进度(GET 请求,taskCode即提交时的code值):
http://127.0.0.1:8383/easy/query?code=${taskCode}本地部署还是 API 服务?怎么选
| 对比维度 | 自建本地部署 | 数字人 API 服务 |
|---|---|---|
| 更推荐人群 | 有深度学习经验、想深度定制的技术用户 | 追求快速集成、需企业级保障的商业团队 |
| 硬件投入 | 需自备 GPU 服务器 | 无需采购 GPU |
| 二次开发 | 源码可自由修改扩展 | 只能在 API 层面扩展 |
| 运维迭代 | 维护成本较高,问题修复依赖社区 | 维护简单,新模型算法优先可用 |
| 生成效果 | 口型效果可用 | 口型更自然、画质更高 |
| 商用授权 | 全球免费商用(超大企业需签商业许可协议) | 可商用 |
判断标准很简单:自己玩、想改代码选本地部署;要上线、要省心选 API 服务。
遇到问题,先按这份清单自查 🔧
- 服务是否全部 Running:在 Docker 里确认 3 个服务的状态(精简版只需 1 个),任何一处在重启,后面都会卡住。
- 显卡与驱动是否就位:执行
nvidia-smi看能否输出显卡信息。本项目算力全部在本地,没有 NVIDIA 显卡或驱动,服务根本起不来。 - 镜像拉取超时、连接失败:Docker Hub 官方源不稳定,在 Docker Engine 配置中加入国内镜像源(registry-mirrors)后重试。
- 克隆形象报错:素材视频必须有人在说话,否则声音克隆无从下手;若报
Connection refused,多为语音识别服务启动慢,等服务几分钟再试,内存只有 16G 的机器可能直接起不来。 - 先更新、留好日志再提问:项目更新频繁,先确认服务端(重新
docker-compose up -d)和客户端都是最新版。排查时保留两份日志:客户端在右上角设置菜单点打开日志,定位到main.log;服务端在对应容器日志页点击复制。
写在最后
Duix.Avatar 把原本昂贵的数字人生产线搬进了本地机器,开源社区的持续迭代还会不断降低它的门槛。建议先按本文完成一次完整部署,遇到问题查阅 常见问题,并阅读 LICENSE 了解商用授权边界。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考