Duix.Avatar 本地部署教程:用一段视频离线生成数字人口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个支持本地部署的开源数字人项目。用一段 10 秒左右的真人说话视频,即可克隆出数字人的形象和声音,再输入文案或上传音频,离线生成口播视频。全程运行在自己电脑上,素材不经过外部服务器,适合批量生产口播内容、想自建数字人应用的开发者,以及对素材隐私敏感的用户。
数字人本地部署的三个典型场景
一段视频克隆数字人形象与声音
提交一段真人说话的视频,程序会自动提取面部特征完成形象建模,同时用视频中的声音做克隆。生成的模型保存在本地,之后可以反复使用。
文案直接驱动口播视频
不需要自己录音频。写入一段文案,内置的语音合成服务会把文字转成语音,并驱动数字人做出对应的口型和表情。文案支持中、英、日、韩、法、德、阿、西 8 种语言。
离线环境运行
服务端容器和客户端启动完成后,视频生成不依赖外网。素材和成片都在本机处理,适合有合规要求或内网环境的内容制作场景。
部署前环境检查:显卡、内存与磁盘空间
先确认三件事:
- 开发客户端需要 Node.js 18;
- 必须有 NVIDIA 显卡并装好最新驱动,安装后用
nvidia-smi确认能显示显卡信息; - 磁盘:Windows 版要求 D 盘空闲大于 30G(存数字人和作品),Docker 镜像所在磁盘空闲大于 100G;内存建议 32G 及以上。
镜像所在磁盘空间不足时,可以在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 改到另一个盘:
Docker 服务端启动与 compose 文件选择
Windows 上若尚未安装 WSL,先执行:
wsl --install wsl --update再安装 Docker Desktop,启动后首次接受协议、跳过登录。拉取代码并在 deploy 目录启动服务端:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy && docker-compose up -d首次拉镜像约 70G,耗时半小时以上。Docker 中出现 3 个 Running 状态的服务即部署成功。显存或内存有限时改用 lite 版:
docker-compose -f docker-compose-lite.yml up -dNVIDIA 50 系列显卡(5090 已验证,30/40 系列 cuda12.8 也可)使用专用配置:
docker-compose -f docker-compose-5090.yml up -dUbuntu 22.04 上对应执行docker-compose -f docker-compose-linux.yml up -d。
客户端安装与首次生成口播视频
客户端有两种获取方式:直接下载官方构建包安装;或从源码构建:
npm install npm run dev启动后先创建数字人模型:进入形象创建页面,上传准备好的说话视频,等待训练完成。再到 Create Video 入口填入文案(或上传音频文件),点击生成,最后在 My Works 列表里预览成片。
成功的标志:My Avatars 中能看到模型,My Works 中有一条可播放的视频,且口型与音频基本对齐。
稳定运行:镜像加速、服务预热与内存要求
- 拉镜像连接失败:compose 启动时出现
request canceled之类的报错,说明 Docker Hub 官方源不稳定。在 Docker Desktop 的 Docker Engine 配置里加入registry-mirrors国内镜像源,Apply and restart 后重试。
- 刚启动就克隆形象容易失败:ASR 服务预热较慢,服务端启动后等几分钟再创建模型,可避免 Connection refused。
- 内存 16G 的机器可能起不全服务,建议按 32G 配置准备。
- Ubuntu 的 root 用户双击 AppImage 无法运行时,在终端加
--no-sandbox参数启动。
常见故障:按现象排查
新增模特时直接报错检查上传的视频里是否有人在说话。声音克隆依赖这段人声,无声视频或纯环境音视频会失败。换一段清晰说话的视频重试。
客户端正常但生成卡住或无响应先点客户端菜单里的 Open Log 查看本地日志;再确认服务端 3 个 Docker 服务是否都是 Running,并用nvidia-smi核对显卡。服务端日志可以在容器的 Logs 页面直接复制:
怀疑版本过旧项目更新较频繁。服务端在 deploy 目录重新执行docker-compose up -d即可更新,客户端拉取代码后重新 build。
下一步:开放 API 与可调配置
- 开放 API:服务端启动后,模型训练、音频合成、视频合成均在 127.0.0.1 上暴露 HTTP 接口,调用示例可参考
src/main/service/下的 model.js、video.js、voice.js。 - 错误日志解读:更完整的自查步骤和报错说明见 doc/常见问题.md。
- 端口与数据目录:音频目录(如
D:\duix_avatar_data\voice\data)等约定路径可在deploy/下的 compose 文件中调整。
先保证三个服务都处于 Running 状态,然后用一段 10 秒说话视频跑通第一条成片。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考