Duix.Avatar 本地部署教程:用一段视频离线生成数字人口播视频
2026/9/23 5:10:03 网站建设 项目流程

Duix.Avatar 本地部署教程:用一段视频离线生成数字人口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个支持本地部署的开源数字人项目。用一段 10 秒左右的真人说话视频,即可克隆出数字人的形象和声音,再输入文案或上传音频,离线生成口播视频。全程运行在自己电脑上,素材不经过外部服务器,适合批量生产口播内容、想自建数字人应用的开发者,以及对素材隐私敏感的用户。

数字人本地部署的三个典型场景

一段视频克隆数字人形象与声音

提交一段真人说话的视频,程序会自动提取面部特征完成形象建模,同时用视频中的声音做克隆。生成的模型保存在本地,之后可以反复使用。

文案直接驱动口播视频

不需要自己录音频。写入一段文案,内置的语音合成服务会把文字转成语音,并驱动数字人做出对应的口型和表情。文案支持中、英、日、韩、法、德、阿、西 8 种语言。

离线环境运行

服务端容器和客户端启动完成后,视频生成不依赖外网。素材和成片都在本机处理,适合有合规要求或内网环境的内容制作场景。

部署前环境检查:显卡、内存与磁盘空间

先确认三件事:

  • 开发客户端需要 Node.js 18;
  • 必须有 NVIDIA 显卡并装好最新驱动,安装后用nvidia-smi确认能显示显卡信息;
  • 磁盘:Windows 版要求 D 盘空闲大于 30G(存数字人和作品),Docker 镜像所在磁盘空闲大于 100G;内存建议 32G 及以上。

镜像所在磁盘空间不足时,可以在 Docker Desktop 的 Settings → Resources → Advanced 里把 Disk image location 改到另一个盘:

Docker 服务端启动与 compose 文件选择

Windows 上若尚未安装 WSL,先执行:

wsl --install wsl --update

再安装 Docker Desktop,启动后首次接受协议、跳过登录。拉取代码并在 deploy 目录启动服务端:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy && docker-compose up -d

首次拉镜像约 70G,耗时半小时以上。Docker 中出现 3 个 Running 状态的服务即部署成功。显存或内存有限时改用 lite 版:

docker-compose -f docker-compose-lite.yml up -d

NVIDIA 50 系列显卡(5090 已验证,30/40 系列 cuda12.8 也可)使用专用配置:

docker-compose -f docker-compose-5090.yml up -d

Ubuntu 22.04 上对应执行docker-compose -f docker-compose-linux.yml up -d

客户端安装与首次生成口播视频

客户端有两种获取方式:直接下载官方构建包安装;或从源码构建:

npm install npm run dev

启动后先创建数字人模型:进入形象创建页面,上传准备好的说话视频,等待训练完成。再到 Create Video 入口填入文案(或上传音频文件),点击生成,最后在 My Works 列表里预览成片。

成功的标志:My Avatars 中能看到模型,My Works 中有一条可播放的视频,且口型与音频基本对齐。

稳定运行:镜像加速、服务预热与内存要求

  • 拉镜像连接失败:compose 启动时出现request canceled之类的报错,说明 Docker Hub 官方源不稳定。在 Docker Desktop 的 Docker Engine 配置里加入registry-mirrors国内镜像源,Apply and restart 后重试。

  • 刚启动就克隆形象容易失败:ASR 服务预热较慢,服务端启动后等几分钟再创建模型,可避免 Connection refused。
  • 内存 16G 的机器可能起不全服务,建议按 32G 配置准备。
  • Ubuntu 的 root 用户双击 AppImage 无法运行时,在终端加--no-sandbox参数启动。

常见故障:按现象排查

新增模特时直接报错检查上传的视频里是否有人在说话。声音克隆依赖这段人声,无声视频或纯环境音视频会失败。换一段清晰说话的视频重试。

客户端正常但生成卡住或无响应先点客户端菜单里的 Open Log 查看本地日志;再确认服务端 3 个 Docker 服务是否都是 Running,并用nvidia-smi核对显卡。服务端日志可以在容器的 Logs 页面直接复制:

怀疑版本过旧项目更新较频繁。服务端在 deploy 目录重新执行docker-compose up -d即可更新,客户端拉取代码后重新 build。

下一步:开放 API 与可调配置

  • 开放 API:服务端启动后,模型训练、音频合成、视频合成均在 127.0.0.1 上暴露 HTTP 接口,调用示例可参考src/main/service/下的 model.js、video.js、voice.js。
  • 错误日志解读:更完整的自查步骤和报错说明见 doc/常见问题.md。
  • 端口与数据目录:音频目录(如D:\duix_avatar_data\voice\data)等约定路径可在deploy/下的 compose 文件中调整。

先保证三个服务都处于 Running 状态,然后用一段 10 秒说话视频跑通第一条成片。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询