☰
一段10秒视频克隆数字人:Duix.Avatar 开源数字人本地部署教程
2026/9/27 21:17:41 网站建设 项目流程

一段10秒视频克隆数字人:Duix.Avatar 开源数字人本地部署教程

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

把手机架好,对着镜头说上 10 秒话,你的形象和声音就能被完整复刻——之后输入任意一段文字,"你"就会对着镜头把它念出来。Duix.Avatar 是一款开源数字人克隆项目,代码完全开源免费:只需提交一段 10 秒左右的视频,就能在本地完成形象克隆与声音克隆,再用文字或音频驱动数字人,自动合成口播视频。它适合想在个人电脑上跑数字人、又不想把素材传到云端的创作者和开发者;最大的特点是全离线运行——视频、声音、模型都留在本机硬盘里,部署完成后断网也能生成。

先确认显卡够不够:NVIDIA 显卡是硬门槛

判断这台机器值不值得投入,先看这一节。Duix.Avatar 的全部算力都跑在本地 GPU 上,项目文档写得很直白:没有英伟达显卡、或没装好驱动,三个服务根本起不来。纯核显的电脑和 Mac 可以先放弃。

配置项硬门槛推荐配置
显卡NVIDIA 显卡,且驱动装好RTX 4070
内存16G(ASR 服务可能起不来)32G 及以上
硬盘(Windows)C盘 100G 存镜像 + D盘 30G 存数据—
硬盘(Ubuntu)空闲空间大于 100G—
系统Windows 10 19042.1526+ 或 Ubuntu 22.04第13代 i5-13400F 级 CPU

Windows 用户如果 C 盘腾不出 100G,装完 Docker Desktop 后可以在设置里把镜像存储位置挪到别的磁盘:

机器达标了,下一条命令就能把服务拉起来。

一条命令拉起本地数字人服务

先装容器环境。Windows 用户先执行wsl --install装好 WSL(已有则跳过),再执行wsl --update更新,然后安装 Docker Desktop,首次运行接受协议、跳过登录即可。Ubuntu 用户执行下面两条命令装 Docker,另外还要装好 NVIDIA 显卡驱动和 NVIDIA Container Toolkit(README 里有完整步骤),装完执行nvidia-smi能看到显卡信息才算成功:

sudo apt update sudo apt install docker.io docker-compose

接着把仓库拉到本地,deploy 目录 里就是全部部署脚本:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

Ubuntu 用户执行:

cd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -d

首次运行会下载约 70G 的镜像,README 建议预留半小时左右。当 Docker 里出现 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个服务且都是 Running,服务端就算部署完成了。硬件吃紧可以改用 lite 单镜像版本(把配置文件换成 docker-compose-lite.yml);RTX 50 系列显卡(5090 已测试通过)则用 docker-compose-5090.yml。

如果拉镜像时一直报 request canceled 或 Connection refused,多半是连不上 Docker Hub,这个问题放到后面的坑位一节处理。服务就绪后打开客户端,剩下的都在界面上点。

从上传视频到生成第一条数字人口播视频

客户端是独立安装包,不用跑源码:到项目 Releases 页面下载对应系统的版本,Windows 双击Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 双击Duix.Avatar-x.x.x.AppImage直接启动(root 用户桌面需要在终端加--no-sandbox参数运行)。启动后它会连接本机那三个服务。

创建数字人只有一步:在主界面点 Create Avatar,上传一段 10-20 秒的视频。系统会自动转码、分离音频,用视频里的人声训练你的声音克隆模型,同时保存形象。素材上有一个硬性要求:视频里必须有人清晰地说话,因为声音克隆完全靠这段人声,无声或只有 BGM 的视频会直接报错。

生成口播视频同样简单:在 My Avatars 里选中刚创建的数字人,输入文案——脚本支持中、英、日、韩、法、德、阿拉伯、西班牙 8 种语言——点击生成,稍等片刻,成片会出现在 My Works 列表里。

有一个时间差要留意:ASR 服务启动偏慢,服务端刚拉起来时别马上克隆形象,等几分钟再操作,否则会报连接被拒。

第一条视频出来之后,可以回头看一眼它和别的数字人方案最不一样的地方。

全离线运行:数字人素材和模型不出本机

这一点不是宣传话,而是部署方式决定的:

  • 三个服务都是本地 Docker 容器,推理全部发生在你自己的显卡上,部署完成后断网不影响生成。
  • 你的源视频、提取的音频、克隆出的模型全部写在本地目录:Windows 是D:\duix_avatar_data,Ubuntu 是~/duix_avatar_data。
  • 商用免费:README 写明支持全球免费商用,但用户量超 10 万或年营收超 1000 万美元的企业需要签署商业许可协议。

商业数字人 SaaS 的普遍做法是把视频上传到云端渲染,而这里的素材从头到尾没有离开过机器。同时 README 也如实标注了差距:开源本地版的口型效果定位是"效果可用",官方付费 API 标注"更高清",对口型要求很高的场景要心里有数。

本地方案也有自己的脾气,下面两个坑踩的人最多。

本地部署数字人最常踩的两个坑

坑一是拉镜像失败。docker-compose up -d报 request canceled 或 Error response from daemon,几乎都是 Docker Hub 连接不稳定。解决方式是配置国内镜像源:Windows 在 Docker Desktop 设置 → Docker Engine 里加 registry-mirrors,Ubuntu 改/etc/docker/daemon.json,重启 Docker 生效,常见问题 里附了可用的镜像源列表。

坑二是克隆形象报错或生成卡住,常见三种情况:

  • 新增模特直接失败:回去检查素材,视频里必须有人清晰说话。
  • 克隆时日志出现 Connection refused:ASR 服务还没起完,等服务几分钟再试;16G 内存的机器可能根本拉不起这个服务。
  • 视频生成卡在某个进度不动:在 Docker 里打开 duix-avatar-tts 容器的 Logs 看具体报错。

客户端右上角 Setting 菜单里的 Open Log 可以直接打开客户端日志,排查"点了没反应"这类问题。

往哪深入:开放 API 与批量生成

不想停留在图形界面,服务端暴露的本地接口可以直接调用,拼出自己的批量生成流水线:

  • 声音合成:http://127.0.0.1:18180/v1/invoke
  • 视频合成:http://127.0.0.1:8383/easy/submit,提交后用http://127.0.0.1:8383/easy/query轮询进度
  • 模特训练与合成的完整请求参数,客户端自己的代码 src/main/service 里都有现成写法

README 的"开放 API"一节给出了每个接口的入参和返回示例,照抄即可。

现在就可以做的三件事

  1. 先跑一次nvidia-smi(Windows 用 PowerShell,Ubuntu 用终端),确认显卡和驱动正常——这一步过了,后面一半的坑可以提前排除。
  2. 用手机录一段 10 秒测试视频:正面、光线均匀、说话清晰、背景简单,作为第一个数字人的唯一素材。
  3. 把服务拉起来后,先完整走一遍"建一个数字人 + 生成一条短口播",链路通了再回头换更好的素材,别一上来就追求完美。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询