☰
Duix.Avatar本地部署实操:10秒视频克隆AI数字人,三步跑出第一条口播视频
2026/9/25 13:01:41 网站建设 项目流程

Duix.Avatar本地部署实操:10秒视频克隆AI数字人,三步跑出第一条口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个完全开源、支持本地部署的 AI 数字人工具:你上传一段 10 秒左右的真人视频,它克隆你的形象和声音;之后只要输入一段文案,就能自动生成口型对得上的口播视频,全程离线,素材不出你的机器。面向两类人:想在本地跑起来的开发者,和想做数字人口播的自媒体创作者。

本地部署AI数字人前的硬件环境检查清单

开跑之前,先花五分钟把环境过一遍,后面 90% 的坑都出在这一步。

  • NVIDIA 显卡 + 正常驱动:三个服务全部依赖 GPU 本地算力,A 卡或核显直接跑不起来。用nvidia-smi能打印出显卡信息才算过关。
  • 推荐配置:i5-13400F、32G 内存、RTX 4070。16G 内存可能起不来服务,32G 是底线。
  • 磁盘:Windows 下 D 盘留 30G 以上放数据(duix_avatar_data),C 盘或 Docker 镜像目录留 100G 以上。
  • 系统:Windows 10 19042 以上(需 WSL2),或已验证过的 Ubuntu 22.04。
  • 软件:Docker + Docker Compose;如果从源码构建客户端,还要装 Nodejs 18。

Windows 下先确认 WSL2 就位:

wsl --list --verbose # 检查 WSL 是否已安装 wsl --update # 把 WSL 更新到最新

Linux 下确认 Docker 可用:docker --version、docker-compose --version。

AI数字人容器部署:克隆仓库到三个服务Running

环境没问题,一条命令流跑通服务端。

做什么:克隆仓库,进入deploy目录,用 docker-compose 起服务。

# 克隆项目 git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy # 标准版:三个服务 docker-compose up -d

成功标志:Docker 里出现三个容器,且全部是 Running 状态。

首次拉镜像要下载约 70GB,耐心等上半小时,建议连 WiFi 或挂网线。三个服务的分工:duix-avatar-tts(语音合成,鱼声)对外端口18180、duix-avatar-asr(语音识别,fun-asr)对外10095、duix-avatar-gen-video(视频合成,Duix.Avatar)对外8383。

两个变体记一下:显存紧张可以用docker-compose -f docker-compose-lite.yml up -d起精简版(只有一个 gen-video 服务);RTX 50 系列显卡(5090 已验证,30/40 系 CUDA 12.8 也可)用docker-compose -f docker-compose-5090.yml up -d。

客户端不用编译:下载官方 release 里的安装包装上(Windows 是Duix.Avatar-x.x.x-setup.exe,Linux 是 AppImage 直接运行),首次启动同意协议,能看到"创建模特"和"生成视频"两个入口就算装好了。

服务端起来了,接下来就是喂素材了。

训练素材拍摄要求与模特创建流程

录一段 10 秒左右的视频,记住三条量化标准:

  • 人物正面居中,占画面大半;
  • 光线充足、背景干净;
  • 全程在说话,人声清晰无环境噪音——这段视频会同时用来克隆形象和克隆声音,无声的视频训练必挂。

做什么:客户端里点"新增模特",选视频、填名字,提交。

系统会自动把视频转成 H.264,并用 ffmpeg 抽出音频丢到D:\duix_avatar_data\voice\data(Linux 在用户主目录下的同名目录),再走语音克隆训练。

成功标志:"我的模特"列表里出现新建的模特条目,点开能看到形象和声音。

输入文案生成口播视频:数字人视频产出流程

选一个模特,进入视频编辑页,输入文案(首次建议 50 字以内),点生成。底层发生两件事:文本先经 TTS 变成你克隆音色的语音,再和模特视频合成口型。文案支持中、英、日、韩、法、德、阿、西 8 种语言。

成功标志:几分钟后作品列表出现新视频,播放时口型和语音对得上、没有明显错位。

想跳过界面直接调接口?往下看。

API批量调用与常见问题避坑清单

开放API批量生成口播视频

Docker 起来后,全部接口都挂在http://127.0.0.1上。批量生产时,写个脚本循环调视频合成接口:

# 提交合成任务(pn、chaofen 等固定参数参考 src/main/service/video.js) curl -X POST http://127.0.0.1:8383/easy/submit \ -H "Content-Type: application/json" \ -d '{"audio_url":"音频路径","video_url":"模特视频路径","code":"任意唯一值","chaofen":0,"watermark_switch":0,"pn":1}' # 用同一个 code 轮询进度 curl "http://127.0.0.1:8383/easy/query?code=你的code"

语音合成接口是http://127.0.0.1:18180/v1/invoke,完整参数结构参考 src/main/service/video.js 和 src/main/service/voice.js,里面就是现成的调用实现。

现象一句话,解法一句话

  • 拉镜像失败 / context canceled:Docker Hub 官方源不稳定,Docker 配置里加国内registry-mirrors就行,见 doc/常见问题.md。
  • 三个容器起不来或反复重启:九成是 N 卡驱动没装好或显存不够,先跑一遍nvidia-smi。
  • 新增模特报错:素材视频里没有说话声,重录一段有声的。
  • 训练报 Connection refused:ASR 服务启动比别的慢,服务端刚起完等几分钟再操作;16G 内存机器可能直接起不来。
  • 生成进度长时间不动:服务端、客户端都更新到最新再试——服务端回deploy目录重跑docker-compose up -d,客户端拉最新代码重新构建;再去项目 Issues 搜一下,更新很频繁,很多坑已经被修了。
  • N 卡 50 系列:换docker-compose-5090.yml启动。
  • Ubuntu root 用户跑 AppImage 没反应:命令行加--no-sandbox启动。

最后交代一下文件都落在哪:数据根目录是duix_avatar_data(Windows 默认 D 盘,Linux 在用户主目录),face2face存模特视频和合成产物,voice存声音样本;目录映射写在 docker-compose 的 volumes 里,想换盘直接改。


到这里整套链路就通了:体检、起容器、录视频、建模特、跑第一条口播。建议下一步就按这个顺序真跑一遍,卡在哪一步回来翻对应的 FAQ;跑通之后想批量出片或者接入自己的工作流,再去翻开放 API 那一节。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询