本地免费制作口播数字人视频:Duix.Avatar 数字人克隆与视频生成完整教程
2026/9/23 16:00:56 网站建设 项目流程

本地免费制作口播数字人视频:Duix.Avatar 数字人克隆与视频生成完整教程

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

把一段十秒左右、带人声的正面视频交给 Duix.Avatar,你的电脑会在本地训练出一个属于你的数字形象;之后再输入一段文字,就能得到一段由"你"开口说话的口播视频,口型、音色都来自你本人。这就是 Duix.Avatar 能帮你做出来的东西——一个完全离线运行的开源 AI 数字人视频工具,形象克隆、声音克隆和文本驱动视频合成都发生在你自己机器上,不经过任何第三方服务器。

先认识一下项目:为什么数字人克隆工具值得跑在本地

用过云端数字人服务的人大概都感受过两件事:按月扣费的账单,以及"我的素材要传到对方服务器上"这件事本身。Duix.Avatar 的思路是把这两件事都去掉:项目完全开源,克隆算法和合成框架直接放在代码仓库里,部署之后所有 AI 计算都在本地 GPU 上跑,录制的形象视频和声音样本不会离开你的硬盘。

看什么云端数字人服务Duix.Avatar 本地部署
持续费用按月订阅,视频越多开销越大部署完成后使用不产生费用
资料去向视频和声音样本需上传服务商文件始终留在本地磁盘
生成速度受网络与排队影响直接取决于你的显卡
能改到什么程度只能用产品提供的功能源码开放,可随需求扩展

它还顺手解决了几个容易踩的坑:界面是图形化的,没有技术背景也能上手;支持导入多个形象并统一管理;客户端在英文和中文之间可以自由切换。

动手之前:数字人克隆的硬件与系统环境要求

操作系统:Windows 10(19042.1526 或更高版本),或 Ubuntu 22.04 Desktop。确认命令:Windows 用winver,Ubuntu 用lsb_release -a

磁盘:Windows 部署要求必须有 D 盘,D 盘(存数字人和项目数据)空闲大于 30GB,C 盘(存镜像文件)空闲大于 100GB;不足的话,装完 Docker 后可以把磁盘镜像位置改到空间更大的盘。

显卡:必须是 NVIDIA 显卡并装好驱动。三个核心容器都声明了runtime: nvidia,没有 NVIDIA 显卡或驱动没装对,服务根本起不来——这一点比 CPU 重要得多。

配置档位参考:

档位CPU内存显卡存储大致表现
入门尝鲜第 10 代酷睿 i5 或同档 AMD16GBRTX 3060(6GB 显存)256GB SSD + 1TB HDD可完成基础形象训练,合成 720p 视频
进阶创作第 13 代酷睿 i7-13700F32GBRTX 4070(12GB 显存)512GB SSD + 2TB SSD训练速度明显更快,合成 1080p 视频
专业批量第 14 代酷睿 i9-14900K64GBRTX 4090(24GB 显存)1TB SSD + 4TB SSD大批量任务与 4K 合成

选件时优先保显卡显存;如果预算只够加一项,建议加内存到 32GB,训练中途内存不足的报错并不少见。

从 clone 代码到服务全部跑通:安装部署步骤

先拿到代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix.Avatar

接着按顺序做四件事:

  1. 确认系统版本winverlsb_release -a),不达标就先换系统或升级。
  2. Windows 用户准备 WSL:执行wsl --list --verbose查看是否已安装,没有或版本旧就执行wsl --update
  3. 安装 Docker:Windows 下载 Docker Desktop,首次启动接受协议、跳过登录即可;Ubuntu 执行sudo apt update后安装docker.iodocker-compose,并安装 NVIDIA Container Toolkit 让 Docker 能用上显卡(详见 README 的 Ubuntu 安装说明)。磁盘镜像位置可以在 Docker 设置里改到空间更大的盘。
  4. 启动服务:进入deploy目录,执行docker-compose up -d。这个目录下还有docker-compose-lite.ymldocker-compose-linux.yml等变体,按需选择。

首次启动会下载大约 70GB 的镜像,请留在 WiFi 环境等待约半小时,期间不要反复 Ctrl+C。完成后执行docker ps,看到fun-asrfish-speech-zimingduix.avatar三个容器状态都是 Up,即部署成功:

cd deploy docker-compose up -d docker ps

三者分别负责语音识别、语音合成和视频合成,对外暴露在http://127.0.0.1的 18180 与 8383 端口上,客户端会自动连接,不需要你手动配置。

一次完整创作:从克隆形象到生成视频

部署完成后打开客户端,首页有「Create Video」和「Create Avatar」两个入口,下方分别是"我的作品"和"我的数字人"列表。一次完整的创作按三步走。

第一步:建数字人形象

进入 Create Avatar,上传一段 10 秒左右的正面视频。注意两个硬性要求:分辨率建议 720p 以上、光线均匀;视频里必须有人声,因为系统要用这段声音做克隆——只有画面没有声音的视频会直接报错。提交后本地开始训练,基础配置大约 30 分钟,训练完成后你会得到一个可反复复用的数字形象。

第二步:声音随形象一起克隆

声音克隆依赖你上传视频里的人声,克隆出来的音色、语调和你本人一致,后续生成的语音都基于它。脚本支持 8 种语言:英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语,语速、音调等参数都可以调。如果只想换音色而不想重录形象,可以在声音样本上单独处理,对应接口走的是 18180 端口的合成服务。

第三步:输入文字,生成口播视频

进入 Create Video,选择已训练好的形象,把口播文案贴进文本框。系统会把文字转成克隆的语音,再驱动形象做出对应的口型与表情,最终输出一条音视频对齐的视频。整个过程就是"文本 → 语音 → 视频"一条线,不需要你在中间手动拼接任何素材。

数字人视频用在哪里:三个真实场景

  • 课程与培训录播:录制教师正面视频训练形象,把讲义变成口播稿,语速调到自己讲解时习惯的节奏,一条课程视频不需要反复进棚。
  • 企业宣传物料:用代言人的形象批量产出产品介绍、活动预告。声音样本建议在安静环境、用质量好的麦克风录,口播稿统一成品牌口吻后,后续只需替换文字。
  • 自媒体批量更新:固定一个虚拟主播的形象和声音,保证账号辨识度;文案批量准备后逐条合成,省去反复拍摄剪辑。

常见问题排查与日常优化

容器起不来。先执行docker ps看是哪几个容器不在 Running;再用netstat -ano | findstr "18180 8383"确认端口没被占用;检查 NVIDIA 驱动是否为最新;最后确认磁盘至少还有 30GB 空闲。多数"服务起不来"最终都落在这四处之一。

训练卡住或报错。最常见的原因还是素材:视频没有人声、分辨率低于 720p、或光线过暗。重录一段,必要时转成 H.264 编码的 MP4 再试;显存吃紧的机器可以适当降低训练参数,或者把其他占显存的程序关掉。另外 asr 服务启动比主服务慢,容器刚起来时别急着提交训练,等几分钟再操作。

合成变慢或卡顿。关掉与合成竞争 CPU 和内存的应用;用系统监控工具观察显存是否被占满;定期清理缓存目录(~/.duix_avatar/cache/)。日常维护上,每月更新一次 Docker 镜像、每周清一次临时文件;训练任务一次只跑一个,多个视频任务集中排队处理,比穿插执行更稳。排障时需要看日志,客户端日志入口在右上角菜单的 "Open Log"(文件位于AppData\Roaming下的 logs 目录),服务端日志则直接打开对应容器的 Logs 页复制即可。

继续探索:源码、接口与文档

想往下挖的话,按目录看代码效率最高:

  • 模型训练 / 视频合成 / 声音合成的 API 调用逻辑:src/main/service/
  • 端口与服务地址等运行配置:src/main/config/
  • 各服务接口实现(f2f、tts):src/main/api/
  • 本地数据库与存储:src/main/db/
  • 部署编排文件(含 lite 精简版与 Linux 版):deploy/
  • 中文排障文档,含镜像源配置、模特报错等常见案例:doc/常见问题.md

遇到问题时,顺序建议是:先读一遍 doc/常见问题.md,再到仓库 Issues 里搜关键词,最后带着复现步骤和容器日志去提问——项目更新比较频繁,很多问题在新版本里已经修掉了。

结尾

从克隆第一个形象开始:找一段十秒、有清晰人声的正面视频,按上面流程把服务跑起来,然后输入你的第一段口播文案。跑通之后,把训练好的模型和项目文件备份到外部存储,剩下的事情就是慢慢扩展你的使用场景了。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询