Duix.Avatar 入门指南:10秒视频,能克隆出离线 AI 数字人吗?
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个开源的离线 AI 数字人项目:提交一段十秒左右的真人视频,即可克隆出形象与声音,之后输入文字或上传音频,就能自动生成口型匹配的说话视频。整个流程运行在装有英伟达显卡的本地电脑上,部署完成后的创作环节不依赖外网。本文面向会用 Docker、但没接触过数字人制作的朋友,按"了解 → 上手 → 评估 → 选择"四步展开。一句话结论:想免费本地做口播视频、又在意素材隐私,且手里有一张中端英伟达显卡的话,这个项目值得试;没有 GPU 或希望零安装直接使用云服务的,则不建议走这条路。
项目一句话认知:Duix.Avatar 离线数字人的数据如何流转
Duix.Avatar 要解决的问题很具体:让真人变成一个可以反复"说话"的形象。它把语音识别(ASR,把语音转成文字)、语音合成(TTS,用文字生成语音)和口型视频生成三个能力装进三个本地容器,算力全部消耗在本机显卡上,素材不出本地机器。
数据流转分两步:先上传一段人在说话的十秒左右视频,系统从中提取外貌与音色,存成本地形象模型;之后再输入文案或上传录音,口型合成服务将语音内容与画面逐帧对齐,输出成品口播视频。README 显示脚本支持中、英、日、韩、法、德、阿拉伯、西语共八种语言。
核心功能拆解:语音克隆、口型合成与本地 API
语音克隆与文字驱动
语音识别基于 FunASR、语音合成基于 Fish-Speech(均为开源项目,README 致谢章节有注明)。创建模型时,系统从样片视频中提取音色,之后用该音色把文字合成为语音,也支持直接传入已录好的音频文件。适合不想进录音棚、但要批量产出课程介绍或产品播报的创作者。
口型同步视频生成
合成环节不是简单对口型,而是依据音频重新生成匹配的嘴部动作与表情,成品观感比静态贴图更接近真人。一段写好的文案可以直接转成可用视频,用于新闻播报、产品介绍、直播切片再创作等场景。
多模型管理与开放 API
客户端支持在同一界面管理多个形象模型并按需切换;服务端另在本地端口开放模特训练与视频合成接口,调用样例放在仓库 src/main/service/ 目录下,方便把数字人能力接入自己的业务系统。
快速上手实践:Duix.Avatar 最低配置要求与离线数字人部署步骤
按 README 推荐配置整理的环境要求如下:
| 部件 | 规格要求 | 说明 |
|---|---|---|
| 系统 | Windows 10 19042 及以上,或 Ubuntu 22.04 桌面版 | 其他 Linux 版本未做兼容性验证 |
| 显卡 | 英伟达显卡并装好驱动 | 算力全在本地;README 引用的社区教程称 8G 显存可用 |
| 内存 | 32G 及以上 | 常见问题提到 16G 可能起不全三个服务 |
| 硬盘 | Windows 需 D 盘 30G+、C 盘 100G+;Linux 空闲 100G+ | 存放镜像、模型与作品 |
| 运行环境 | Docker(Windows 需 WSL2) | 客户端为独立安装包,源码为 Electron + Vue3 架构,可自行构建 |
核心部署命令都在 deploy/ 目录下:
cd deploy docker-compose up -d # 三个服务:语音识别、语音合成、视频生成 docker-compose -f docker-compose-lite.yml up -d # lite 精简版:仅视频生成一个服务首次启动会下载镜像,README 显示约消耗 70G 流量、视网速耗时半小时左右。判断是否成功的标准很直接:Docker 中出现三个容器且均为 Running 状态(lite 版为一个)。随后打开客户端安装包,创建模型、生成第一条视频即可。镜像源慢时可配置国内加速,Docker Desktop 的磁盘镜像存放位置也能在资源设置中调整。
客观评估:它做得好的地方与谁不适合用
做得好的地方 ✅
- 全链路离线:样片、声音素材与生成作品都留在本地,README 明确以此作为隐私保护的卖点。
- 部署整合度高:deploy/ 下四个 compose 文件覆盖 Windows、Linux、5090 显卡与 lite 精简四条路线,无需手工搭环境。
- 客户端界面简单:主界面只有创建视频、创建形象与作品列表,新人学习成本较低。
- 授权相对宽松:README 显示支持全球免费商用,用户量超 10 万或年营收超 1000 万美元的企业需另签协议。
需要注意的地方 ⚠️
- 必须有英伟达显卡:没有 GPU 或驱动装错,三个服务直接起不来,这是硬门槛。
- 首次下载量大,Docker 官方源在大陆不稳定,需要自行配置镜像源,这也是文档中着墨最多的坑。
- 项目处于活跃迭代期,问题单更新频繁,官方自查章节也反复提醒保持服务端与客户端为最新版本。
- 文档未提供生成速度与画面质量的量化对比,实际体验要以本机硬件为准。
选择建议与常见疑问:本地开源与云端商业路线对比
| 对比项 | 本地开源路线(本项目) | 云端商业路线 |
|---|---|---|
| 素材流向 | 全部留存本机 | 需上传至服务商 |
| 使用成本 | 软件免费,商用大多免费 | 通常按生成量计费 |
| 硬件 | 自备英伟达显卡与较大内存 | 无需特殊硬件 |
| 定制空间 | 源码与本地 API 均开放 | 只能用提供的接口 |
| 排障责任 | 依赖社区与文档 | 依赖服务商 SLA |
看重隐私与成本、又有一台带独显的电脑,选本地路线;团队没有 GPU、要求当天上线,云端更省事。官方 README 对两条路线的分工也有说明:开源版面向技术型用户,API 服务面向业务集成场景。
常见疑问
问:新增模特一直报错怎么排查?先确认样片视频里有人在说话,README 明确该条件为必须;其次语音识别服务启动较慢,建议容器起来后等几分钟再操作,细节见 常见问题。
问:拉取镜像失败怎么办?通常是官方源不稳定,按常见问题文档在 Docker 的 daemon.json 中配置国内镜像源即可;运行中的报错可像下图这样从服务日志里查看。
问:部署之后能断网使用吗?只有首次下载镜像需要联网,之后的创作流程按 README 的说法为全离线操作。
一句话总结:Duix.Avatar 是当前少数"完全本地、成本低、可商用"的 AI 口播视频生成路线,代价是一台英伟达显卡和自行排查部署问题的能力。它适合在意隐私的个人创作者与小型团队;没有 GPU、或希望服务稳定且有兜底的场景,云端方案仍然更现实。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考