用10秒视频克隆你的开源数字人:Duix.Avatar 本地部署实战
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
给同一段产品介绍录了八遍音,导演说:还是让 AI 念吧。可你又不想要个没脸的通用形象,Duix.Avatar 是个能选的路子:免费开源的数字人工具,丢给它一段10秒的、有你在说话的视频,它就把你的脸和声音都"拷"走。全程离线,素材不出你的电脑。
它到底能干嘛:10秒视频克隆数字人
流程很短。先拍一段10秒的自拍视频——重点是有说话的声音,这一步不只是采你的脸,连声音也要一起克隆。上传它,数字人就建好了。接下来去"Create Video"里打一段文案,或者直接传一个 mp3,出来的就是"你"在念稿、口型跟音频对得上的成片。
自媒体口播、课程讲解、企业产品演示,够用了。文案支持中、英、日、韩等8种语言,念英文稿它就念英文。所有环节都在本地算,合同讲解、内部培训这类敏感素材也敢往里放。
第一次打开 Duix.Avatar:主界面走读
客户端装好后双击启动。主界面很干净:上方两张大卡片,左边"Create Video",右边"Create Avatar"。
下方两个页签对应"My Works"和"My Avatars":生成的视频归左边,克隆好的数字人归右边,还能按名字搜。右上角 Setting 菜单能打开日志、切中英界面、看协议。你第一件要做的事很明确:点右边那个"Create Avatar",上传10秒视频、起个名字(后端服务没跑起来会报错,所以先去看下一节)。
从0到跑通:一条 docker-compose 命令起三个服务
动手前对一下单子:
- 系统:Windows 10(19042.1526 以上)或 Ubuntu 22.04
- 显卡:NVIDIA 且驱动装好(RTX 30/40/50 系列)
- 内存:32GB 及以上
- 磁盘:100GB 以上空闲;拉镜像大约 70GB 流量,建议连 WiFi
第一步:装 Docker。Windows 用户先用wsl --list --verbose确认 WSL 装没装,然后安装 Docker Desktop;Ubuntu 用户直接跑:
sudo apt install docker.io docker-composeWindows 这步耗时看网速,卡了就重试。
第二步:拉代码。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar仓库很小,一般一分钟内结束。
第三步:起服务端。配置文件在deploy目录,一条命令把 ASR、TTS、视频合成三个服务全拉起来:
cd deploy && docker-compose up -dUbuntu 用户要加文件参数:docker-compose -f docker-compose-linux.yml up -d;显存 8G 左右的低配机器可换 lite 版。这步要 30 分钟上下,Docker 在偷偷下载三套镜像,终端看着像死了,其实没死。Docker 里看到三个服务都是 Running,就算成了:
第四步:装客户端。到仓库 Releases 页下载对应系统的安装包:Windows 双击.exe;Ubuntu 双击.AppImage直接跑(root 用户跑不起来就加个--no-sandbox参数)。
翻车记录:镜像拉不下来和卡在20%的自救
最常踩的是三个坑。先是镜像拉不动:第三步的报错里全是Client.Timeout exceeded,说明网络够不到 Docker Hub,先别怀疑显卡。救法:Docker Desktop 右上角齿轮进 Docker Engine,在配置里加一段registry-mirrors(国内镜像源,自己搜最新的一批填进去),Apply & restart,再重跑第三步那条命令。
第二个是创建数字人失败。九成是上传的视频"没声音":程序要拿视频里说话的声音做克隆,无声视频、只有 BGM、拍的是别处背景,都会挂。重拍一条,人脸正面清楚、10~20秒即可。
第三个是生成卡在20%。问题出在音频处理环节:在 Docker 里找到 heygen-tts 容器,打开 Logs 页签,大概率看到 file not exists 之类的报错:
多半是音频路径不对或服务没完全起来,重启对应容器通常就好。还不行就按顺序查:三个服务是否都 Running、nvidia-smi是否认得显卡、服务端客户端是不是最新版。
延伸一下:三个微服务与本地开放的 API
这套界面背后是三个微服务:fun-asr 管音频转文字,fish-speech 管文字转音频(18180 端口),视频合成引擎挂在 8383 端口做口型驱动。端口都暴露在 127.0.0.1 上,想接进自己的工作流,模型训练、音频合成、视频合成三组接口直接调用,调用姿势在src/main/service/video.js等几个文件里写着。踩到上面没盖到的坑,先看 doc/常见问题.md;没答案就去仓库 Issues 里搜,多半有人先摔过。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考