HeyGem.ai 本地部署完整指南:5 分钟上手 AI 视频生成,从零做出你的数字人
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
HeyGem.ai 本地部署,就是在这套 AI 数字人视频生成平台里,用一段说话视频克隆你的形象和声音,再把文字或音频变成口播视频,全程离线。适合想批量做数字人视频、又不想把素材传到网上的你。
🎬 先看看它能干什么
用自己的视频克隆形象与声音
上传一段 10 秒左右的视频,程序会同时克隆两样东西:
- 你的脸:五官、表情,之后都由这段视频还原
- 你的声音:语调、语速,后续念稿都用这个声音
克隆一次,以后反复用。不用每次重新上传素材。
把文字、音频变成口播视频
形象克隆好之后,你想让它说什么,就输入什么。视频里口型跟着声音走,画面、口型、声音自动对齐。
适合这些场景:
- 短视频口播、知识科普
- 产品介绍、课程讲解
- 不想露脸、但需要一个固定"出镜人"的自媒体
支持的输入方式
| 输入 | 说明 |
|---|---|
| 纯文字 | 直接输入文案,平台自动转成语音 |
| 音频文件 | 自己录好或找别人念好,上传即用 |
脚本支持8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙语。
🚀 安装与启动
环境准备
先对照一下你的电脑,缺了哪样就补哪样:
- NVIDIA 显卡 + 驱动:必需。装完驱动在命令行运行
nvidia-smi,能显示显卡信息才算装好 - 内存 32G 及以上:官方推荐配置
- 硬盘:服务端镜像约 70G,数字人数据约 30G,建议给足 100G 空闲空间
- Node.js 18和Docker:客户端和服务端各依赖一个
获取项目代码
打开命令行,执行:
git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai安装依赖包
npm install这一步会自动装客户端依赖并编译底层模块。等它跑完、末尾不报红色错误就行,中途卡住一般是网络问题,重新执行一次即可。
启动并验证
客户端要连本地的服务端,所以先启动服务端(在deploy目录里执行,详见下文"部署方式"一节)。两个信号代表全部就绪:
- Docker 里出现 3 个服务,状态都是 Running——语音合成、语音识别、视频生成各一个
- 在项目根目录执行
npm run dev,弹出客户端窗口,首页能看到"Create Video"和"Create Avatar"两个大按钮
看到主界面,就说明 HeyGem.ai 本地部署完成了。
🧑🎤 上手实操:做出你的数字人
第一步:准备一段合格素材
素材质量直接决定克隆效果,记住两条硬标准:
- 清晰正面:正对镜头、光线充足,别侧脸、别逆光
- 人在说话、有声音:大约 10 秒,背景别带背景音乐或杂音
程序要靠这段声音做声音克隆,没声音的视频会直接报错。
第二步:创建你的数字人角色
- 点首页的Create Avatar
- 上传刚才那段视频,填个名字
- 等待训练完成,头像出现在My Avatars列表里就算成功
第三步:输入文字或音频,生成视频
- 点Create Video,选刚创建的角色
- 输入文案,或上传一段音频
- 提交任务。生成速度取决于显卡,40 系显卡上几十秒到几分钟不等
第四步:检查输出效果
- 在My Works列表里点开视频播放
- 重点看口型对不对得上、声音是否像本人
- 不满意就换素材重克隆,而不是反复生成
⚙️ 部署方式与性能调优
方式一:直接跑客户端
npm run dev- 从源码直接启动,改完代码立刻能看到效果
- 适合会写代码、想魔改界面或逻辑的开发者
方式二:Docker 容器化(服务端推荐)
docker-compose up -d在deploy目录执行,镜像里预装好了全部模型,不用自己装环境。
- 适合不想折腾依赖的普通用户,一条命令起服务
- 显存较小(8G 左右)可以改用轻量版:
docker-compose -f docker-compose-lite.yml up -d,只起视频生成一个服务 - 配置细节见 Docker 配置文件
| 直接运行 | Docker 容器化 | |
|---|---|---|
| 启动命令 | npm run dev | docker-compose up -d |
| 适合人群 | 开发者 | 普通用户 |
| 环境负担 | 需 Node 18、手动装依赖 | 镜像预装,开箱即用 |
| 改代码立即生效 | 是 | 否 |
三条性能调优点
- 显卡:全部算力都在本地,
nvidia-smi看不到显卡时,先修驱动,再谈别的 - 内存:视频生成服务在配置里预留了 8G 共享内存(
shm_size),别随意调小;显存紧张时保持默认的分块设置即可 - 磁盘:首次拉取约 70G 镜像,数据落在
duix_avatar_data目录,定期清理旧作品,避免把盘塞满
🕳️ 常见坑与解法
坑一:镜像拉取超时
现象:执行docker-compose up -d后,服务报错request canceled或Client.Timeout。
原因:Docker Hub 官方源网络不稳定,拉镜像中途断掉。
解决办法:在 Docker 设置里给 Docker Engine 配置国内镜像源(registry-mirrors),然后重新执行命令;或者挂上代理再试。
坑二:三个服务起不来
现象:Docker 里服务反复重启,或直接停掉,客户端连不上。
原因:本机没有 NVIDIA 显卡,或驱动没装好,Docker 调用不到 GPU。
解决办法:先装显卡驱动,用nvidia-smi验证;Linux 用户还需装 NVIDIA Container Toolkit 让 Docker 能用显卡。
坑三:创建模特时报错
现象:上传视频创建角色时提示Connection refused或处理失败。
原因:两种常见情况——上传的视频没有声音或没人说话;或者服务端某个服务没处于 Running 状态。
解决办法:换一段人在说话的清晰视频重新上传;再确认 3 个服务都是 Running。还报错就打开对应容器的日志定位,别凭感觉猜。
更多报错场景可以翻 常见问题文档,按现象对照查。
最后
环境搭好、素材备齐,现在就可以创建你的第一个数字人角色,跑通第一支口播视频。卡住的地方,先查服务状态和日志,十次里有九次能自己解决。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考