☰
HeyGem.ai 本地部署完整指南:5 分钟上手 AI 视频生成,从零做出你的数字人
2026/9/29 20:23:55 网站建设 项目流程

HeyGem.ai 本地部署完整指南:5 分钟上手 AI 视频生成,从零做出你的数字人

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai 本地部署,就是在这套 AI 数字人视频生成平台里,用一段说话视频克隆你的形象和声音,再把文字或音频变成口播视频,全程离线。适合想批量做数字人视频、又不想把素材传到网上的你。

🎬 先看看它能干什么

用自己的视频克隆形象与声音

上传一段 10 秒左右的视频,程序会同时克隆两样东西:

  • 你的脸:五官、表情,之后都由这段视频还原
  • 你的声音:语调、语速,后续念稿都用这个声音

克隆一次,以后反复用。不用每次重新上传素材。

把文字、音频变成口播视频

形象克隆好之后,你想让它说什么,就输入什么。视频里口型跟着声音走,画面、口型、声音自动对齐。

适合这些场景:

  • 短视频口播、知识科普
  • 产品介绍、课程讲解
  • 不想露脸、但需要一个固定"出镜人"的自媒体

支持的输入方式

输入说明
纯文字直接输入文案,平台自动转成语音
音频文件自己录好或找别人念好,上传即用

脚本支持8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙语。

🚀 安装与启动

环境准备

先对照一下你的电脑,缺了哪样就补哪样:

  • NVIDIA 显卡 + 驱动:必需。装完驱动在命令行运行nvidia-smi,能显示显卡信息才算装好
  • 内存 32G 及以上:官方推荐配置
  • 硬盘:服务端镜像约 70G,数字人数据约 30G,建议给足 100G 空闲空间
  • Node.js 18和Docker:客户端和服务端各依赖一个

获取项目代码

打开命令行,执行:

git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai

安装依赖包

npm install

这一步会自动装客户端依赖并编译底层模块。等它跑完、末尾不报红色错误就行,中途卡住一般是网络问题,重新执行一次即可。

启动并验证

客户端要连本地的服务端,所以先启动服务端(在deploy目录里执行,详见下文"部署方式"一节)。两个信号代表全部就绪:

  1. Docker 里出现 3 个服务,状态都是 Running——语音合成、语音识别、视频生成各一个
  2. 在项目根目录执行npm run dev,弹出客户端窗口,首页能看到"Create Video"和"Create Avatar"两个大按钮

看到主界面,就说明 HeyGem.ai 本地部署完成了。

🧑‍🎤 上手实操:做出你的数字人

第一步:准备一段合格素材

素材质量直接决定克隆效果,记住两条硬标准:

  • 清晰正面:正对镜头、光线充足,别侧脸、别逆光
  • 人在说话、有声音:大约 10 秒,背景别带背景音乐或杂音

程序要靠这段声音做声音克隆,没声音的视频会直接报错。

第二步:创建你的数字人角色

  1. 点首页的Create Avatar
  2. 上传刚才那段视频,填个名字
  3. 等待训练完成,头像出现在My Avatars列表里就算成功

第三步:输入文字或音频,生成视频

  1. 点Create Video,选刚创建的角色
  2. 输入文案,或上传一段音频
  3. 提交任务。生成速度取决于显卡,40 系显卡上几十秒到几分钟不等

第四步:检查输出效果

  • 在My Works列表里点开视频播放
  • 重点看口型对不对得上、声音是否像本人
  • 不满意就换素材重克隆,而不是反复生成

⚙️ 部署方式与性能调优

方式一:直接跑客户端

npm run dev
  • 从源码直接启动,改完代码立刻能看到效果
  • 适合会写代码、想魔改界面或逻辑的开发者

方式二:Docker 容器化(服务端推荐)

docker-compose up -d

在deploy目录执行,镜像里预装好了全部模型,不用自己装环境。

  • 适合不想折腾依赖的普通用户,一条命令起服务
  • 显存较小(8G 左右)可以改用轻量版:docker-compose -f docker-compose-lite.yml up -d,只起视频生成一个服务
  • 配置细节见 Docker 配置文件
直接运行Docker 容器化
启动命令npm run devdocker-compose up -d
适合人群开发者普通用户
环境负担需 Node 18、手动装依赖镜像预装,开箱即用
改代码立即生效是否

三条性能调优点

  • 显卡:全部算力都在本地,nvidia-smi看不到显卡时,先修驱动,再谈别的
  • 内存:视频生成服务在配置里预留了 8G 共享内存(shm_size),别随意调小;显存紧张时保持默认的分块设置即可
  • 磁盘:首次拉取约 70G 镜像,数据落在duix_avatar_data目录,定期清理旧作品,避免把盘塞满

🕳️ 常见坑与解法

坑一:镜像拉取超时

现象:执行docker-compose up -d后,服务报错request canceled或Client.Timeout。

原因:Docker Hub 官方源网络不稳定,拉镜像中途断掉。

解决办法:在 Docker 设置里给 Docker Engine 配置国内镜像源(registry-mirrors),然后重新执行命令;或者挂上代理再试。

坑二:三个服务起不来

现象:Docker 里服务反复重启,或直接停掉,客户端连不上。

原因:本机没有 NVIDIA 显卡,或驱动没装好,Docker 调用不到 GPU。

解决办法:先装显卡驱动,用nvidia-smi验证;Linux 用户还需装 NVIDIA Container Toolkit 让 Docker 能用显卡。

坑三:创建模特时报错

现象:上传视频创建角色时提示Connection refused或处理失败。

原因:两种常见情况——上传的视频没有声音或没人说话;或者服务端某个服务没处于 Running 状态。

解决办法:换一段人在说话的清晰视频重新上传;再确认 3 个服务都是 Running。还报错就打开对应容器的日志定位,别凭感觉猜。

更多报错场景可以翻 常见问题文档,按现象对照查。

最后

环境搭好、素材备齐,现在就可以创建你的第一个数字人角色,跑通第一支口播视频。卡住的地方,先查服务状态和日志,十次里有九次能自己解决。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询