☰
Duix.Avatar:10秒素材克隆数字人完整指南
2026/10/3 7:37:01 网站建设 项目流程

Duix.Avatar:10秒素材克隆数字人完整指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款完全开源的 AI 数字人视频合成工具:上传一段你自己的短视频,它就能在本地克隆你的外貌和声音,再靠文本或语音驱动它开口说话。传统 3D 数字人制作要数十万美元,现在降到 1000 美元级——成本直接砍掉 99%,而且全流程离线,数据不出你的电脑。

3组数据,说明它凭什么值得换

传统路线做数字人:动捕棚 + 建模团队 + 数周周期 + 数十万美元报价。Duix.Avatar 路线:一段自拍视频 + 一张 NVIDIA 显卡 + 半小时部署。差异具体到三个点上:

  • 痛点:外包 3D 数字人,数十万美元起步。方案:用真人视频数据本地训练模型。收益:制作成本降到 1000 美元级,降幅 99%。
  • 痛点:在线生成 API 必须把素材和声音传到云端,隐私风险自担。方案:ASR、TTS、视频渲染三个服务全部跑在本机 GPU。收益:外网流量为 0,完全离线。
  • 痛点:自己接 ASR/TTS/视频模型,得先会 Python 再会工程。方案:3 个 Docker 镜像 + docker-compose 编排,Electron 客户端管界面。收益:拉镜像约 30 分钟,图形界面开箱即用。

核心模块拆解:3个服务怎么配合跑起来

整套架构是"三个容器 + 一个客户端":语音克隆、视频合成各占一个服务,客户端负责串流程。

🎙️ 语音克隆:本地 TTS 服务

把你的一句话音频变成"你嗓子"的任意文本朗读。底层是 Fish-Speech(语音合成,TTS: Text To Speech)服务,监听 18180 端口,走/v1/invoke接口:传reference_audio(参考音频)和reference_text,再带上topP: 0.7、temperature: 0.7、max_new_tokens: 1024这类采样参数即可。传统 TTS 只有固定内置音色,它能从一段参考音频里复刻你的语速、语气和音色。

🎬 视频合成:Face2Face 口型驱动

让原视频里的人脸跟着克隆语音做口型。视频服务跑在 8383 端口,/easy/submit提交任务(传audio_url+video_url),/easy/query?code=xxx轮询进度。容器侧用shm_size: 8g撑住共享内存,PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512抑制显存碎片。传统 3D 管线要建模、绑骨、对口型、渲染好几道工序,这里一次接口调用搞定,任务队列由客户端本地 SQLite 管理。

🖥️ 桌面客户端:Electron 任务调度器

统一管理数字人模型、声音模型和合成任务。Electron + Vue 3 + better-sqlite3 本地数据库 + fluent-ffmpeg 处理音视频,状态机按 draft → waiting → 完成流转,轮询服务端更新进度条。不懂代码的人全程点鼠标完成克隆和出片。

五步跑通:从装环境到出片

1. 校验环境:显卡、Docker、WSL

核心操作:

nvidia-smi docker --version wsl --list --verbose

踩坑提醒:

  • ❌ AMD/核显不行,三个服务起不来
  • ❌ C 盘空闲 <100GB,Docker 镜像放不下
  • ✅ 推荐 i5-13400F + 32G 内存 + RTX 4070
  • ✅nvidia-smi必须能看到显卡型号

2. 拉起服务:一键启动3个容器

核心操作:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d docker ps

踩坑提醒:

  • ❌ 首次拉取约 70GB 流量,中途别断电断网
  • ❌docker ps不是 3 个 UP,先查日志再重启
  • ✅ 50 系显卡改跑docker-compose-5090.yml
  • ✅ 显存紧张可跑 lite 版docker-compose-lite.yml

3. 装客户端:安装包或 AppImage

核心操作:

# Windows: 双击 Duix.Avatar-x.x.x-setup.exe 安装 # Ubuntu root 桌面下需加参数启动: ./Duix.Avatar-x.x.x.AppImage --no-sandbox

踩坑提醒:

  • ❌ 别装在含中文的路径下
  • ❌ 不要同时开多个客户端实例
  • ✅ 连不上服务端,检查防火墙放行 8383/18180

4. 训练模型:一段视频克隆外貌和声音

核心操作:

# 客户端点 Create Avatar,上传10~30秒正面 MP4 视频 # 系统自动拆出音频与无声视频,分别送 TTS 和 Face2Face 训练

踩坑提醒:

  • ❌ 视频里戴帽子、墨镜,特征提取会翻车
  • ❌ 多人同框或频繁遮挡面部,训练失败
  • ✅ 分辨率 ≥720P,背景简单、光线均匀

5. 生成视频:文本变成片

核心操作:

# Create Video → 选模型 → 输入文本或上传音频 → Generate # 音频走 18180 合成,成片走 8383 渲染,客户端轮询进度

踩坑提醒:

  • ❌ 单次文本 >500 字,容易显存溢出
  • ❌ 合成中途关掉客户端,任务队列会卡住
  • ✅ 渲染失败先查显存,不够就降分辨率

真实场景怎么用:老师、客服、自媒体

做课程视频的老师

  • 谁在用:要批量产出标准化课程视频的讲师
  • 怎么搭:
    • 训练一个"虚拟讲师"模型,多门课程复用同一形象
    • 长课脚本分段处理,单次不超过 500 字防溢出
    • 渲染走本机 8383 服务,批量任务排队提交
  • 效果:单课制作成本降 80%,日均产出 300+ 分钟课程视频

搭客服数字分身的运营

  • 谁在用:需要 7×24 多语言自助视频的企业客服团队
  • 怎么搭:
    • 用金牌客服形象克隆一个数字分身,训练正式/亲切两种音色
    • 中、英、日、韩等 8 种语言脚本直接出片,FAQ 视频预生成缓存
    • 长尾问题再走动态渲染,缓存优先
  • 效果:常见咨询从"人工分钟级应答"变成"视频秒级自助",8 语言一套配置全出

日更口播的自媒体

  • 谁在用:个人博主,要周更甚至日更口播视频
  • 怎么搭:
    • 工作流接成"文案 → TTS 音频 → 视频渲染"三段管线
    • 口型精度优先时用音频驱动模式,音频采样率 44.1kHz
    • 换背景用绿幕素材,后期替换更省时间
  • 效果:周产出 3 条 → 15 条,单条制作时间缩 75%

进阶:改代码、调参数、找社区

  • 二次开发:接自己的 TTS 可参考 src/main/service/voice.js 的合成流程;新增服务端调用参考 src/main/api/request.js 的请求封装;改界面参考 src/renderer/src/views 下的 Vue 组件
  • 性能调优:显存吃紧先切 720P 出片;lite 版单容器部署走docker-compose -f指定文件即可,不用动主配置
  • 社区资源:排错先看 doc/常见问题.md,问题提项目 issue,社区更新很快

Duix.Avatar 把"模型+声音+视频合成"整条链路搬进一台有显卡的电脑,离线、免费、零门槛。以后做"一个自己的数字人",大概就和装个应用一样顺手。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询