SadTalker数字人:10分钟让单张图片开口说话的完整路径
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
上传一张人像照片、喂给一段音频,几分钟后得到一个头部运动与口型同步的说话视频。本文带你用 10 分钟完成 SadTalker——一款单图音频驱动说话人脸生成工具(CVPR 2023)——的本地部署与首次出片,只需一台能打开终端的电脑。
核心能力速览
SadTalker 的输入输出关系非常直接:
- 虚拟主播、品牌形象:一张人像加任意音频,产出口型同步的说话视频
- 教学视频、正式形象:Still 模式冻结头部姿态,输出稳定不晃
- 角色短片、全身动画:Full 图像模式让整幅画面动起来并贴回原图
- 高清成片:可叠加 GFPGAN 人脸增强后直接交付
跑起来
环境检查清单
- 系统:Windows 10/11、macOS、Linux 均支持
- 内存 8GB 以上(推荐 16GB),磁盘空闲 10GB 以上
- 已安装 git 与 ffmpeg;推荐 Python 3.8,启动脚本会自动创建虚拟环境
启动命令
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker bash webui.shWindows 用户可直接双击webui.bat。脚本会自动创建 Python 虚拟环境并安装依赖,首次运行耐心等待 Gradio Web UI 就绪即可。接着执行一条命令下载模型:
bash scripts/download_models.sh模型文件会落到checkpoints/与gfpgan/weights/两个目录;网络不稳定时,可手动从 Release 页下载后解压到相同位置。
首次生成
浏览器打开 Web UI 后,按页面完成首次出片:
- 上传一张正面清晰的人像作为源图像
- 选择驱动音频(wav 或 mp3),或输入文本自动生成语音
- 选择预处理模式,默认 crop(裁剪面部区域生成)
- 确认 expression_scale(默认 1.0),想要直接成片可勾选 gfpgan 增强
- 点击生成,视频几分钟后保存在
results/目录
仓库自带的examples/source_image/示例图可以直接作为首次源图像,examples/driven_audio/里有现成音频可用。
使用场景与选择
| 方式 | 特点 | 适合谁 |
|---|---|---|
| 本地 | 数据不出机器、参数完全可控,消耗本机算力 | 个人开发者、人像数据敏感场景 |
| Docker | 环境隔离、一条命令启动,规避依赖冲突 | 技术爱好者、企业集成 |
| 云端 | 无需本地资源,随时可试 | 临时体验、快速验证效果 |
选择逻辑只有一条:涉及真实人像数据,优先本地或自管 Docker;只想先验证效果,从云端试起成本最低。
效果调优
输出质量由输入决定,按素材到参数的顺序调整:
- 图片选择:只支持真人照片,正面、面部清晰、无遮挡,避免侧脸与低光;高度风格化的图像不在支持范围
- 音频标准:仅支持 wav 与 mp3,无背景噪声的干声口型最稳
- expression_scale:最影响自然度的单一参数,默认 1.0,动作偏弱时提到 1.2–1.5,表情过冲时降到 0.5–0.8
- 全身照片:配合 Still 模式与 full 预处理,保持原头部姿态,再叠加 gfpgan 增强出成片
踩坑速查
Q:启动提示 ffmpeg 未识别A:先安装 ffmpeg(Linux/Mac 用 conda 或 brew,Windows 加入 PATH),再重新启动。
Q:模型文件缺失或 checkpoint 加载失败A:重跑bash scripts/download_models.sh;校验文件大小,不匹配则重新下载。
Q:音频无法解析A:仅支持 wav 与 mp3,其他格式先用 ffmpeg 转码。
Q:CUDA out of memoryA:设置PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128,或降低输出分辨率、关闭增强。
Q:Mac M1 报 Illegal Hardware ErrorA:单独执行pip install dlib重装 dlib。
Q:生成速度太慢A:降低输出分辨率、关闭增强模式,并确认跑在 GPU 上。
继续探索
- 用 generate_batch.py 批量生成多组人像与音频
- 全部推理参数、模式对比与参考视频模式详解
- 更多常见问题与解法
SadTalker 把"单图加音频到说话视频"压缩成了本地十分钟可跑通的工程任务。第一个视频跑通之后,翻一翻仓库里的 best practice 文档,增强模式与全身动画都能直接上手。
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考