快速下载 Stability AI 模型权重并跑通首次推理:SDXL、SVD 到 SV4D 的三条任务完整指南
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
本指南面向 Stability AI 的 generative-models 仓库:用 huggingface-cli 完成 SDXL(静态图)、SVD/SV3D(图生视频)、SV4D(4D 资产)三类任务的模型下载,把权重统一放进 checkpoints/ 目录,再用仓库自带采样脚本完成首次推理验证。
按想要的产物选权重:一张决策表覆盖全部下载任务
下载前先对号入座。所有权重都落在仓库根目录的checkpoints/,scripts/sampling/configs/ 与 configs/inference/ 里各 yaml 的ckpt_path已直接指向该目录,文件名固定即可开箱即用,无需手写配置。
| 目标产物 | 模型 | 权重文件(放入 checkpoints/) | 大致体积 | 仓库内采样入口 |
|---|---|---|---|---|
| 静态图像(文生图/图生图) | SDXL-base-1.0 | sd_xl_base_1.0.safetensors | 约 7GB | streamlit run scripts/demo/sampling.py |
| 图生视频,14 帧,576x1024 | SVD | svd.safetensors | 数 GB | simple_video_sample.py --version svd |
| 图生视频,25 帧 | SVD-XT | svd_xt.safetensors | 数 GB | simple_video_sample.py --version svd_xt |
| 单图多视角环绕,21 帧,576x576 | SV3D_u / SV3D_p | sv3d_u.safetensors、sv3d_p.safetensors | 各数 GB | simple_video_sample.py --version sv3d_u(或sv3d_p) |
| 4D 资产,48 帧 = 12 帧 x 4 视角 | SV4D 2.0 | sv4d2.safetensors | 30GB 以上 | simple_video_sample_4d2.py |
| 4D 资产,5 帧 x 8 视角 | SV4D 2.0 8 视角 | sv4d2_8views.safetensors | 数十 GB 级 | simple_video_sample_4d2.py --model_path checkpoints/sv4d2_8views.safetensors |
| 初代 4D,40 帧 = 5 帧 x 8 视角 | SV4D | sv4d.safetensors(另依赖sv3d_u.safetensors) | 数十 GB 级 | simple_video_sample_4d.py |
只想验证流程就下 SDXL 一个文件;想图生视频就补齐 SVD 与 SV3D;做 4D 资产再下 SV4D 2.0。全部下齐建议磁盘预留 100GB 以上。
克隆并装依赖:三条命令完成环境准备
本地还没有仓库时,先克隆并进入根目录:
git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models按 README 安装依赖(PyTorch 安装行里的 index-url 指定 CUDA 11.8 构建,先用nvidia-smi确认本机 CUDA 版本,再换对应通道):
python3 -m venv .pt2 source .pt2/bin/activate pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt pip3 install .装完逐项核对版本,四条命令都有输出且无报错即通过:
python --version # 需 3.10 python -c "import torch; print(torch.__version__)" # 需 2.0.1 以上 nvidia-smi # CUDA 11.8 以上 huggingface-cli --version # 支持 download 子命令即可一条命令拉齐 SDXL 基础权重并跑起文生图
任务若是文本生成图像或图生图,只需要这一个文件;它是仓库验证最多的模型,适合作为第一次下载。
拉取主权重(--local-dir把输出固定在仓库的 checkpoints/,--include只保留权重文件,跳过仓库里的其他小文件):
huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" \ --local-dir checkpoints成功判据:ls -lh checkpoints/sd_xl_base_1.0.safetensors显示约 7GB,且目录里没有.incomplete残留。
想进一步确认文件完整,可以比对哈希(完整 64 位值与 README.md Inference 一节一致):
sha256sum checkpoints/sd_xl_base_1.0.safetensors # 预期 31e35c80fc4829d14f90153f4c74cd59c90b779f6afe05a74cd6120b893f7e5b下载完成后启动文生图/图生图演示页:
streamlit run scripts/demo/sampling.py --server.port 8501成功判据:页面可打开,模型列表能选中 sd_xl_base_1.0 并正常出图。
获取 SVD 与 SV3D 四个图生视频权重
想让静态图动起来(SVD)或围绕单物体合成多视角(SV3D),把下面四个文件取齐;只要 14 帧视频的话,下svd.safetensors一个就够。
按模型分别拉取(SVD 为 14 帧版,SVD-XT 是 25 帧微调版,SV3D 两个变体一起取:u 默认轨道,p 支持指定相机路径):
huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints成功判据:ls -lh checkpoints/下四个文件齐全且大小非零。
显存偏紧的机器可再取图像解码器变体,降低解码阶段占用:
huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints获取 SV4D 2.0 的 4D 资产权重:两个文件
想由短视频合成新视角的 4D 资产,用 SV4D 2.0:每次生成 48 帧(12 帧 x 4 视角),576x576 分辨率,输入建议用白底运动物体的短视频。
拉取主权重与 8 视角变体(同属 stabilityai/sv4d2.0 仓库,两个文件一次配齐即可覆盖两种生成规格):
huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints huggingface-cli download stabilityai/sv4d2.0 sv4d2_8views.safetensors --local-dir checkpoints成功判据:ls -lh checkpoints/sv4d2.safetensors显示 30GB 以上且无.incomplete残留;该文件与 scripts/sampling/configs/sv4d2.yaml 中的ckpt_path对应。
需要跑初代 SV4D(40 帧 = 5 帧 x 8 视角)时,另从 stabilityai/sv4d 仓库取sv4d.safetensors放入 checkpoints/,其推理脚本同时依赖上一节已下载的sv3d_u.safetensors。
下载中断、速度慢时的三个动作:续传、镜像、并发
传输中途断掉,重放原命令即可从断点继续(huggingface-cli 自带断点续传;不要手动移动或清理缓存与目标目录,否则断点重置):
huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints官方端点访问不畅时切镜像,对当前会话生效:
# 镜像的文件列表有同步延迟,若报文件不存在,unset 该变量回退官方端点 export HF_ENDPOINT=https://hf-mirror.com带宽够但单文件太大太慢时,用 16 连接并发拉取(直链需从文件页面手动获取;aria2c 不认识 HuggingFace 仓库结构,也不参与 hf 命令的续传机制):
aria2c -x 16 -s 16 -o sv4d2.safetensors "<权重文件直链>"分两段排障:先查下载问题,再查加载与生成问题
下载期问题(checkpoints/ 有残留):
- 出现 0 字节文件或
.incomplete文件——网络中断留下的传输残留,重放同一条获取命令续传;速度仍慢则切换上面的镜像端点。 - 镜像端点提示找不到文件——镜像同步延迟,
unset HF_ENDPOINT回退官方端点。 - 哈希对不上——与 README.md Inference 一节的 sha256 比对,不一致就删除该文件后重新获取。
加载与生成期问题(模型端):
Missing key(s) in state_dict——权重不完整或版本与配置不匹配;删除对应文件后重放获取命令,重下前核对仓库页面文件清单。CUDA out of memory——显存不足;给采样脚本加--decoding_t 1降低单批解码帧数,4D 脚本再补--encoding_t 1,或把--img_size降到 512。- 模型能加载但图像或视频模糊、畸变——配置与权重版本不一致;核对 scripts/sampling/configs/ 中各 yaml 的
ckpt_path与 checkpoints/ 内实际文件名,确保二者来自同一发布版本。
用一次最小 SVD 推理闭环验证
拿到 SVD 权重后跑最小推理,能出视频即代表整条链路打通。
用仓库自带测试图采样(该图为 1024x576,恰是 576x1024 训练分辨率,不会触发尺寸告警;默认 25 步、14 帧):
python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd成功判据:outputs/simple_video_sample/svd/新增000000.jpg(输入图)与000000.mp4(14 帧视频),终端无 traceback。显存紧张时追加--decoding_t 1。
下一步
- 其他版本与参数:scripts/sampling/ 下的
simple_video_sample.py(svd、svd_xt、sv3d_u、sv3d_p)、simple_video_sample_4d.py、simple_video_sample_4d2.py,各版本的默认帧数与步数都写在脚本内。 - 模型结构配置:configs/inference/,每个 yaml 与 checkpoints/ 内权重文件一一对应。
- 交互式界面:
streamlit run scripts/demo/video_sampling.py(SVD/SV3D)、streamlit run scripts/demo/sampling.py(SDXL)。
某一个权重跑通后,其余权重随时按上文命令补齐即可,所有获取命令均可重放。
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考