☰
快速下载 Stability AI 模型权重并跑通首次推理:SDXL、SVD 到 SV4D 的三条任务完整指南
2026/10/2 13:29:59 网站建设 项目流程

快速下载 Stability AI 模型权重并跑通首次推理:SDXL、SVD 到 SV4D 的三条任务完整指南

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

本指南面向 Stability AI 的 generative-models 仓库:用 huggingface-cli 完成 SDXL(静态图)、SVD/SV3D(图生视频)、SV4D(4D 资产)三类任务的模型下载,把权重统一放进 checkpoints/ 目录,再用仓库自带采样脚本完成首次推理验证。

按想要的产物选权重:一张决策表覆盖全部下载任务

下载前先对号入座。所有权重都落在仓库根目录的checkpoints/,scripts/sampling/configs/ 与 configs/inference/ 里各 yaml 的ckpt_path已直接指向该目录,文件名固定即可开箱即用,无需手写配置。

目标产物模型权重文件(放入 checkpoints/)大致体积仓库内采样入口
静态图像(文生图/图生图)SDXL-base-1.0sd_xl_base_1.0.safetensors约 7GBstreamlit run scripts/demo/sampling.py
图生视频,14 帧,576x1024SVDsvd.safetensors数 GBsimple_video_sample.py --version svd
图生视频,25 帧SVD-XTsvd_xt.safetensors数 GBsimple_video_sample.py --version svd_xt
单图多视角环绕,21 帧,576x576SV3D_u / SV3D_psv3d_u.safetensors、sv3d_p.safetensors各数 GBsimple_video_sample.py --version sv3d_u(或sv3d_p)
4D 资产,48 帧 = 12 帧 x 4 视角SV4D 2.0sv4d2.safetensors30GB 以上simple_video_sample_4d2.py
4D 资产,5 帧 x 8 视角SV4D 2.0 8 视角sv4d2_8views.safetensors数十 GB 级simple_video_sample_4d2.py --model_path checkpoints/sv4d2_8views.safetensors
初代 4D,40 帧 = 5 帧 x 8 视角SV4Dsv4d.safetensors(另依赖sv3d_u.safetensors)数十 GB 级simple_video_sample_4d.py

只想验证流程就下 SDXL 一个文件;想图生视频就补齐 SVD 与 SV3D;做 4D 资产再下 SV4D 2.0。全部下齐建议磁盘预留 100GB 以上。

克隆并装依赖:三条命令完成环境准备

本地还没有仓库时,先克隆并进入根目录:

git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models

按 README 安装依赖(PyTorch 安装行里的 index-url 指定 CUDA 11.8 构建,先用nvidia-smi确认本机 CUDA 版本,再换对应通道):

python3 -m venv .pt2 source .pt2/bin/activate pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt pip3 install .

装完逐项核对版本,四条命令都有输出且无报错即通过:

python --version # 需 3.10 python -c "import torch; print(torch.__version__)" # 需 2.0.1 以上 nvidia-smi # CUDA 11.8 以上 huggingface-cli --version # 支持 download 子命令即可

一条命令拉齐 SDXL 基础权重并跑起文生图

任务若是文本生成图像或图生图,只需要这一个文件;它是仓库验证最多的模型,适合作为第一次下载。

拉取主权重(--local-dir把输出固定在仓库的 checkpoints/,--include只保留权重文件,跳过仓库里的其他小文件):

huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" \ --local-dir checkpoints

成功判据:ls -lh checkpoints/sd_xl_base_1.0.safetensors显示约 7GB,且目录里没有.incomplete残留。

想进一步确认文件完整,可以比对哈希(完整 64 位值与 README.md Inference 一节一致):

sha256sum checkpoints/sd_xl_base_1.0.safetensors # 预期 31e35c80fc4829d14f90153f4c74cd59c90b779f6afe05a74cd6120b893f7e5b

下载完成后启动文生图/图生图演示页:

streamlit run scripts/demo/sampling.py --server.port 8501

成功判据:页面可打开,模型列表能选中 sd_xl_base_1.0 并正常出图。

获取 SVD 与 SV3D 四个图生视频权重

想让静态图动起来(SVD)或围绕单物体合成多视角(SV3D),把下面四个文件取齐;只要 14 帧视频的话,下svd.safetensors一个就够。

按模型分别拉取(SVD 为 14 帧版,SVD-XT 是 25 帧微调版,SV3D 两个变体一起取:u 默认轨道,p 支持指定相机路径):

huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints

成功判据:ls -lh checkpoints/下四个文件齐全且大小非零。

显存偏紧的机器可再取图像解码器变体,降低解码阶段占用:

huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints

获取 SV4D 2.0 的 4D 资产权重:两个文件

想由短视频合成新视角的 4D 资产,用 SV4D 2.0:每次生成 48 帧(12 帧 x 4 视角),576x576 分辨率,输入建议用白底运动物体的短视频。

拉取主权重与 8 视角变体(同属 stabilityai/sv4d2.0 仓库,两个文件一次配齐即可覆盖两种生成规格):

huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints huggingface-cli download stabilityai/sv4d2.0 sv4d2_8views.safetensors --local-dir checkpoints

成功判据:ls -lh checkpoints/sv4d2.safetensors显示 30GB 以上且无.incomplete残留;该文件与 scripts/sampling/configs/sv4d2.yaml 中的ckpt_path对应。

需要跑初代 SV4D(40 帧 = 5 帧 x 8 视角)时,另从 stabilityai/sv4d 仓库取sv4d.safetensors放入 checkpoints/,其推理脚本同时依赖上一节已下载的sv3d_u.safetensors。

下载中断、速度慢时的三个动作:续传、镜像、并发

传输中途断掉,重放原命令即可从断点继续(huggingface-cli 自带断点续传;不要手动移动或清理缓存与目标目录,否则断点重置):

huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints

官方端点访问不畅时切镜像,对当前会话生效:

# 镜像的文件列表有同步延迟,若报文件不存在,unset 该变量回退官方端点 export HF_ENDPOINT=https://hf-mirror.com

带宽够但单文件太大太慢时,用 16 连接并发拉取(直链需从文件页面手动获取;aria2c 不认识 HuggingFace 仓库结构,也不参与 hf 命令的续传机制):

aria2c -x 16 -s 16 -o sv4d2.safetensors "<权重文件直链>"

分两段排障:先查下载问题,再查加载与生成问题

下载期问题(checkpoints/ 有残留):

  • 出现 0 字节文件或.incomplete文件——网络中断留下的传输残留,重放同一条获取命令续传;速度仍慢则切换上面的镜像端点。
  • 镜像端点提示找不到文件——镜像同步延迟,unset HF_ENDPOINT回退官方端点。
  • 哈希对不上——与 README.md Inference 一节的 sha256 比对,不一致就删除该文件后重新获取。

加载与生成期问题(模型端):

  • Missing key(s) in state_dict——权重不完整或版本与配置不匹配;删除对应文件后重放获取命令,重下前核对仓库页面文件清单。
  • CUDA out of memory——显存不足;给采样脚本加--decoding_t 1降低单批解码帧数,4D 脚本再补--encoding_t 1,或把--img_size降到 512。
  • 模型能加载但图像或视频模糊、畸变——配置与权重版本不一致;核对 scripts/sampling/configs/ 中各 yaml 的ckpt_path与 checkpoints/ 内实际文件名,确保二者来自同一发布版本。

用一次最小 SVD 推理闭环验证

拿到 SVD 权重后跑最小推理,能出视频即代表整条链路打通。

用仓库自带测试图采样(该图为 1024x576,恰是 576x1024 训练分辨率,不会触发尺寸告警;默认 25 步、14 帧):

python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd

成功判据:outputs/simple_video_sample/svd/新增000000.jpg(输入图)与000000.mp4(14 帧视频),终端无 traceback。显存紧张时追加--decoding_t 1。

下一步

  • 其他版本与参数:scripts/sampling/ 下的simple_video_sample.py(svd、svd_xt、sv3d_u、sv3d_p)、simple_video_sample_4d.py、simple_video_sample_4d2.py,各版本的默认帧数与步数都写在脚本内。
  • 模型结构配置:configs/inference/,每个 yaml 与 checkpoints/ 内权重文件一一对应。
  • 交互式界面:streamlit run scripts/demo/video_sampling.py(SVD/SV3D)、streamlit run scripts/demo/sampling.py(SDXL)。

某一个权重跑通后,其余权重随时按上文命令补齐即可,所有获取命令均可重放。

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询