SD Forge 5 分钟跑起来:大模型出图、显存优化与 GGUF 加载完整教程
2026/9/13 4:46:47 网站建设 项目流程

SD Forge 5 分钟跑起来:大模型出图、显存优化与 GGUF 加载完整教程

【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge

想在 Flux 级别的大模型上出图,但显存告急?这就是 Stable Diffusion WebUI Forge 要解决的场景。它是基于 SD-WebUI 1.10.1 维护的优化分支(当前版本 2.0.1v1.10.1),核心工作有三件:把大模型装进有限的显存(BitsandBytes NF4 与 GGUF 量化原生支持)、用动态显存管理(GPU Weight 滑杆、队列/异步交换)压低峰值占用、内置 ControlNet、IP-Adapter、FreeU V2 等常用扩展。

显存不够用的时候,大模型出图卡在哪

原版 SD-WebUI 跑 SD1.5、SDXL 没有压力,但 Flux 这类模型动辄十几 GB 起步,显存小的卡直接 OOM,或者出图慢到没法用。Forge 的思路是把模型按量化格式加载,再把权重的一部分留在显存、一部分按需换出到内存,用"GPU Weight"参数控制比例。对新手来说,这意味着一张 12G 甚至更低的卡也有机会跑 Flux,代价是出图速度会随参数变化。

一键安装包启动顺序

官方最推荐的一键安装包已内置 Git 和 Python 环境,推荐组合是 CUDA 12.1 + PyTorch 2.3.1:

解压后先运行 update.bat,再运行 run.bat

顺序很重要:先执行 update.bat 更新到最新代码,跳过这一步可能用到带 bug 的旧版本。启动成功后浏览器访问 http://127.0.0.1:7860/ 即进入界面。

Git 克隆与虚拟环境安装

熟悉 Git 的话,把 Forge 克隆下来当 SD-WebUI 的另一个分支装,可以复用原有 checkpoint 和扩展,仓库地址如下:

git clone https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge cd stable-diffusion-webui-forge python webui.py

追求环境隔离时,先python -m venv venv建虚拟环境、激活后再安装依赖和启动,流程与上面一致。

GPU Weight 参数怎么调

Flux 教程里的关键参数是 GPU Weight 滑杆,它决定模型权重有多少留在显存里。经验值:Flux 出图卡顿、变慢或 OOM 时,先把 GPU Weight 调低,官方说法是降低这个值能解决 99% 的性能问题;跑得快但显存紧张,再逐步调高。配套的 Offload Location、Offload Method 控制换出位置和队列/异步交换方式,默认配置不动,只调 GPU Weight 就够用了。

模型格式与内置扩展支持状态

组件 / 格式支持状态备注
BNF NF4原生支持Flux 量化主力格式之一
GGUF Q8_0 / Q5_0 / Q5_1 / Q4_0 / Q4_1原生支持均可配合 GPU Weight 滑杆使用
LoRA正常NF4 与 GGUF Q8_0 / Q5_0 / Q4_0 均带 LoRA 支持
FreeU V2已内置单文件实现,见 sd_forge_freeu
ControlNet 集成版正常Flux ControlNet 与 Union 版尚未实现
IP-Adapter / InstantID / Reference-only正常见 sd_forge_ipadapter

模型文件放进 models/Stable-diffusion/ 等对应目录即可被扫描到。

启动报 Connection errored out 怎么排查

这是最高频的问题。按这个顺序查:7860 端口是否被占用、防火墙是否拦截本地访问、是否漏跑了 update.bat。官方讨论区有专门文档,绝大多数案例是端口或防火墙。模型加载慢、出图慢则回到上一节:调低 GPU Weight。

LoRA 在低比特模型上精度不够怎么办

低比特(NF4、低精度 GGUF)模型上直接挂 LoRA 时精度可能不够,官方建议查两条:一是使用低比特模型的精确 LoRA 加载方式,二是开启"跳过 LoRA 补丁"选项,让 LoRA 只加载一次而不是每次生成都重新应用,同时能省时间。相关实现入口在 lora 扩展目录。

性能调优要点

  • GPU Weight 是第一优先级,其余参数先别动
  • 用 GGUF 还是 NF4:同精度下两者差距不大,按手头的模型文件选
  • FreeU V2 默认参数 B1=1.01、B2=1.02、S1=0.99、S2=0.95,界面已内置,不开不生效
  • Flux 采样器推荐用 Flux Realistic,配合 simple 调度器

适用场景与后续路线

适合的人群很明确:显存有限但想跑 Flux、想用 ControlNet/IP-Adapter 做受控生成、以及需要 GGUF 量化模型跑通工作流的用户。待办方面:Flux ControlNet 与 ControlNet Union 重写在进行中,API 端点(txt2img、img2img 等)功能正常但 Flux 支持待增强,Gradio 5 升级预计 2025 年初尝试,项目每 90 天或与重要修复对齐时同步一次原版 SD-WebUI。

本文基于版本 2.0.1v1.10.1(基于 SD-WebUI 1.10.1)整理,具体功能以项目 NEWS 与最新代码为准。

【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询