SD Forge 5 分钟跑起来:大模型出图、显存优化与 GGUF 加载完整教程
【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge
想在 Flux 级别的大模型上出图,但显存告急?这就是 Stable Diffusion WebUI Forge 要解决的场景。它是基于 SD-WebUI 1.10.1 维护的优化分支(当前版本 2.0.1v1.10.1),核心工作有三件:把大模型装进有限的显存(BitsandBytes NF4 与 GGUF 量化原生支持)、用动态显存管理(GPU Weight 滑杆、队列/异步交换)压低峰值占用、内置 ControlNet、IP-Adapter、FreeU V2 等常用扩展。
显存不够用的时候,大模型出图卡在哪
原版 SD-WebUI 跑 SD1.5、SDXL 没有压力,但 Flux 这类模型动辄十几 GB 起步,显存小的卡直接 OOM,或者出图慢到没法用。Forge 的思路是把模型按量化格式加载,再把权重的一部分留在显存、一部分按需换出到内存,用"GPU Weight"参数控制比例。对新手来说,这意味着一张 12G 甚至更低的卡也有机会跑 Flux,代价是出图速度会随参数变化。
一键安装包启动顺序
官方最推荐的一键安装包已内置 Git 和 Python 环境,推荐组合是 CUDA 12.1 + PyTorch 2.3.1:
解压后先运行 update.bat,再运行 run.bat顺序很重要:先执行 update.bat 更新到最新代码,跳过这一步可能用到带 bug 的旧版本。启动成功后浏览器访问 http://127.0.0.1:7860/ 即进入界面。
Git 克隆与虚拟环境安装
熟悉 Git 的话,把 Forge 克隆下来当 SD-WebUI 的另一个分支装,可以复用原有 checkpoint 和扩展,仓库地址如下:
git clone https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge cd stable-diffusion-webui-forge python webui.py追求环境隔离时,先python -m venv venv建虚拟环境、激活后再安装依赖和启动,流程与上面一致。
GPU Weight 参数怎么调
Flux 教程里的关键参数是 GPU Weight 滑杆,它决定模型权重有多少留在显存里。经验值:Flux 出图卡顿、变慢或 OOM 时,先把 GPU Weight 调低,官方说法是降低这个值能解决 99% 的性能问题;跑得快但显存紧张,再逐步调高。配套的 Offload Location、Offload Method 控制换出位置和队列/异步交换方式,默认配置不动,只调 GPU Weight 就够用了。
模型格式与内置扩展支持状态
| 组件 / 格式 | 支持状态 | 备注 |
|---|---|---|
| BNF NF4 | 原生支持 | Flux 量化主力格式之一 |
| GGUF Q8_0 / Q5_0 / Q5_1 / Q4_0 / Q4_1 | 原生支持 | 均可配合 GPU Weight 滑杆使用 |
| LoRA | 正常 | NF4 与 GGUF Q8_0 / Q5_0 / Q4_0 均带 LoRA 支持 |
| FreeU V2 | 已内置 | 单文件实现,见 sd_forge_freeu |
| ControlNet 集成版 | 正常 | Flux ControlNet 与 Union 版尚未实现 |
| IP-Adapter / InstantID / Reference-only | 正常 | 见 sd_forge_ipadapter |
模型文件放进 models/Stable-diffusion/ 等对应目录即可被扫描到。
启动报 Connection errored out 怎么排查
这是最高频的问题。按这个顺序查:7860 端口是否被占用、防火墙是否拦截本地访问、是否漏跑了 update.bat。官方讨论区有专门文档,绝大多数案例是端口或防火墙。模型加载慢、出图慢则回到上一节:调低 GPU Weight。
LoRA 在低比特模型上精度不够怎么办
低比特(NF4、低精度 GGUF)模型上直接挂 LoRA 时精度可能不够,官方建议查两条:一是使用低比特模型的精确 LoRA 加载方式,二是开启"跳过 LoRA 补丁"选项,让 LoRA 只加载一次而不是每次生成都重新应用,同时能省时间。相关实现入口在 lora 扩展目录。
性能调优要点
- GPU Weight 是第一优先级,其余参数先别动
- 用 GGUF 还是 NF4:同精度下两者差距不大,按手头的模型文件选
- FreeU V2 默认参数 B1=1.01、B2=1.02、S1=0.99、S2=0.95,界面已内置,不开不生效
- Flux 采样器推荐用 Flux Realistic,配合 simple 调度器
适用场景与后续路线
适合的人群很明确:显存有限但想跑 Flux、想用 ControlNet/IP-Adapter 做受控生成、以及需要 GGUF 量化模型跑通工作流的用户。待办方面:Flux ControlNet 与 ControlNet Union 重写在进行中,API 端点(txt2img、img2img 等)功能正常但 Flux 支持待增强,Gradio 5 升级预计 2025 年初尝试,项目每 90 天或与重要修复对齐时同步一次原版 SD-WebUI。
本文基于版本 2.0.1v1.10.1(基于 SD-WebUI 1.10.1)整理,具体功能以项目 NEWS 与最新代码为准。
【免费下载链接】stable-diffusion-webui-forge项目地址: https://gitcode.com/GitHub_Trending/st/stable-diffusion-webui-forge
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考