最近AI绘画圈子里又热闹起来了,前有FLUX系列坐稳开源质量标杆,后有Seedream(即梦)、Z-image、Qwen-Image、GLM-Image一个接一个冒出,各自拿手绝活还不太一样。很多朋友在社区里问“这几个模型到底怎么选”“本地能不能跑”“为什么我下载的Z-image一生成就是黑图”。说实话,这些模型的名字叠在一起容易让人发懵,但真正上手之后会发现它们背后其实是同一套扩散模型逻辑,只是工程实现、文本理解、社区生态和部署工具各不相同。
这篇文章我就从实战角度,把这五个模型的核心知识按“模型定位—底层原理—本地部署—高频问题”四层拆开讲。不管你是刚开始接触AI绘画的新手,还是已经在ComfyUI里折腾过SD和FLUX的老手,看完这份梳理应该能少走不少弯路。
1. 先别急着下载,五个模型到底什么来路
1.1 FLUX.2:绕不开的“质量天花板”
FLUX系列是Black Forest Labs出的开源图像生成模型,FLUX.2可以理解成在FLUX.1基础上继续迭代的新版本。它延续了扩散Transformer(DiT)架构,把图像和文本都当作token序列来处理,整体生成逻辑和Stable Diffusion家族有明显区别。
FLUX给我的最大感觉是“稳”:构图合理、光影自然、对复杂提示词的理解能力很强,尤其在写实人像和电影感画面上很出彩。FLUX.2在提示词跟随性、细节纹理和色彩控制上也做了加强。不过它最大的门槛在于显存,整模型参数体量摆在那里,消费级显卡想跑得顺手,要么用量化版本,要么得学会甩一些模块到内存里。
1.2 Seedream(即梦):中文美学与文字的强项
Seedream是字节跳动即梦团队推出的图像生成模型,即梦平台可以直接在线使用,也有对应的API接入方式。这个模型的强项非常明显:对中文语义的理解很细腻,并且生成画面里的中文文字不会乱码。
我做过的实际测试里,用Seedream生成“带有毛笔书法标题的海报”,文字内容基本能保持结构正确,这在多数开源模型里是稀缺能力。所以如果你的项目需要大量中文海报、电商素材、公众号封面,Seedream是很好的“出图终点”。
1.3 Z-image:社区热度很高的开源“多面手”
Z-image在社区里讨论度不低,尤其是一批国产模型爱好者把它当作本地部署首选。它提供了base和turbo两个版本:base版本出图细腻,但推理速度慢一些;turbo版本通过减少采样步数来提速,适合批量出图和实时工作流。
不过Z-image的坑也明显,最典型的就是“base生成黑图”。很多刚下载完权重的人,放进ComfyUI或diffusers一跑,出来的是一张纯黑底图。这个问题后面我会单独展开,原因其实很集中,排查起来不需要太长时间。
1.4 Qwen-Image:把多模态理解塞进扩散模型
Qwen-Image来自阿里通义团队,属于开源模型,它的亮点在于把Qwen系列的多模态理解能力和扩散生成模型结合起来。也就是说,模型不光是看一段文本然后画图,它还能理解更复杂的指令结构,比如输入一张参考图和一段描述,做局部编辑和风格迁移。
本地部署方面,Qwen-Image已经有不少ComfyUI节点支持,硬件门槛和FLUX不在一个量级。配合OpenVINO这类推理优化工具,在中低端显卡上也能获得可用的生成速度。这也是我在Ubuntu环境里经常选择研究的模型之一。
1.5 GLM-Image:智谱系的“中文语义尖刀”
GLM-Image是智谱AI出品的图像生成模型,延续了GLM系列在中文语义理解上的优势。它在处理中文提示词时的跟随性很强,一些抽象描述如“失落的黄昏”、“时间流动的感觉”都能转译成比较准确的视觉元素。
这个模型的风格偏向干净和克制,不像有些模型“用力过猛”,适合做概念图、插画分镜和产品预览。它也有ComfyUI集成方案,部署流程和Qwen-Image类似,文本编码器会占用一定显存,但整体可控。
1.6 模型选型对照表
| 模型 | 团队 | 开源情况 | 中文能力 | 强项场景 | 本地部署难度 | ComfyUI支持 |
|---|---|---|---|---|---|---|
| FLUX.2 | Black Forest Labs | 权重开放 | 中等 | 写实、艺术感、复杂构图 | 较高 | 完善 |
| Seedream(即梦) | 字节跳动 | 平台/API为主 | 很强 | 中文海报、文字渲染 | 低(在线使用) | 官方方案 |
| Z-image | 社区/厂商开源 | 权重开放 | 较好 | 细腻画面、批量生图 | 中等 | 支持 |
| Qwen-Image | 阿里通义 | 权重开放 | 强 | 多模态编辑、可控生成 | 中等 | 支持 |
| GLM-Image | 智谱AI | 权重开放 | 很强 | 中文语义转画面 | 中等 | 支持 |
选模型不能只看精度,还得看你的使用场景。如果只是做中文营销图,Seedream效率最高;如果你想本地跑通并研究底层,Qwen-Image和Z-image会给你更多折腾空间;而论纯画质的上限,FLUX.2依然是很多人心里的大山。
2. 读懂这几个模型,绕不开的底层三件套
2.1 扩散模型还在,但U-Net换成了DiT
这几个新模型的底层都是扩散模型,简单说就是“先让图像变成纯噪声,再一步步去噪还原成目标图”。但架构上有个重要变化:过去的Stable Diffusion用U-Net做去噪主干,而FLUX.2、Qwen-Image、GLM-Image、Z-image等都转向了DiT(Diffusion Transformer)。
DiT的思路是把图像切成一格格patch,再和文本信息一起交给Transformer处理,类似把画画变成“逐格预测”。这种结构的优势是能建模更长距离的依赖关系,所以生成画面的整体一致性更好,复杂场景不容易散架。代价是计算量更大,这也是为什么这些模型普遍比SD系列吃显存。
2.2 文本编码器:决定“指哪打哪”的关键
扩散模型里有个说法:“文本编码器决定上限,生成模型决定下限。”你可以把文本编码器理解成一个翻译官,先把你的中文或英文提示词翻译成模型能理解的高维向量。翻译官水平越高,模型越知道该画什么。
FLUX系列用了T5和CLIP组合,理解力很强,但对中文的支持更多依赖T5的跨语言能力。Qwen-Image直接用Qwen-VL模型做文本编码器,所以中文指令理解很自然。GLM-Image和Seedream则针对中文语义做了专门优化,因此在中文prompt下表现明显更稳。
我个人的建议是:无论用哪个模型,提示词尽量写完整,不要只写“猫”,而是写“一只橘猫蹲在窗台上,阳光洒在毛发上,背景是虚化的城市街道”。文本编码器再强,也需要你提供足够的上下文。
2.3 VAE与像素空间、潜空间的关系
每次看到模型列表里的“VAE”,很多人以为是个可加可不加的插件,其实它是整个生成链路中不可少的一环。VAE的作用是在扩散模型操作的低维“潜空间”和最终像素空间之间做转换。
扩散模型不是在原图上做去噪,而是在VAE压缩后的潜空间里做,计算量小很多。生成结束后再用VAE解码器把潜空间数据还原成图片。如果VAE文件缺失、加载错误,或者权重文件放错位置,就会出现画面发灰、发黑、偏色等问题。Z-image的“黑图”案例里,VAE问题占了很大比例。
2.4 采样器与步数:影响效果的隐藏变量
除了模型本身,采样器选择也会大幅影响结果。比如Euler、DPM++、DDIM等,各有各的收敛节奏。Z-image turbo版本通常只需要4步采样,但你依然用默认的20步采样器去跑,画质反而可能崩。FLUX.2一般推荐20到30步,配合特定采样器。建议大家拿到新模型后,先去模型页看推荐的采样器配置,这个信息比很多教程都管用。
3. Qwen-Image:本地部署与ComfyUI实操复盘
3.1 Ubuntu 20.04环境准备
我自己常用的是Ubuntu 20.04,配合ComfyUI跑Qwen-Image。环境准备这块没什么玄学,核心就是把几件套版本对齐。
conda create -n comfy python=3.10 conda activate comfy pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 git clone https://github.com/comfyanonymous/ComfyUI cd ComfyUI pip install -r requirements.txt需要注意的是,PyTorch版本和CUDA版本必须匹配。很多人部署失败,不是模型问题,而是torch装成了CPU版本。可以用下面命令检查GPU是否被正确识别:
python -c "import torch; print(torch.cuda.is_available())"输出为True才继续往下走。
3.2 Qwen-Image在ComfyUI的流程图搭建
ComfyUI的节点图形化方式让Qwen-Image工作流变得非常直观,核心流程其实很固定:加载模型 → 文本编码 → 潜空间采样 → VAE解码 → 保存图像。
我习惯的节点列表如下:
CheckpointLoader:加载已经写进ComfyUI目录的Qwen-Image模型文件。CLIPTextEncode:分别接正向提示词和负向提示词。Qwen-Image对负向提示词的依赖不高,但可以写一些通用避讳,比如“low quality”、“bad anatomy”。KSampler:设置采样步数,推荐20步左右,CFG建议3到5之间,太高容易过曝。VAEDecode:把潜空间图像解码成像素图。SaveImage:保存结果。
如果你是从模型页下载的单个权重文件,大概率需要配合对应的VAE和文本编码器文件一起放置。ComfyUI里有个习惯:把diffusers格式的模型转成safetensors单文件,会省去很多路径匹配问题。网上已经有大佬做了转换工具,下载后直接放models/diffusers也可以,取决于你用的节点类型。
3.3 OpenVINO部署的加速踩坑
社区里现在流行用OpenVINO把Qwen-Image转到CPU或核显上跑,这对没有独显的朋友很有吸引力。热搜里的“openvino qwen-image”指的就是这套方案。
OpenVINO部署的实际流程不算复杂:先把PyTorch模型导出成ONNX,再用OpenVINO工具转成IR格式,最后放到OpenVINO的推理引擎里加载。但有几个经典坑:
- 固定输入shape会限制不同分辨率,导出时要设置动态shape。
- Qwen-Image包含文本编码器、扩散主干和VAE三部分,三部分都要转IR,少一个就报错。
- 第一次运行会做模型编译,耗时较长,不要当成死机。
实测下来,OpenVINO在CPU上的推理速度能比纯PyTorch快一到两倍,但依然无法和独立显卡比。如果你只是想尝鲜或者没有GPU,可以试试;要批量生产画质图,还是建议至少有一张8GB显存的N卡。
4. Z-image实战:从权重下载到搞定黑图问题
4.1 base与turbo版本选择与下载渠道
Z-image有两种常见版本:base和turbo。base版本注重画质,适合精细出图;turbo版本通过蒸馏和减少推理步数实现加速,适合做批量出图或实时工作流。
下载方面,Hugging Face仓库是首选,社区里也会通过蓝奏云等网盘分享权重,方便下载受限的朋友。这里提醒一句:不管从哪个渠道下载,一定要核对SHA256哈希值,避免拿到损坏或被篡改的文件。文件目录建议保持如下结构:
ComfyUI/models/checkpoints/z-image-base.safetensors ComfyUI/models/vae/z-image-vae.safetensors如果你下载的是diffusers格式文件夹,也可以放到models/diffusers下,配合特定加载节点使用。
4.2 Z-image base生成黑图的五个排查方向
“Z-image base 生成的图是黑的”这个关键词在社区里几乎成了日经问题。我前前后后踩过不少次,总结下来根源就在五个方向:
| 排查方向 | 说明 |
|---|---|
| VAE缺失或未加载 | 模型文件里如果没有内置VAE,生成输出就会是潜空间数据,表现为纯黑或纯灰色 |
| 权重文件损坏 | 下载不完整导致权重解析异常,模型实际只有噪声输出 |
| 数据类型不匹配 | fp16与bf16混用,或CPU/GPU类型不一致,导致张量数值溢出 |
| CFG设置过高 | 部分base模型对CFG非常敏感,CFG超过7时画面直接变黑 |
| 采样器不兼容 | 某些采样器与base版本不匹配,导致去噪过程发散 |
对应解决办法比较直接:把VAE文件放入models/vae,在节点上明确连到VAEDecode;检查模型文件大小是否和页面标注一致;统一在ComfyUI启动参数中加--force-fp16或--bf16;先把CFG改成4试跑;采样器换成euler或dpmpp_2m。
4.3 用turbo版提高生产出图效率
如果你已经能稳定出图,想提高速度,Z-image turbo是很好用的选项。它的核心参数是采样步数只需要4步,CFG通常设为2左右。ComfyUI里可以新建一个预设工作流,把KSampler的steps改成4,cfg改成2,采样器选择dpmpp_2m。
实测下来,turbo版本在3060显卡上生成一张1024x1024图,耗时能控制在2秒以内。做批量风格探索或者视频帧生成时非常划算。唯一要注意的是turbo版本对细节的保留不如base,复杂光影场景会有点“糊”,建议在需要快速验证创意时用turbo,最终成稿再切回base精修。
5. FLUX.2、Seedream、GLM-Image的实用心得
5.1 FLUX.2显存吃紧?试试这些方案
FLUX.2的显存占用一直是本地玩家的痛点。裸模型加高分辨率生成,16GB显存都不一定从容。我试下来比较有效的组合是:
- 使用FP8量化版本的模型文件,体积几乎减半,画质损失不明显。
- ComfyUI里开启
--lowvram或--medvram模式,让部分模块按需加载。 - 采样步数控制在20步以内,没必要追求40步。
- 启用Tiled VAE,大图解码时把画面拆块处理,能避免爆显存。
FLUX.2更适合作为“精修模型”使用,先用其他模型快速出草稿,再把满意的构图交给FLUX.2重新生成或图生图精修。
5.2 Seedream(即梦)作为工作流中的“出图终点”
Seedream在线平台和API的优势是省去本地部署麻烦,而且它在中文文字生成上的优势极其明显。你可以把Z-image或FLUX.2生成的画面作为底图,拿到即梦里做二次重绘,或者直接用即梦生成包含中文商品名的海报。
我用Seedream的API时,习惯把提示词写成带结构的形式,比如:
一张电商促销海报,背景浅蓝色渐变,中间是一个白色保温杯,杯身印有“冬日暖心”,标题文字“限时特惠”,画面干净,构图居中。Seedream对中文标点、引号的理解比很多模型好,但也不要一股脑堆长句,重点信息放在前50个字,效果最稳。
5.3 GLM-Image的人像细节与提示词习惯
GLM-Image在中文人像描述上很有优势,比如“一个三十岁左右的东方女性,五官柔和,眼神平静,身穿米色毛衣,背景是虚化的秋季街道”。它能把“柔和”“平静”这种偏抽象的词转化成实际光影和面部状态。
我的经验是GLM-Image比较吃提示词中的“层次词”:地点、光线、表情、服饰、背景各写一段,比把所有元素挤在半句话里要更容易出片。采样步数推荐20到25步,CFG在4到6之间。如果你想让人物皮肤质感更真实,可以在负向提示词里写“oversmoothed, plastic skin”,但别写太多,否则画面会显得生硬。
6. 高频问题速查与避坑手册
6.1 常见问题速查表
| 问题 | 可能原因 | 解决思路 |
|---|---|---|
| Z-image生成黑图 | VAE缺失、权重损坏、CFG过高 | 接VAE解码,重新下载权重,CFG降到4试跑 |
| Qwen-Image加载报错 | 模型路径不对、文本编码器缺失 | 检查ComfyUI目录结构,补齐三件套文件 |
| OpenVINO转换后速度没提升 | 动态shape未配置 | 导出时设动态输入尺寸 |
| Ubuntu下ComfyUI启动黑屏/闪退 | PyTorch CPU版本或依赖冲突 | 检查torch.cuda.is_available(),重装环境 |
| FLUX.2爆显存 | 未启用低显存模式 | 加--medvram --offload参数,使用FP8 |
| Seedream生成的文字乱码 | 提示词中文字过密 | 缩短提示词,关键词前置 |
| GLM-Image人像脸崩 | 采样步数太低或CFG不当 | 步数提到25,CFG试5 |
| turbo版画质粗糙 | 采样器不匹配 | 换dpmpp_2m,确保步数为4 |
6.2 几个值得收藏的通用排查习惯
每次我在本地环境引入新模型,都会按固定顺序做三件事:先看模型页面的README和推荐配置,再检查模型文件的SHA256,最后用一张简单的测试图跑通工作流。这样能把“模型问题”和“环境问题”快速隔离开。
日志是个很重要的线索。ComfyUI控制台里如果出现CUDA error: out of memory,那是显存问题;但如果是FileNotFoundError,就要先检查路径,而不是急着改显卡配置。很多人把大量时间耗在重装环境上,其实问题只是VAE文件放错了目录。
如果你同时折腾多个模型,建议给每个模型建独立的工作流JSON文件,并标注好对应的模型路径、步数、CFG、采样器。这几个信息看似简单,但换模型时只要有一个对不上,成品质量就会天差地别。
最后再分享一个小技巧:每次运行新模型的第一张测试图,最好固定用同一句提示词,比如“一只白色猫咪坐在窗边,背景有绿色植物”。这样你在不同模型间切换时,可以通过同一句话快速对比风格和参数手感,久而久之就会形成一套自己的“模型校准方法论”。