近日,Qwen 团队开源 Qwen-Image-2.1。它延续了 Qwen-Image 的图像生成路线,同时把图像编辑、透明图生成和多参考图控制收进同一条推理管线。
这次更新,Qwen 团队控制了生成主干的参数规模,并在注意力结构、条件缓存和图像编解码上做了取舍。
先看模型参数
Qwen-Image-2.1 的生成主干采用单流DiT,共 32 层,参数量为 7B。单流结构会把文本、条件图像和待去噪的图像表示放入同一套 Transformer 中处理,模型因此能用统一方式完成文生图和图像编辑。
它的文本与条件图编码器是 Qwen3-VL 8B。这个模块负责理解提示词,也负责读取参考图,将两种条件整理为统一表示。这里需要分清两组参数:官方所说的"7B"指视觉生成组件,系统还包含 Qwen3-VL 8B 编码器,不能把整个推理管线简单理解成一台只需承载 7B 权重的模型。
图像侧采用 64 通道 RGBA VAE,空间压缩倍率为 16 倍。RGBA 中的 A 代表 Alpha 透明度通道,这使模型可以直接生成带透明背景的素材,也可以编辑透明图层。调度器采用 Flow Matching,配合 Euler 离散调度和动态偏移。官方默认推理步数为 40 步,权重以 BF16 形式发布。
64 通道 RGBA VAE16 倍压缩Flow Matching
Qwen3-VL 读取文字与参考图,DiT 在压缩后的潜空间里完成去噪生成,VAE 再把结果还原为带颜色和透明度的像素图。开发者调用时面对的是一条统一 Pipeline,底层仍由多个大组件协作。7B 适合用来描述生成主干的体量,却不能单独代表整套系统的资源消耗。
一句话总结
调用接口是一条统一 Pipeline,底层是 Qwen3-VL 编码器 + DiT 主干 + RGBA VAE 的多组件协作,评估资源时要按整条管线来算。
如何同时处理生成与编辑
Qwen-Image-2.1 使用块因果注意力。文本部分采用 token 级因果掩码,图像部分采用图像块级双向掩码。模型可以保持文本序列的顺序关系,同时让同一张图里的视觉块互相读取信息。
这套设计被称为混合粒度注意力。它还有一个很实际的作用:复用前缀 KV Cache。图像编辑时,输入图片和文字指令在第一次去噪步骤中完成编码,后续步骤直接读取缓存。参考图越多,避免重复计算的价值越明显。模型默认开启 causal_condition,缓存逻辑由 Transformer 自动处理。
扩散式图像模型通常需要反复执行多轮去噪。若每一轮都重新计算相同的文字和条件图,算力会花在重复内容上。Qwen-Image-2.1 把稳定条件留在缓存中,让后续步骤集中处理正在变化的图像表示。这项机制用于 vLLM-Omni 的服务加速,并配合 CUDA Graph 减少内核启动开销。
这也解释了 Qwen-Image-2.1 为什么把多图编辑列为重点能力。它最多接收10 张参考图,可以把人物、服装、鞋、包、帽子分别作为条件,再合成完整画面;也可以根据多张人物照生成合影。
“最多 10 张”代表输入上限,不等于每次都应塞满参考图。每张图片都要进入条件上下文,数量、分辨率和主体关系会共同影响显存、速度与控制难度。实际项目更适合先确定每张参考图的职责,例如一张锁定人物,一张提供服装,一张规定场景,再逐步增加条件。这样也方便定位某张参考图引起的身份漂移或构图冲突。
原生透明图,最有辨识度的能力
很多图像模型只能先生成带背景的 RGB 图片,再依靠抠图工具得到透明素材。Qwen-Image-2.1 的 VAE直接处理 RGBA,透明度进入模型的生成空间。用户可以从文字生成透明背景贴纸、图标或商品元素,也可以编辑已有透明图层,还能从照片中提取主体。
透明度由模型直接生成后,边缘、半透明材质和细碎结构有机会保留更多信息。玻璃、薄纱、烟雾、毛发这类内容尤其依赖 Alpha 通道。对于电商设计、游戏素材和视频包装,这项能力可以减少抠图、修边及导出透明底文件的步骤。
建议在提示词中明确写出“RGBA image” “alpha channel”和“background is transparent”,提示词仍需清楚声明输出格式。
透明图还能继续作为编辑输入。设计人员可以保留主体透明边缘,替换局部纹理或姿态,再把素材放回海报、网页和视频合成软件。过去常见的工作流会在生成模型与抠图模型之间来回传文件,现在可以先在同一模型内完成更多步骤。成品是否需要人工修边,仍要按毛发、玻璃等复杂边缘逐张检查。
编辑方式更接近真实工作流
Qwen-Image-2.1 支持单图编辑和多参考图编辑。局部修改可以通过圆圈、手绘标注或独立蒙版指定区域。使用者可以圈出手表要求删除,标出头发修改颜色,再把服装区域替换为另一种款式。模型同时处理多处改动,其他区域尽量保持原样。
在主体一致性之外,文字渲染、肖像光线、真实纹理和细节表现得到改进。展示案例包含文字排版、商品保真、自拍扩展全景,以及根据角色三视图生成分镜。这里的能力组合指向一套连续流程:先用参考图固定角色或商品,再改构图和局部元素,最后输出适合成品尺寸的图像。
文字渲染直接影响海报、包装和社交媒体图片能否交付。官方示例把文字作为画面内容生成,重点观察字形、排版与材质能否同时成立。全景和分镜则考验空间延展与角色一致性:前者根据自拍补出更宽的环境,后者读取角色三视图并生成连续镜头。两类任务都要求模型理解参考图里的主体特征,再按照新构图重新组织画面。它们也给出了较清楚的测试方法,团队可以准备固定角色、商品标识和指定文案,比较多次生成后的身份、文字与版式稳定度。
**测试建议:**准备固定角色、商品标识和指定文案,比较多次生成后的身份、文字与版式稳定度。
局部编辑的输入方式也值得留意。圆圈和手绘标注适合交互式界面,用户不必先制作精细蒙版;独立蒙版则适合已有分割结果的自动化流程。两种入口覆盖了人工创作与批处理场景。模型在一次任务里可以接收多个修改目标,生产端仍应检查未选区域是否出现变化,尤其是人脸、文字和商品标识。
圆圈与手绘标注服务人工创作,独立蒙版服务批处理自动化。
提示词改写单独交给两套 9B 模型
Qwen 团队还发布了两个提示词改写模型:
Qwen-Image-2.1-PE-T2I服务文生图
Qwen-Image-2.1-PE-I2I服务图像编辑
两者都由 Qwen3.5-VL 9B 微调而来,共用一套代码。它们可以把短提示词扩展成详细英文描述,并为文生图推荐画幅比例;编辑任务还可以沿用某张输入图的比例。
这部分属于可选前处理。生成模型可以直接接收用户提示词,若项目追求批量出图的一致性,可以把改写模型放在前面。官方提供 Transformers 单条推理、vLLM 离线批处理及服务化调用三种方式,便于从本地试验过渡到生产队列。
本地部署需要什么
本地运行可直接使用 Diffusers 的 QwenImage21Pipeline。基础环境包括 PyTorch 2.4 或更高版本、Transformers 5.17 或更高版本、开发版 Diffusers、Accelerate 和 Pillow。官方示例采用 CUDA、BF16 和 40 个去噪步骤。显存不足时可开启 enablemodelcpu_offload()。
习惯节点工作流的用户可以选择 ComfyUI。在线服务可使用 vLLM-Omni 或 SGLang-Diffusion,二者都提供缓存、并行和内存优化;LightX2V 也已支持文生图与图像编辑。AMD 显卡可通过 ROCm、PyTorch 和 Diffusers 运行。
结语
Qwen-Image-2.1 把 7B 单流 DiT、Qwen3-VL 条件理解、RGBA VAE 和多参考图编辑组合到一套模型里。它给开发者的价值很具体:一条 Pipeline 可以完成从生成、改图到透明素材输出,服务端也已有多套推理框架可选。接下来真正值得测的是不同显卡上的速度、显存和多图一致性,这些数据会决定它能进入哪些生产环境。
模型下载
OpenCSG社区:
https://opencsg.com/models/Qwen/Qwen-Image-2.1
Hugging Face社区:
https://huggingface.co/Qwen/Qwen-Image-2.1
OpenCSG vs魔搭:如何选择?
模型部署在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
关于 OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps 是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。