【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
Qwen-Image-2.1 是 Qwen 团队开源的统一图像生成与编辑模型(7B 视觉生成组件),其中最受新手欢迎的能力就是局部编辑:通过圈选、涂抹、Mask 三种方式指定"只改这里,其他别动"。本文带你快速上手局部编辑的原理、三种选区方式的适用场景、Prompt 写法要点,以及如何配合官方指令重写模型强化编辑效果。
Qwen-Image-2.1局部编辑原理:为什么它不会"手滑"
普通整图编辑经常出现两类翻车:想换个背景,结果把人脸也变了(过度编辑);想让颜色加深,结果几乎看不出变化(编辑不足)。
Qwen-Image-2.1 的编辑系统提示词(见 prompt_rewrite/prompts/system_prompt_edit.txt)把编辑核心定义为"属性解耦":
- ✅ 只修改用户点名的属性,且要把修改做到明显可见的程度
- ✅ 其余所有内容保持在输入图的原始保真度
- ✅身份是最难改变的不变量:人物面部特征、标志性的个人配饰、产品的精确设计与标识,以及图像的渲染介质(照片/动漫/3D渲染),在任何编辑中都会保留,除非你明确把它们作为编辑目标
官方示例中有一句很典型的指令:"把头转向左,而身体和手臂保持不动"——正是靠属性解耦,模型才能只动头部、锁住其他部位。
三种局部编辑方式:圈选、涂抹、Mask
Qwen-Image-2.1 支持通过circles(圈选)、painted annotations(涂抹标注)、separate masks(独立 Mask 图)三种方式指定局部编辑区域,三者走同一个接口,区别只在于选区的精度和方式。
方式一:圈选编辑(Circle),离散小目标首选
在要修改的区域周围画一个圈即可。官方展示中就有一张多区域圈选示例:同一张图里同时圈出三个区域——摘掉手表、改变发色、替换服装(circle-guided multi-region editing),一次指令全部完成。
- 🎯适合:手表、饰品、Logo、需要替换的独立部件
- 💡技巧:多个区域可以分别圈选,配合"只改圈内、圈外全部保持"的指令
方式二:涂抹标注(Paint),不规则区域快速标记
区域边界不太规则、或者你只想"大致框住"时,直接用笔刷在图上涂抹目标区域,模型会理解"这片笔迹标出的就是要编辑的地方"。
- 🎯适合:不规则小区域、软边界(如模糊的阴影范围)、快速随手标记
- 💡技巧:涂抹范围宁可略小于目标,避免把想保留的内容涂进去
方式三:Mask 图像,像素级精度的最终手段
需要像素级控制时,传入一张独立的黑白 Mask 图:白色 = 要修改的区域,黑色 = 要保留的区域。Mask 可以用任意修图工具绘制,也可以用自动分割模型一键生成。
- 🎯适合:发丝级复杂边界、文字区域精准替换、商品抠图、大范围换背景但必须精确保护主体
三种方式都通过同一个 Pipeline 调用,核心就是"输入图 + 编辑指令"(依赖安装见 README.md):
import torch from PIL import Image from diffusers import QwenImage21Pipeline pipe = QwenImage21Pipeline.from_pretrained( "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16 ).to("cuda") result = pipe( prompt="仅移除圈出的手表,其余所有区域保持与输入图完全一致", image=Image.open("input.png"), num_inference_steps=40, ).images[0]💡小知识:单图局部编辑时,输出默认继承输入图的分辨率与宽高比(对应输出字段
ratio_follow),无需再指定尺寸,编辑后的图可以直接替换原图使用。
圈选 vs 涂抹 vs Mask:一张表快速选择
| 方式 | 精度 | 上手成本 | 典型场景 |
|---|---|---|---|
| 圈选 Circle | 中 | ⭐ 最低 | 手表、饰品等离散小目标 |
| 涂抹 Paint | 中偏高 | ⭐⭐ 低 | 不规则区域、快速标记 |
| Mask 图 | ⭐⭐⭐ 像素级 | 较高 | 发丝边界、文字替换、商品抠图 |
比如"只把标题文字翻译成另一种语言,人物和背景全部不动"这类文字局部编辑,用 Mask 圈出文字区域通常是最稳的选择:
局部编辑Prompt写法:3条核心规则
基于官方编辑系统提示词,写给新手的 3 条规则:
- 写清目标区域 + 明确写出要保留什么。先说操作("移除/替换/重绘圈内的手表"),再给一条总括性保留声明("其余区域保持与输入图完全一致"),比逐个描述要保留的内容更安全——描述得越具体,模型越容易"顺手"改掉它。
- 不要添加没要求过的操作。即使原图上有个明显的瑕疵,只要你没点名,就让它保持原样。
- 图中要出现的文字必须逐字给出。如果编辑后画面中会出现可读文字,请在 Prompt 里用引号写出完整内容,不要含糊带过。
官方示例数据 prompt_rewrite/data/edit_example.jsonl 里就有一条很地道的短句指令:
"can u this image so that the head twist to the left while the body and arms not moved"
——"改哪里 + 哪里不动"两句话说清,这正是局部编辑指令的标准形态。
配合官方Prompt重写模型:一句话指令变专业编辑指令
如果你的指令比较口语化,可以配合仓库自带的指令重写模型(基于 Qwen3.5-VL 9B 微调,代码位于 prompt_rewrite/)。它的--task edit模式会把模糊的编辑指令扩写为精确、可执行的编辑指令,并自动判断输出画布是跟随哪张输入图的比例:
python run_vllm.py --task edit \ --ckpt Qwen/Qwen-Image-2.1-PE-I2I \ --input data/edit_example.jsonl --output out.jsonl输入就是一行行简单的 JSON(示例输入见 prompt_rewrite/data/),输出字段positive_prompt可直接喂给上面的 Pipeline。例如这条把 Logo 图变成"天空中飘扬的旗帜"的示例:
更多重写模型的细节(采样参数、vLLM 服务部署)可参考 prompt_rewrite/README.md。
总结:Qwen-Image-2.1局部编辑速记
- 🎯原理:属性解耦——只改点名的属性,其余锁定;身份、产品、画风是最强不变量
- ⭕圈选:离散小目标(手表、饰品),上手最快
- 🖌️涂抹:不规则区域快速标记,精度适中
- ⬜Mask:像素级精度,文字替换与发丝级边界首选
- ✍️Prompt 三原则:写清目标 + 明确保留项;不加点名外的操作;图中文字逐字给出
- 🔁进阶:口语指令先过一遍官方重写模型(
--task edit),局部编辑命中率更高
局部编辑之外,Qwen-Image-2.1 还支持最多 10 张参考图的多主体合成与原生透明图(RGBA)生成,配合局部编辑可以覆盖绝大多数图像修改场景:
更多编辑示例与社区支持(Diffusers、ComfyUI 等),可查看仓库 README.md 的 Showcase 与 Community Support 章节。
【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
相关推荐
Qwen-Image-2.1 进阶编辑技巧:10张参考图+局部圈选,人像产品身份精准保持
Qwen Image 2.1 进阶编辑技巧:10张参考图+局部圈选,人像产品身份精准保持 Qwen Image 2.1 是 Qwen 团队开源的 AI 图像编辑
人工智能大模型媒体生成多模态Xinference 部署 Qwen-Image-Edit-2511:image2image 编辑模型的三种启动方式与源码解析
Xinference 部署 Qwen Image Edit 2511:image2image 编辑模型的三种启动方式与源码解析 本文围绕 Xinference
模型推理服务人工智能大模型本地部署多模态语音5分钟升级游戏DLSS版本:DLSS Swapper免费游戏帧率优化实测记
5分钟升级游戏DLSS版本:DLSS Swapper免费游戏帧率优化实测记 昨晚打《赛博朋克 2077》,开光追后帧数直接掉到 40 以下,而游戏里的 DLSS
桌面应用
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考