☰
Stable Diffusion图生图(img2img)全解析:从重绘幅度到ControlNet实战
2026/10/1 12:29:29 网站建设 项目流程

Stable Diffusion玩到一定阶段,都会碰到这样一个问题:文生图的随机性太大,生成什么完全靠抽卡。哪怕你的提示词写得再精准,模型理解出来的构图、姿势、光影也未必是你脑海里那张图。这时候真正拉开玩家差距的,就是img2img(图生图)模式。它把生成过程从"从噪声中凭空创造"变成了"在已有图像上定向演化",这就像给你一支画笔而不是一块画布——你不再依赖模型猜你想要什么,而是直接告诉它方向和幅度。

这篇内容我打算直接把img2img模式从底层原理到参数调优、再到各种实战玩法全部拆开讲清楚。适合两类人看:一是刚入门、图生图只会拖一张图进去然后乱调重绘幅度的新手,二是已经能稳定出图但总觉得图生图效果不可控、想系统化理解这个模式的进阶玩家。我会尽量用具象化的方式讲透这个模式的工作原理,再给出大量我自己实测过的参数组合和操作思路。

1. 先从一张"重绘"的图说起:img2img到底在做什么

很多人在刚接触图生图时,会把它理解成一个简单的"滤镜工具"或者"风格化工具"。这种理解不算错,但远远低估了img2img的能力。它不是一个把照片变成油画风格的程序,而是一个完整的图像生成流程——把一张已有的图片和一段文字描述一起交给模型,让模型在参考原图结构的同时,按文字描述重新生成一张新图。

1.1 为什么img2img比txt2img更容易控制结果

理解这个问题的关键在于Stable Diffusion的工作机制。文生图时,模型拿到的是纯噪声——一张没有任何信息量的雪花噪点图,然后根据文字描述一步步去噪,最终生成图像。这个过程里,模型只能依赖文字描述和它对世界的先验知识来"猜测"你想要的画面,所以结果往往会和你的想象有偏差。你写"一只戴帽子的猫",它可能给你画出一只戴着草帽的橘猫,但你可能想要的是戴礼帽的黑猫,这就是典型的方向偏差。

而img2img把起点从纯噪声换成了一张已经有明确结构的图片。模型去噪的每一步都会参考原图的潜空间特征,确保生成结果在构图上、整体结构上不会偏离原图太远。你给它一张戴草帽橘猫的照片,再加提示词"black cat, wearing a top hat",模型会在保留猫咪姿势、背景结构的前提下,把毛色换成黑色、把草帽换成礼帽。你给予的信息越多,模型的发挥空间就越少,结果自然越可控。

我用的比喻是:文生图是把一个从外地来的画家带到一片空白画布前,让他根据你的口述画一幅画,结果完全看这个画家的脑补能力;img2img则是你给这个画家一张草图,告诉他在此基础上修改,他再怎么自由发挥,也得先尊重你给的构图基础。

1.2 这个模式的"代码层面"到底发生了什么

如果想精确理解img2img,你需要知道一个概念:Stable Diffusion并不直接处理像素图,而是用VAE把图片编码到潜空间(latent space),在这个低维空间里做去噪处理,然后再用一个解码器把潜空间向量还原成图片。

img2img的流程具体拆解是:先把你输入的原图经过VAE编码成潜空间的一组特征张量,然后根据你设定的重绘幅度(Denoising Strength),往这组特征里注入一定量的噪声。最后模型从"加了噪声的潜空间特征"出发,结合你的提示词去噪重建出新的图像。

这里最关键的参数就是Denoising Strength(重绘幅度)。它决定了你有多大程度"破坏"原图的潜空间特征,再让模型重建。

  • 重绘幅度0.1-0.3:原图结构基本完整保留,只有细节纹理轻微变化
  • 重绘幅度0.4-0.6:构图不变,但色彩、纹理、风格会发生明显改变
  • 重绘幅度0.7-0.8:原图结构只有大轮廓被保留,细节几乎全部重建
  • 重绘幅度0.9以上:原图只剩一个模糊的影子,基本等于重新生成

理解这个逻辑之后,你会发现img2img的可控性核心不在于提示词写得多华丽,而在于你能否精准控制重绘幅度这条"破坏-重建"曲线的位置。后面我会详细讲不同场景下该用什么参数。

2. 核心参数逐个拆:重绘幅度、采样步数、CFG在img2img里的角色差异

图生图的参数面板看着和文生图很像,但实际每个参数在img2img里的作用权重和文生图完全不同。如果你沿用文生图的调参习惯去推图生图,大概率会得到一堆脏乱差的结果。这部分我把我实测的几个关键参数的差异逻辑整理出来。

2.1 重绘幅度不是越大越好,它和采样步数存在联动

重绘幅度(Denoising Strength)是img2img最核心的滑块,但它从来不是孤立起作用的。它和采样步数(Sampling Steps)之间存在一个强耦合关系:去噪过程中的有效步数约等于总步数乘以重绘幅度。

举个例子,如果你设置总步数是30步、重绘幅度是0.5,那么模型实际进行去噪的步数只有15步左右;如果你的重绘幅度是1.0,那基本等于全步数去噪,接近文生图的完整过程。这带来一个很反直觉的结果:高重绘幅度情况下,你把采样步数设置很高意义不大,因为模型在这么多步中已经彻底摆脱原图的约束,纯粹按提示词重新生成;而低重绘幅度情况下,步数太高反而容易导致画面过度优化、产生不自然的塑料感。

我常用的组合是:

  • 轻度微调(0.2-0.3):步数20-25
  • 中度重绘(0.5-0.6):步数25-30
  • 大改构图(0.75-0.85):步数30-35

注意,不同采样器对步数敏感度不同。DPM++ 2M Karras这类采样器收敛速度很快,20步出图质量已经够用;但如果你用Euler或者Heun这一类,25步以下可能还能看到明显的噪点残留。所以实际调参时不要只盯着重绘幅度,要结合采样器特性一起试。

2.2 CFG Scale在img2img里的作用被"稀释"了

文生图时,CFG(提示词引导系数)控制的是生成结果遵循提示词的程度,通常设为7-9。但在img2img里,这个参数的作用会打折扣——因为除了提示词引导,原图本身也在"引导"模型,相当于有两个力量在拉扯最终结果。

实测下来,在img2img模式下CFG高到12以上,画面容易出现色彩过饱和、边缘过锐的"烧焦"现象。这主要是因为原图信息给模型提供了一个天然的"正确答案",提示词再施加高强度的引导,两个信号在潜空间打架,结果就是伪影和色块。更合理的逻辑是:重绘幅度越低,CFG反而可以适度降低(5-6已经够用);重绘幅度越高,CFG可以拉回7-9来强化提示词的约束力。

我自己比较习惯的思路是:把CFG当作fine-tune提示词影响力的旋钮,而不是让它在img2img里充当主角。主角永远是重绘幅度,CFG只是辅助微调提示词的作用力。

2.3 分辨率设置和重绘幅度的配合比你想象的更重要

做图生图时,很多人直接把原图传上去,然后保留默认分辨率设置,结果生成的图总是存在模糊或者结构变形的问题。原因在于Stable Diffusion对输入图像的尺寸是有"偏好"的——它训练时用的是512x512或者1024x1024这类整数宽高比。如果你传的是一张800x600或者 768x512和其他非标准比例的图片,模型在编码到潜空间时会做resize处理,导致构图被拉伸变形。

img2img面板里有个Resize mode选项,常见的有三种:

  • Just resize:直接把图拉伸到目标尺寸。适合构图简单、拉伸后不影响整体结构的图,但人物肖像用这个选项容易拉变形
  • Crop and resize:先把图等比缩放,然后居中裁剪到目标尺寸。适合保留主体,但对边缘内容有裁切
  • Resize and fill:等比缩放后用镜像填充补齐空白区域。适合原图比例和目标比例差距大、又不想牺牲内容完整性的场景

实战里面我最常用的是Crop and resize,因为大多数情况下我都只要主体内容,边缘被裁掉反而能去除干扰元素。而Resize and fill更适合做壁纸类、横幅类需要铺满画面的场景。

另外,一个非常容易被忽略的点是:重绘幅度较高时,建议先在低分辨率下测试构图,确认没问题后再用放大算法提升分辨率。直接在1024x1024下用高重绘幅度反复迭代,不仅速度慢,出现结构崩坏时排查起来也更麻烦。

3. 图生图的几种典型玩法:从线稿上色到写实照片转二次元

img2img真正强大的地方在于玩法多样性,同一个模式,搭配不同参数和准备工作,可以完成完全不同的任务。我挑几种我自己经常用的场景来讲,每种都有明确的参数方案和操作要点。

3.1 线稿上色与草图细化:白底线稿提色最快路径

很多画师和设计师会手绘线稿或草图,然后想快速看到上色后的效果。Stable Diffusion img2img基本秒掉传统手绘上色流程——你只需要一张干净的白底线稿,加一段描述配色和画风的提示词,三分钟内能出几十个配色方案。

操作流程是:

  • 准备一张线稿图,背景纯白,线条清晰
  • 提示词里写清楚"lineart, flat color, anime style"或具体画师风格词
  • 重绘幅度控制在0.5-0.65之间,太低颜色上不进去,太高线稿会被破坏
  • 开启ControlNet的Lineart模型(如果有条件),能极大程度保线稿结构

但如果你没有ControlNet也不着急,可以用内置的重绘幅度调参来硬做。关键是白底必须足够干净,因为Stable Diffusion会把白底也当成画面内容的一部分。如果底色偏灰或者有纸纹,生成结果里会出现大面积脏色。我常常先把线稿拖进PS里用阈值把底色处理成纯白,再进行图生图。前处理不做干净,后面怎么调参数都是白搭。

3.2 写实照片转二次元:最出效果但也最容易翻车的场景

"照片转动漫"应该是图生图里被玩得最多、也最容易产生惊艳效果的用途。核心目标是在保留照片人物神情和构图的基础上,把材质和渲染方式切换到二次元风格。

这个场景的参数我建议从以下起点开始调整:

  • 重绘幅度:0.5-0.6首测
  • 采样器:DPM++ 2M Karras
  • 步数:30
  • 提示词:anime style, detailed face, clean lineart, vibrant colors(加负面词:photorealistic, 3d render, blurry)

如果效果出来发现人物五官还是不够动漫化,就把重绘幅度往上调一点;如果出来了脸崩了或者五官结构不对,可能是原图本身太小。照片分辨率低于800x800的话,脸部细节信息不足,模型没有足够的像素去"理解"五官结构,重绘时容易放飞自我,生成一张似是而非的脸。

我个人的建议是:照片转二次元最理想的原图尺寸是1024x1024或更高。如果你手头只有低清小图,先做一步超分(比如用ESRGAN或者Stable Diffusion放大脚本把图片分辨率提到1024以上),再进img2img流程,出图干净程度会好很多。

3.3 粗糙3D渲染转高质量概念图:游戏原画师的偷懒神器

这个用法相对小众,主要是做游戏美术或概念设计的朋友在用。用Blender或SketchUp快速拉一个白模或粗糙渲染图,然后丢进img2img,配合风格提示词,能快速产出多张高质量的概念设计图用于方案汇报和方向探索。

这个场景的特点在于:原图本身结构比较简单、没有太多细节,所以重绘幅度可以开得比较高(0.65-0.75),让模型去"脑补"大量材质和光影细节。提示词则重点描述材质和氛围:"octane render, cinematic lighting, intricate details, high concept art quality"这一类型的词组合很关键。

操作上有个小技巧:把粗糙渲染图的背景统一成纯色(深灰或白色),可以减少模型在背景区域自由发挥时产生的杂乱元素干扰。我见过很多人在这个环节偷懒不处理背景,结果生成图里到处都是莫名其妙的漂浮物体。

4. 关键技巧:用ControlNet锁结构,用img2img填细节

如果你只靠重绘幅度去控制结果,会发现它的能力边界——想保留姿势却不要背景?很难。想保留背景色但替换物品?也很难。当你需要更精细地锁住原图中的某一部分信息,再对另一部分做重绘时,就该请出ControlNet了。

ControlNet不是img2img的"插件",而是一个独立的条件控制网络,它读取一张参考图的结构信息(可以是线稿、深度图、骨骼姿态、语义分割图等),把这个结构信息作为强条件输入到模型生成过程中。img2img配合ControlNet,等于把"模糊控制"升级成"精确控制"。

4.1 保留人物姿势:img2img + OpenPose是黄金组合

如果你通过图生图修改人物服装或背景,但不希望人物姿势有任何改变,纯靠低重绘幅度(0.3以下)虽然能做到,代价是画面其他部分的重绘空间也被压缩了,改不出效果。这时候开启ControlNet的OpenPose预处理,它会先自动检测原图中人物的骨骼关键点,把姿势信息提取出来,在生成过程中强制模型维持同样的姿势。

这样即使你把重绘幅度调到0.6以上,人物还是那个动作,但衣服、背景、画风都能大幅改变。我管这叫"单点锁死"——你只用这一张参考图控制住你最在意的那个变量,剩下的事情全交给提示词和重绘幅度去发挥。

4.2 锁构图:Canny图生图适合建筑和场景设计

Canny边缘检测会把图片里所有物体的轮廓线提取出来,然后作为控制条件强制生成结果遵循这些轮廓线。在建筑改色、工业设计、场景重构这类对空间结构要求高的任务里特别好用。

具体做法:原图丢进ControlNet,预处理器选Canny,然后调整Canny的最低阈值和最高阈值——通常保持默认即可,但如果想要保留更多细节轮廓可以把阈值调低、想要更概括的轮廓就调高阈值,看预处理预览图确定自己需要的轮廓密度,再决定阈值。重绘幅度可以放心拉到0.7左右,模型会沿着轮廓线"填充"新的材质和光影,但建筑的结构比例基本不跑偏。

4.3 不要忽视Depth和MLSD在特定场景的作用

Depth(深度图)适合需要保持空间层次关系的场景,人像摄影、产品拍摄这类对前后景关系有要求的任务特别适合。MLSD则适合室内设计和建筑制图,它提取直线信息,对透视感较强的图像有很好的结构约束。

这里我想强调一个容易踩的坑:ControlNet控制力越强,画面的"自由度"就越低,容易让生成结果呆板、没灵气。实际使用中不要所有图都启用ControlNet,当你希望模型在构图基本正确的前提下来一点"意外之喜"时,关掉ControlNet,只靠img2img的重绘幅度反而能激发更多创意可能。

5. 不同底模在img2img上的表现差异与选择逻辑

不少人问我:同样一张图,同样的参数,为什么用不同模型出来的效果天差地别?确实如此——img2img对模型风格的耦合程度远高于文生图。因为原图提供的信息占很大权重,模型自身的"艺术风格"会和原图内容产生化学反应,不同模型对这些信息的理解和重构方式不一样,最终呈现的效果自然不同。

如果你用的是像秋叶整合包这类集成了多个模型包的本地环境,在SD1.5、SDXL甚至更新架构的模型之间切换,你会明显感受到同样的图生图参数在不同模型上输出的风格差异巨大。

5.1 SD1.5系模型:细节宽容度高、上手难度低

SD1.5系列的社区底模数量巨大,风格覆盖极其广泛。对img2img来说,SD1.5模型最大的优点是它们训练时的基座分辨率是512x512,细节识别粒度比较小,所以对低分辨率原图(比如网络上的小尺寸图片)有更好的"容错"能力。

如果你拿一张模糊的、噪点较多的参考图去做图生图,SD1.5模型还能勉强处理出一个相对干净的结果。但到了SDXL时代,模型默认分辨率建议在1024x1024左右,低清原图压根不够模型去理解细节,直接出图很容易崩脸或出现奇怪的纹理。

5.2 SDXL系模型:质感更强但重绘幅度窗口更窄

SDXL模型的图生图能力非常强,尤其在材质表达、光影层次和语义理解方面比SD1.5高出一个档次。但它的代价就是——对原图质量和重绘幅度更敏感。

我自己用SDXL做img2img的体会是,重绘幅度超过0.65之后,画面很容易进入"过拟合"状态——模型突然开始不讲结构,直接在原有的基础上画出大量语义重复的元素,比如脸上叠出三只眼睛,或者衣服纹路突然变成了一堆乱码。相比之下,SD1.5系列在0.7-0.8的重绘幅度下还能保持一定的合理性。

所以如果你用的是SDXL系模型,建议把重绘幅度控制在0.55以下做微调,0.6-0.65之间做中度修改,超过0.7就要做好反复跑多批次的心理准备。而SD1.5则有更大的自由度,重绘幅度0.7是一个比较从容的起点。

5.3 特化模型:实现风格迁移的捷径

社区里有很多专攻特定风格的模型,比如专画赛博朋克、水墨风、厚涂、水彩的checkpoint。这些模型在img2img里能发挥"风格覆盖"作用——即使原图是写实照片,用特化模型搭配较高重绘幅度(0.6-0.75),也能比较自然地把照片风格"迁移"成特定画风。

越特化的模型,图生图风格迁移越明显,但同时它对原图内容的"解释权"也越大,生成结果可能和你想保留的内容有偏离。我在这个环节的建议是:先用通用模型把构图调稳定,确定主体内容满意后,再切换到特化模型做最终的风格重绘。中间过程不要直接上特化模型,不然后面要花大量时间清理模型自己脑补出来的奇怪元素。

6. 实战中经常翻车的几种情况与排查链路

图生图模式用久了,你一定会碰到各种奇奇怪怪的出图事故。这部分我总结几种高频翻车场景,并给出完整的排查思路,帮助你快速定位问题根源。我个人建议不要急着改参数,先搞清楚是哪个环节出了岔子。

6.1 重绘之后人物脸崩了:先检查原图结构信息

如果说图生图翻车第一名,脸崩绝对当之无愧。现象是:原图里一张清晰端正的脸,重绘之后要么五官变形、要么左右不对称、要么出现"恐怖谷"效果。很多人第一反应是降低重绘幅度,但这往往治标不治本。

排查链路如下:

  • 第一步:确认原图分辨率是否足够高。如果人脸区域低于256x256像素,模型根本提取不到足够的五官细节,重绘时自然会脑补出畸形的脸。对策是先做超分放大或裁剪人脸区域单独重绘。
  • 第二步:确认是否开启了面部修复(face restoration)功能。有些整合包里默认开启ADetailer或Face Detailer,在低重绘幅度下这些修复插件有时反而会和img2img的生成过程产生冲突,导致脸越修越怪。
  • 第三步:检查负面提示词里是否包含"ugly, deformed face"等基础负面词。不少新手会把负面词写得很随意,恰恰漏掉了最该屏蔽的face-related项。

如果以上都排查过,问题依旧,那就试一下把重绘幅度降低到0.35以下,并在局部重绘时圈定脸部区域,只对脸部做精细修改。很多时候,全图重绘和局部重绘的脸部表现差异是巨大的。

6.2 画面发灰、颜色脏:大概率是CFG和重绘幅度失衡

图生图结果发灰、颜色浑浊的问题,尤其是在照片转手绘、照片转动漫时最常出现。核心原因是原图的色彩分布破坏了模型生成时对色彩纯度的偏好。

我的排查步骤:

  • 先看CFG Scale是不是太高。CFG在img2img里超过10,色彩饱和度和明暗对比容易失真,俗称"烧色",看起来就是颜色发脏。把CFG降到6-7观察一下。
  • 再检查重绘幅度。中等重绘幅度(0.4-0.55)最容易出现"不上不下"的脏色阶段——原图信息还在,模型的色彩重建还没完全接管,两个色彩体系在画面上重叠。要么降低到0.3以内做微小变化,要么提高到0.65以上让模型完全接管色彩重建。
  • 确认采样器类型。Euler a和DPM++ SDE这类随机性较强的采样器在img2img中更容易产生色彩噪声,如果画面中有明显的彩点点缀,改回DPM++ 2M Karras会干净很多。

6.3 重绘出来的物体数量增多或减少:语义扰动问题

这个翻车场景很奇特:原图里有一个人,重绘之后变成了两个人;原图里有三棵树,重绘之后变成了一整片森林。这是模型在去噪过程中受到提示词语义和原图结构之间互相矛盾导致的"语义扰动"。

例如你给一张单人照片,提示词里写了"group of people"或"crowd",模型会尝试在原图构图基础上塞入更多的人,结果就是人物数量失控。反过来,如果原图里有明确的两只猫,提示词里只写了"cat"而没限定数量,模型可能把其中一只抹掉。

处理办法:

  • 提示词里用数量限定词,比如"one person","two cats",减少语义歧义
  • 降低重绘幅度到0.4以下,保留原图的内容数量信息
  • 如果开启ControlNet,用语义分割(Segmentation)或者Depth控制数数量信息

这个问题本质上是模型对"数量"这个概念理解力不够稳定,比它对"颜色""材质"的理解弱不少。知道这个机理后,其实只要在提示词层面做约束,大部分翻车都可以规避。

7. 进阶玩法:局部重绘(Inpaint)和图生图如何搭配使用

很多人在图生图里遇到的最大痛苦就是"牵一发而动全身"——我只是想改个背景,结果整个人物也跟着变了。这时候局部重绘(Inpaint)功能就是最终的解决方案。它本质上不是独立于img2img的模式,而是在img2img框架里增加了一个蒙版,让你只对选中区域做重绘,未选中区域保持原样。

注意:局部重绘和整体重绘的思维方式完全不同。整体重绘时你操心的是"我要改动多大程度",局部重绘时你操心的是"我要把重绘区域限定得多准确"。

7.1 ControlNet的Inpaint模型 vs 内置局部重绘功能

现在常用的局部重绘有两种方式:一是Stable Diffusion WebUI自带的"Inpaint"功能,直接在原图上用蒙版笔刷涂出要修改的区域;二是ControlNet的Inpaint模型,它把蒙版作为条件控制信息送入模型。

两者的核心区别在于:ControlNet方式能更好地理解蒙版边界,在蒙版边缘的处理上更加自然,不会出现明显的"贴纸感"。内置功能则更适合快速试效果,尤其在蒙版区域比较规整时效率更高。

我的使用习惯是:粗略修改用内置Inpaint,追求精修效果切换ControlNet Inpaint+局部重绘+低重绘幅度的组合。每次需要改动画面某个细节,但不想改变整体氛围时,这个组合可以帮你省下大量反复重roll的时间。

7.2 局部重绘的蒙版边缘优化:这决定你的修改是否"隐形"

很多人在局部重绘时忽略了一个关键参数:蒙版边缘的羽化(Mask Blur)。默认值通常是4-8像素,但它对最终效果影响巨大。

如果蒙版边缘羽化值太小,模型在蒙版内外之间的过渡会很生硬,重绘区域和保留区域之间会产生明显的接缝。如果羽化值太大,重绘影响会渗透到不想改变的区域,造成不必要的扰动。

我的经验参数:原图1024x1024的情况下,Mask Blur设置为12-20像素比较稳妥。如果原图边缘特征比较复杂(比如头发丝、树叶边缘),建议把Mask Blur再调高一些,让模型有更大的自由度去融合边缘。但注意,羽化过大也会让蒙版区域的边界偏移,生成结果可能不只是你要改的那部分。

另外,局部重绘时有个容易被忽略的选项:蒙版模式(Mask Mode),分为"重绘蒙版内容"和"重绘非蒙版内容"。前者是你涂哪里改哪里,后者是除了你涂的地方之外全部重绘——后者最适合用来保留画面中某个核心物体,然后把背景整个换掉的场景。

7.3 多次局部重绘的组合使用:复杂改图的正确姿势

工作中我经常遇到的需求是:一张图既要换掉背景,又要改人物的衣服,还要调整画面的色调。这种多目标修改如果一次性完成,模型很容易在相互矛盾的指令之间失去方向,最后哪个目标都没做好。

正确的做法是分阶段执行:第一步先用局部重绘,把背景区域蒙版选中,用较高的重绘幅度(0.7左右)配合背景描述的提示词单独重绘背景;第二步再对人物服装区域做蒙版,开启局部重绘,此时重绘幅度降低到0.5左右,只重绘服装细节;第三步做整体色调和画风统一,用较低的重绘幅度(0.35-0.4)全图跑一遍。

这种层层递进的方式能让每一步的目标都比较单一,模型在每个环节需要处理的变量少,输出稳定度自然高很多。这个方法论,其实就是把一个复杂的图像编辑任务分解成多个可控的小任务——和软件开发里模块化设计的思路如出一辙。

8. 图生图实操流程复盘:整理一套人人可用的完整工作流

前面讲了很多原理、技巧和参数,最后我把这套经验浓缩成一套可以直接上手执行的完整工作流,方便你下次打开图生图界面时,不用一脸茫然不知道从哪里下手。这套流程是我平时开工时的基准,涵盖了从准备到输出管理的完整链路。

准备阶段:

  • 定目标:想清楚这次图生图是要改风格、改元素、还是修细节。目标不同,参数起点完全不同
  • 修底图:确保底图分辨率不低于768,结构清晰、背景尽量干净。有需要就先用PS或其他工具做裁剪、超分处理
  • 选底模:根据目标风格选择合适的checkpoint模型。风格定向的修改优先切换特化模型,内容保真优先用通用模型

参数设置阶段:

  • 重绘幅度:从0.5开始试验,根据效果上下调节
  • 采样器:DPM++ 2M Karras作为默认,追求细节用DDIM
  • 步数:30步左右,不要过多
  • CFG Scale:控制6.5-7.5之间,按提示词复杂度微调
  • 分辨率:与被处理图尺寸匹配,避免模型resize导致的拉伸变形

执行与迭代阶段:

  • 第一轮:用较低重绘幅度(0.4-0.5)跑4-6张,主要看构图和内容保真度
  • 第二轮:从中挑出构图满意的图,提高重绘幅度(0.6-0.65),增加风格提示词强度,跑4-6张看风格表现
  • 第三轮:锁定一张最满意的,局部重绘修细节,或配合ControlNet进一步锁定结构

输出阶段:

  • 高清放大:用Hires.Fix或Ultimate SD Upscale把最终结果放大到目标分辨率
  • 后期处理:导出后用PS或Lightroom微调色彩、对比度,去除少量瑕疵。不要追求完全脱离后期的一步到位,熟练的AI绘画用户都会把一部分工作放到后期解决

这套流程唯一的目的就是减少不必要的"盲猜"——每一步都有一个明确的判断依据和决策路径,而不是把参数乱拖一通然后拼命刷批次。

9. 我的几点心得与偏好

最后聊一些偏个人的经验和偏好。虽然AI绘画工具迭代飞快,但很多底层的使用思路是不太会变的。

其一,关于趋势的体感:早期大家做图生图,重度依赖重绘幅度滑块;现在ControlNet铺开之后,大家追求的是"先锁定结构,再用提示词和专用模型驱动风格"。从结果来看,这种做法的稳定性和可复现度高太多了。所以我建议新手朋友不要太早陷入"调参玄学"的泥潭,先把ControlNet的几种基本用法吃透,再回头玩纯img2img参数,会觉得豁然开朗。

其二,关于秋叶整合包这类本地环境:很多人安装完就急着跑图,其实值得花点时间研究一下插件管理面板。图生图的体验和预处理器、ControlNet模型的安装完整性强相关,缺一个模型文件都会导致功能不可用或报错。如果你发现图生图和教程里表现不一致,优先检查环境里的模型和插件版本,而不是怀疑自己的参数有问题。

其三,真正好看且有灵性的结果,很少是"一次成型"的。我过去复盘过自己比较满意的作品,绝大多数都经过了至少三轮以上的迭代——第一轮定构图,第二轮调风格,第三轮抠细节,期间还需要回到PS做局部修改再重新喂进去。AI绘画最忌讳的心态就是一锤子买卖,图生图给了你极高的迭代效率,那就应该最大限度利用这种"反馈-修正"的循环去逼近理想画面。这个思路反过来也会让你对参数逻辑的理解越来越深,很快就摆脱对着教程一步步照做的阶段了。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询