☰
AI巨人国视频制作全流程:从Stable Diffusion生成到AE合成实战
2026/9/30 2:14:58 网站建设 项目流程

1. 先搞清楚“AI大人国”视频到底在做什么

如果你在短视频平台刷到过“误入巨人国”这类标签的视频,可能会好奇它们是怎么做出来的,以及自己能不能也做出类似的效果。这类视频通常被称为“AI大人国”或“巨人国”视频,核心玩法是利用AI技术,将普通尺寸的物体或人物,无缝嵌入到一个由AI生成的、充满巨大化日常物品的幻想场景中,从而营造出一种“小人误入巨人世界”的错位感和新奇感。

它解决的其实是一个很具体的创意需求:如何低成本、高效率地制作出具有强烈视觉冲击力和叙事感的超现实场景。传统的3D建模或影视特效门槛太高,而这类AI视频工具的出现,让普通人用几张图片和一段描述,就能快速生成一段沉浸式的视觉内容。它特别适合短视频创作者、内容营销人员、或者单纯想玩点新花样的视觉爱好者。

最值得关注的点,不是“AI很强大”这个泛泛而谈的概念,而是它如何把“创意描述”和“视觉元素”精准地结合并稳定输出。很多人尝试后会发现,生成结果经常“货不对板”——要么巨人国的环境不够震撼,要么小人放进去显得很假。所以,这篇文章不会只告诉你“用某个工具”,而是会拆解从创意到成片的完整流程,重点放在如何控制AI,让它听懂你的“巨人国”到底应该长什么样。

2. 制作前的核心准备:明确你的“巨人国”设定

动手之前,最忌讳的就是直接打开工具开始“盲试”。AI生成非常依赖清晰、具体的指令。你需要先花几分钟,像导演一样构思你的场景。

2.1 定义“巨人”的尺度与风格

“巨人国”是一个宽泛的概念。你需要把它具体化:

  • 尺度感:是微缩模型般的“手办世界”,还是史诗般的“山峰即桌椅”?这决定了你后续拍摄主体物(小人)的大小和透视关系。
  • 风格:是温馨的木质玩具屋风格,还是冰冷的钢铁工业风?是茂密的森林秘境,还是未来感的巨型都市?风格直接影响你给AI的提示词(Prompt)。
  • 时代背景:现代、复古、科幻还是奇幻?背景元素(如灯具、书本、工具)的风格要统一。

我的经验是:先找参考图。去Pinterest、Behance甚至电影截图里,搜索“giant everyday objects”、“forced perspective miniature”等关键词,收集3-5张最能代表你想要的氛围的图片。这比空想有效十倍。

2.2 准备你的“小人”素材

“小人”是画面的视觉焦点和故事载体。素材质量直接决定最终效果的可信度。

  • 拍摄要点:
    • 纯色背景:最好在绿色幕布或纯白、纯黑背景下拍摄,便于后期抠像。如果条件有限,至少确保背景干净、简单,与主体对比强烈。
    • 光线匹配:想象你的“小人”在巨人国环境中的光照方向(例如,窗外来的侧光),尽量在拍摄时模拟类似的光线,这样合成后光影会更真实。
    • 动作与表情:既然是“误入”,惊讶、好奇、探索、小心翼翼的表情和动作会比僵硬的站立更有故事感。
  • 素材格式:高清图片(PNG格式为佳)或一段短视频(MOV, MP4)。如果是视频,确保主体动作幅度不要太大,以免增加AI跟踪和合成的难度。

2.3 选择你的技术路线

目前主要有两种实现路径,适合不同需求和技能水平的人。

路径核心工具举例优点缺点适合人群
一站式AI视频生成如Pika、Runway Gen-2、Sora(待开放)等流程简单,输入文字或图片+文字,直接生成动态视频。创意实现快。对画面细节和主体控制力较弱,容易“跑偏”;生成时长有限;可能需付费。想快速体验、对画面精度要求不高、追求创意效率的创作者。
AI绘图+传统合成如Stable Diffusion(SD)生成背景 + After Effects(AE)/达芬奇合成控制精度高,画面质量上限高;背景可反复修改直至满意;合成技巧通用性强。流程繁琐,需要学习多个软件;对硬件(尤其是GPU)有一定要求;耗时较长。对画面有较高要求、愿意深入钻研、希望掌握全流程的视觉创作者。

对于绝大多数想认真做出好效果的初学者,我强烈建议从第二条路(AI绘图+传统合成)开始。虽然步骤多,但每一步你都有完全的控制权,理解原理后,举一反三的能力会强很多。下文也将主要围绕这条路径展开。

3. 实战流程:从无到有构建你的巨人国短片

我们假设一个最经典的场景:一个探险者,手持提灯,走入一个由巨大书籍、墨水瓶和羽毛笔构成的巨人书房。

3.1 第一步:用AI绘制静态背景图

这里以Stable Diffusion WebUI(开源,本地部署)为例。

  1. 启动SD:确保你的SD环境已经配置好,拥有一个写实风格的大模型(如Realistic Vision、ChilloutMix的变体)。
  2. 构思提示词(Prompt):这是成败的关键。不要写“一个巨人房间”,要写细节。
    • 正面提示词:giant library interior, enormous vintage books stacked as walls, giant ink bottle as a tower, colossal feather pen leaning against a book, wooden texture, dim lighting from a window, dust particles in the air, photorealistic, hyperdetailed, 8k, dramatic lighting, cinematic
    • 反面提示词:blurry, deformed, ugly, small furniture, normal sized objects, bad proportions, cartoon, painting
  3. 设置参数:
    • 采样方法:DPM++ 2M Karras 或 Euler a(适合快速测试)。
    • 分辨率:至少 1024x576(16:9视频比例),如果想做高清视频,可以生成2048x1152的大图,后期裁剪。
    • 生成数量:先生成4-8张,挑选最符合构图和光影感觉的一张。
  4. 利用ControlNet精控构图(进阶):如果你对构图有明确想法(比如一定要一条由书铺成的小路),可以:
    • 在纸上画个简单的草图,拍照。
    • 在ControlNet单元中上传草图,启用Canny(边缘检测)或Scribble(涂鸦)预处理器。
    • 这样SD生成的背景就会大致遵循你的草图布局,成功率更高。

关键点:不要指望一次生成完美背景。通常需要生成多轮,调整提示词(例如增加“looking down angle”来获得俯视视角),直到得到一张在透视、光影、物体尺度感上都让你满意的图。

3.2 第二步:处理你的“小人”素材

  1. 抠像:使用剪映、Premiere、After Effects或专门的抠图软件(如Topaz Mask AI),将拍摄的“探险者”从背景中干净地抠出来,导出为带透明通道的PNG序列(如果是图片)或带Alpha通道的视频(如ProRes 4444格式)。
  2. 调色与光影匹配:观察你生成的巨人国背景图的光源方向(比如光从右侧窗户来)。在合成软件里,给你的“小人”图层添加:
    • 亮度/对比度:调整以匹配背景的整体影调。
    • 颜色平衡:让“小人”的肤色和衣物颜色融入环境色。
    • 投影:在“小人”脚下或背光侧添加一个柔和的、方向一致的投影。这是增加真实感最廉价有效的方法。

3.3 第三步:在合成软件中进行整合

以Adobe After Effects为例。

  1. 导入素材:将背景图和小人(序列帧或视频)导入AE。
  2. 搭建场景:
    • 背景图作为底层。
    • 小人图层放在上方。使用位置(P)、缩放(S)、旋转(R)属性,将小人放到合适的位置,比如“书籍小路”的起点。缩放是关键,要把小人缩放到看起来只有几厘米高。
    • 添加环境互动:为了让小人更融入,可以:
      • 在小人脚边用遮罩画一点淡淡的“灰尘”粒子,模拟走动时扬起的微尘。
      • 如果背景有景深模糊(虚化),可以对小人图层添加相机镜头模糊效果,并根据所处位置调整模糊度。
  3. 运镜与动画:
    • 如果背景是静态图,可以通过给背景图层做缓慢的缩放和平移,模拟摄像机缓慢推进或摇移的效果,增加动态感。
    • 给小人的位置属性做关键帧动画,让他从画面一侧走入,停在某个巨型物品前抬头张望。
    • 技巧:在背景图层上使用动态拼贴效果,可以让你在平移背景时不会露出黑边。

3.4 第四步:添加氛围与音效

视觉合成完成后,氛围塑造就靠后期了。

  1. 调色:使用Lumetri Color或插件,统一整个片子的色调。巨人国可以偏向暖黄(烛光)或冷蓝(月光)。
  2. 添加特效:
    • 光线:用镜头光晕或Light插件,模拟从巨型窗户射入的光柱。
    • 粒子:添加微小的灰尘或光斑粒子漂浮在空气中。
  3. 音效设计(ASMR/解压的关键):
    • 环境音:巨大的空间回声、遥远的钟摆声、低沉的通风声。
    • 动作音:小人轻微的脚步声、布料摩擦声、呼吸声。
    • 互动音:当小人触碰书本时,厚重的纸张摩擦声被极度放大、放缓。
    • 背景音乐:选择空灵、舒缓、带有一点神秘感的纯音乐。
    • 工具:可以在Epidemic Sound、Artlist等网站寻找音效,或用Adobe Audition进行混音。

4. 避坑指南:为什么你的“巨人国”看起来假?

很多人在尝试后,作品总感觉哪里不对。问题通常出在以下几个细节上,按照这个顺序排查,能解决80%的问题。

4.1 透视关系错乱

这是最致命也最常见的问题。AI生成的背景透视,和你放置的小人透视不匹配。

  • 现象:小人像是贴在背景上的贴纸,没有站在“地面”上。
  • 解决方法:
    1. 在生成背景时,在提示词中强烈指定视角,如“low angle view looking up”(仰视)、“high angle view looking down”(俯视)、“eye level view”(平视)。这决定了背景的消失点。
    2. 在AE中,可以尝试使用3D图层功能。将背景和小人图层都转为3D图层,为他们创建一个虚拟摄像机。通过调整摄像机角度和小人的3D位置,能更精细地对齐透视。但这需要一点学习成本。
    3. 最实用的土办法:寻找背景中明确的“地面”参考线(如地板缝隙、地毯边缘)。确保小人的脚底与这些参考线接触,并且小人的视线方向与背景的透视延伸线大致相符。

4.2 光影不融合

抠出来的小人自带原始拍摄环境的光照,与巨人国背景的光照方向、强度、色温完全不同。

  • 现象:小人看起来像个发光体,或者阴影方向诡异。
  • 解决方法:
    1. 前期匹配:拍摄小人时,尽量用台灯等单一光源模拟方向光。
    2. 后期重塑:在AE中,使用效果-过时-CC Light Sweep或Red Giant的Knoll Light Factory等插件,在小人身上“画”上符合背景方向的高光和阴影。同时,务必用曲线或色相/饱和度工具,让小人整体的明暗和颜色倾向靠近背景的阴影区/高光区。

4.3 尺度感缺失

物体只是被放大,但没有体现出“巨大”的质感。

  • 现象:巨大的书本却没有纸张的纹理和厚度,巨大的木桌却没有木材的粗糙肌理。
  • 解决方法:
    1. 提示词加持:在生成背景时,加入描述质感和细节的词,如“macro texture of paper fibers”, “weathered wood grain”, “dusty surface”, “chipping paint”。
    2. 后期叠加:在合成软件中,可以为背景的特定物体(如书本封面)单独叠加一层高清的材质纹理图片(设置混合模式为叠加或柔光),并添加轻微的锐化效果,强化细节。

4.4 运动不协调

当背景或小人运动时,感觉不像在同一个物理空间。

  • 现象:摄像机移动时,小人和背景的相对位置或速度感不对。
  • 解决方法:
    1. 运动模糊:如果小人在快速走动或镜头在快速移动,为小人图层添加像素运动模糊。
    2. 视差滚动:当摄像机横向移动时,前景(小人)的移动速度应该比背景快。可以通过给背景和小人设置不同的移动速度关键帧来模拟。
    3. 稳定跟踪:如果背景是实拍且有轻微晃动,可以使用AE的变形稳定器先稳定背景,再把小人的运动跟踪到稳定后的背景上。

5. 从单张图到动态视频的进阶思路

掌握了静态合成,动态视频就是水到渠成。核心思路是:让AI生成一段连贯的背景视频,或者让多张静态背景图动起来。

5.1 方案A:使用AI视频生成工具生成动态背景

这是目前更前沿但可控性稍差的方法。

  1. 工具选择:Runway Gen-2, Pika, Stable Video Diffusion。
  2. 操作流程:
    • 将你在3.1步生成的最满意的单张巨人国背景图,导入到Runway或Pika。
    • 输入运动提示词,如:“slow panning from left to right, revealing more of the giant library, dust particles floating slowly”(缓慢从左向右平移,展示更多巨人图书馆,灰尘缓慢漂浮)。
    • 生成一段3-5秒的动态背景视频。
    • 将这段视频导入AE,作为新背景,然后重复3.2-3.4步,将你的小人合成进去。
  3. 挑战:AI生成的动态视频可能在连续性、稳定性上出现问题(画面闪烁、物体变形)。通常需要生成多次,选取最稳定的一段,或者只使用其中运动平滑的几帧。

5.2 方案B:静态图序列+摄像机动画(推荐)

这是更稳定、更可控的方案,适合制作短视频。

  1. 生成关联图像:在SD中,使用同一组提示词和种子(Seed),通过微调提示词或使用Dynamic Prompts插件,生成一系列视角缓慢变化的背景图。例如:
    • 图1:正面视角。
    • 图2:提示词加“slightly turned to the right”。
    • 图3:提示词加“turned more to the right, showing a giant cup on the table”。
  2. 创建序列动画:在AE中,将这些图片按顺序导入,排列在时间线上,每张图片持续几帧。然后给整个图片序列添加动态拼贴和时间重映射效果,并做缓慢的平移、缩放动画,就能得到一段平滑的动态背景。这种方法虽然需要多生成几张图,但画面质量稳定,完全由你掌控。

5.3 方案C:3D化处理(高阶)

对于追求极致效果的用户,可以将AI生成的背景图作为贴图。

  1. 在Blender等3D软件中,创建一个简单的几何体(如一个房间的立方体)。
  2. 将你的巨人国背景图作为贴图,投射到几何体内部。
  3. 在3D场景中放置一个低面数的“小人”模型,或直接导入你抠像后的人物视频(作为面片)。
  4. 在3D空间里设置摄像机和灯光,进行渲染。这种方法能获得最真实的透视和光影互动,但技术门槛最高。

最后给想尝试的朋友一个忠告:不要一开始就追求复杂的运镜和长视频。从一张静态图、一个固定镜头、一个小人的简单动画开始,把透视、光影、合成这几个基本功练扎实。成功做出一个10秒的、看起来不假的小片段,远比折腾一个处处穿帮的长视频更有成就感,也更能让你理解这个创作流程的精髓。当你掌握了这个“AI绘图+专业合成”的流程,你获得的将不仅仅是制作“巨人国”视频的能力,而是一套应对各类超现实视觉合成需求的通用方法论。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询