1. 为什么给宠物饮水机做 AI 分镜脚本
1.1 传统宠物广告拍摄的痛点
先把话说在前面:我这次接到的项目,是给一款宠物饮水机做一条 15 秒的电商短视频。刚拿到需求时,团队第一反应是找摄影师、租场地、请一只性格稳定的猫和一只狗来配合。结果预算一报上去,老板直接沉默了。
传统宠物用品广告拍摄,最大的问题就是“不可控”。猫不会听你指挥,狗看到镜头要么太兴奋要么躲着走,真正能用的素材可能只有十分之一。然后是“水”这个元素,饮水机要表现活水循环、水花晶莹、水泵静音,这些在实拍里全都要靠高速摄影、补光、道具水、后期合成才能勉强达到。租一台像样的高速摄影机,一天下来够买三台饮水机了。
后来我们决定走 AI 视频生成路线。先写一份足够细的《寵物飲水機AI分鏡腳本》,用分镜脚本去驱动各个 AI 工具出图、出视频,最后剪成成片。整个过程不需要真实宠物出镜,不需要控制水花,也不用担心猫咪突然跑路。实测下来,从脚本到第一条完整成片,只用了两天时间。
1.2 AI 分镜脚本到底在写什么
很多人一听“AI 分镜脚本”,以为就是把原来的拍摄脚本改个名字。其实不是。传统分镜脚本是写给摄影师和演员看的,而 AI 分镜脚本是写给大模型和视频生成模型看的。这两者的阅读对象完全不同,写法自然也不一样。
传统分镜只需要写“猫咪走近饮水机,低头喝水”,摄影师能看懂就行,他会自己去想机位、构图、光线。AI 视频模型没有这个能力,它需要你把画面里的主体、景别、动作、镜头运动、光影、氛围全部用提示词描述清楚,而且描述越具体,生成结果越可控。
所以这份脚本的真正核心,不是“分镜”,而是“每个镜头要喂给 AI 什么”。我把脚本做成了两层结构:第一层是人类可读的画面描述,第二层是机器可读的 AI 提示词。两组人——导演和模型——都能看懂同一份文档。这也是我这次项目里最想分享的一个经验。
1.3 谁适合参考这份脚本
如果你手上有宠物用品、小家电、快消品要做短视频内容,或者你本身就是做 AI 视频的创作者、电商运营、自媒体博主,那这份脚本可以直接抄作业。哪怕你完全没做过 AI 视频,只要会打字,按照我给的分镜表格一个个生成再拼起来,也能做出一条像样的成品。
当然,如果你的目标是拍一条真正的商业广告大片,有预算请专业团队,那 AI 分镜脚本就退化成“预览片”的作用——先用它跑通镜头语言和节奏,再拿去给实拍团队做参考。这本身也是省钱省时间的好办法。
2. 分镜脚本的整体设计思路
2.1 先定产品卖点,再定镜头
写分镜脚本之前,我先翻了这个宠物饮水机的产品详情页,把卖点全部列出来:活水循环、四层过滤、超静音水泵、2.5L 大容量、缺水断电保护、易拆卸清洗。如果把这些卖点全部塞进 15 秒里,结果是每个点都讲不透,观众什么都记不住。
所以第一件事是做减法。15 秒短视频适合讲三个以内的核心卖点,我把“活水循环”“超静音”“大容量”定为三条主线。剩下的过滤、断电保护、易清洗,全部放进 30 秒升级版或者详情页里补充。这样镜头叙事更干净,观众看完能记住最关键的三点。
这里有个小技巧:给每个卖点分配一个情绪词。活水循环对应“新鲜”,超静音对应“安心”,大容量对应“省心”。后面写提示词的时候,情绪词会直接影响画面氛围——表达“新鲜”就用明亮通透的光线和清澈的水花,表达“安心”就用暖色调和安静的夜晚场景,表达“省心”就用干净利落的家中环境。
2.2 15 秒版本怎么切分节奏
短视频的黄金节奏是 0-3 秒抓注意力,3-10 秒讲内容,10-15 秒促行动。我按照这个节奏把 15 秒分成了四段:
- 第一段(0-3s):抛出痛点,猫对空碗发呆,制造代入感;
- 第二段(3-10s):产品亮相,宠物喝水的健康画面,集中展示卖点;
- 第三段(10-13s):夜间静音场景,强化“深夜不打搅”的安心感;
- 第四段(13-15s):产品包装和 logo 露出,点明品牌名,引导购买。
四段对应八个镜头,每个镜头大约 2 秒。AI 视频生成工具单次生成往往只有 3-5 秒,所以一个镜头让它生成一段 3 秒素材,再在剪辑时截取其中最稳定的 2 秒,这样容错率最高。
2.3 角色一致性:宠物形象怎么统一
AI 视频最大的翻车点不是画面不好看,而是同一只猫在这个镜头长这样,下个镜头就变成另一只猫了。我这次脚本里要用到一只橘猫和一只柯基,跨 8 个镜头必须长得一样,不然观众一眼出戏。
我的方案是“角色参考图 + 首帧锁定”。先用 AI 绘图工具各生成一批橘猫和柯基的标准形象图,挑出最满意的一张作为角色基准图。后续每个镜头生成视频时,都把这张角色图作为参考图输入,或者用图生视频的方式,先把角色图变成该镜头的第一帧,再延展成动态视频。
这样操作下来,只要角色基准图不换,同一个镜头系列里生成出来的宠物,长相基本能保持在 90% 以上的相似度。至于剩下那 10% 的偏差,靠剪辑节奏快一点就能盖过去,观众根本来不及细看。
3. 逐镜分镜脚本与 AI 提示词实战
3.1 15 秒版分镜总览表
直接给可复制的表格。下面这张表是全片的总览,列了镜号、时长、画面内容、景别、旁白字幕和对应卖点。提示词的完整写法在下一小节逐个拆解。
| 镜号 | 时长 | 画面内容 | 景别与运镜 | 旁白/字幕 | 对应卖点 |
|---|---|---|---|---|---|
| 1 | 0-2s | 橘猫盯着空水碗,爪子拨碗 | 特写,固定镜头 | 字幕:还在喝这碗水? | 痛点引入 |
| 2 | 2-4s | 白色饮水机亮相,涌泉出水 | 中景,缓慢推进 | 旁白:活水循环 | 活水 |
| 3 | 4-6s | 柯基小跑过来低头喝水 | 中景,跟拍感 | 旁白:每一口都新鲜 | 活水 |
| 4 | 6-8s | 橘猫跳到桌面,靠近饮水机喝水 | 中景,固定镜头 | 无旁白,环境声 | 产品吸引力 |
| 5 | 8-10s | 水流与滤芯特写,水珠晶莹 | 微距特写,缓慢推近 | 旁白:四层过滤 | 过滤 |
| 6 | 10-12s | 夜间场景,饮水机指示灯亮,猫狗安静 | 远景,固定镜头 | 旁白:超静音运行 | 静音 |
| 7 | 12-14s | 猫狗一起喝水,主人在旁微笑 | 中景,横移镜头 | 字幕:2.5L 大容量 | 容量 |
| 8 | 14-15s | 产品包装与 logo 展示 | 商品展示,固定镜头 | 旁白:让毛孩子爱上喝水 | 品牌 |
八个镜头总共 15 秒,前后两个镜头没有宠物出镜,中间六个镜头全靠角色基准图锁定形象,整体工作量可控。
3.2 每个镜头的提示词写法拆解
光有表格还不够,每个镜头要真正能喂给 AI 工具,还得有完整的提示词。这里我按镜号给出我当时实际使用的提示词,并说明为什么这么写。
镜头 1:痛点引入
画面要求:一只橘猫坐在木地板上,面前是空的白色水碗,猫咪用爪子轻轻拨动碗沿,碗发出细微的金属声响,猫咪表情带一点困惑和渴望。光线是自然日光,浅景深,背景是简洁的客厅。
对应 AI 提示词:
一只肥胖的橘猫坐在木地板上,面前放着一个空的白色陶瓷水碗,猫伸出爪子轻轻拨动碗沿,表情困惑而渴望,自然侧光,浅景深,背景是虚化的简约客厅,写实风格,4K,高细节为什么这么写?第一,“肥胖的橘猫”这个描述能让形象更接近大众对家养橘猫的认知,也便于后面角色参考图统一。第二,明确写了“浅景深”和“虚化的背景”,可以让 AI 聚焦在猫和碗上,减少环境对主体的干扰。第三,动作限定在“轻轻拨动碗沿”,避免 AI 自由发挥成打翻碗。
镜头 2:产品亮相
画面要求:白色宠物饮水机放置在浅色木柜上,顶部涌泉式的出水口流出细细的水流,水花在光线下晶莹剔透,产品正面线条简洁,背景是现代风格的客厅。
对应 AI 提示词:
一台白色的现代宠物饮水机放在浅色木柜上,顶部涌泉出水,水流细而清澈,水花晶莹,产品正面可见水箱水位线,背景是明亮的现代客厅,温暖的日光从窗户照入,商业产品摄影风格,8K,高细节这里我特意加了“水箱水位线可见”,是为了让观众直观感受到大容量的特点,同时这个细节也能让产品更有真实感,而不是一堆无意义的白色块。照明用了“温暖的日光”,和镜头 1 的自然侧光形成连续感,但情绪上从“空碗的干渴”过渡到了“水源的丰沛”。
镜头 3:柯基喝水
画面要求:一只柯基犬从画面左侧小跑入镜,耳朵随步伐抖动,凑近白色饮水机低头喝水,舌头卷水的动作清晰可见,背景是客厅一角,暖色调。
对应 AI 提示词:
一只黄白相间的柯基犬从左侧小跑进画面,耳朵抖动着,停在白色宠物饮水机前低头喝水,舌头清晰可见,暖色调,自然光,中景镜头,略微带一点跟随感,写实风格,高帧率,毛发细节丰富柯基的“黄白相间”是颜色锚点,能强化角色认知。写“略微带一点跟随感”是为了让静态画面有动态叙事,但又不至于让 AI 把镜头运动做得太夸张。AI 视频生成里,镜头运动幅度一夸大,画面边缘就很容易扭曲变形,所以描述镜头运动时我会刻意用“略微”“缓慢”这类限制词。
镜头 4:橘猫加入
画面要求:橘猫从右侧跳上桌面,走近饮水机,先低头闻了闻水流,然后开始舔水,动作谨慎又可爱,画面安定温馨。
对应 AI 提示词:
一只橘猫从右侧跳上桌面,走近白色宠物饮水机,低头闻了闻水流,然后小心地舔水喝,动作轻缓,画面温馨柔和,自然光,固定中景镜头,浅景深与镜头 3 形成左右对称的入场方向,这样两个宠物在视觉上会产生“一左一右都过来喝水”的集聚感。同时,橘猫动线比柯基细致——先闻、再舔,这个动作层次能体现猫的小心谨慎,也更有看头。
镜头 5:滤芯与水流特写
画面要求:微距镜头对准饮水机的水流落入水箱的瞬间,水面上泛起细小的涟漪,透过透明水箱可以看到内部的白色过滤棉和活性炭颗粒,水滴晶莹。
对应 AI 提示词:
微距镜头,白色宠物饮水机的水流落入透明水箱,水面泛起细小涟漪,透过水箱可见内部的过滤棉和黑色活性炭颗粒,水珠晶莹剔透,背景虚化,逆光,高动态范围,慢动作质感这里的“逆光”是关键。逆光下液体折光率高,水珠会透亮,效果会好很多。慢动作质感则靠提示词里的“慢动作质感”或生成工具里的运动速度参数来实现,如果没有,就在后期剪辑时对素材做 50% 或 25% 的变速慢放。
镜头 6:夜间静音场景
画面要求:深夜的客厅一角,饮水机底部指示灯亮着柔光,水流声几乎听不见,一只柯基和一只橘猫安静地趴在旁边的地毯上,画面静谧,只有微弱的环境光。
对应 AI 提示词:
夜晚的客厅,白色宠物饮水机底部指示灯发出柔和的淡蓝光,柯基犬和橘猫安静地趴在旁边的灰色地毯上,半闭着眼睛,周围昏暗,只有台灯和指示灯的光线,静谧安详的氛围,写实风格,远景固定镜头静音这个卖点,视觉上其实是没办法直接表现的,我的思路是拍“安静的结果”——两只宠物安心入睡,就反衬出产品没有产生让人焦虑的噪音。这里用到“指示灯发出淡蓝光”,除了增加产品科技感,也能让夜间画面不显得死黑。
镜头 7:共享饮水时刻
画面要求:白天,柯基和橘猫并排站在饮水机前喝水,主人穿着居家服蹲在旁边微笑抚摸宠物,暖阳从窗外照进来,整个画面幸福满溢。
对应 AI 提示词:
一只柯基犬和一只橘猫并排站在白色宠物饮水机前一起喝水,一位穿浅色居家服的年轻主人蹲在旁边,伸手轻抚猫咪头部,微笑看着宠物们,窗边暖阳照射,整幅画面温馨明亮,中景横移镜头,生活化场景这个镜头承担“容量”卖点。两只宠物并排喝水,你要表达的就是“它能同时满足多猫多狗家庭的需求”。主人入镜能拉近消费者距离,同时为片尾品牌露出做情感铺垫。
镜头 8:品牌展示
画面要求:白色宠物饮水机与产品包装盒并排放在干净背景前,包装盒上有品牌名“XX”,整体是商业产品图风格,结尾定格。
对应 AI 提示词:
白色宠物饮水机与同色系产品包装盒并排展示,包装盒正中央有清晰的品牌名“XX”,简洁干净的浅色背景,商业产品摄影风格,柔和棚拍灯光,高清晰度,商品主图质感镜头 8 的提示词要单独说明:如果你直接用 AI 生成带文字的包装,大概率会出现乱码。我的解决办法是不让 AI 生成具体文字,只生成“白色包装盒”,后期在剪辑软件里叠加一个品牌字模板。提示词里可以写“有清晰的品牌名”,但生成结果能用算惊喜,不能用就在后期加字,完全不影响成片。
3.3 30 秒升级版要补哪些镜头
如果你需要拍一条信息量更大的版本,就在 15 秒版的基础上增加这样几个镜头:
- 开箱镜头:主人拆开快递,取出饮水机和水泵配件,营造一种“新入手的期待感”;
- 结构拆解:演示水箱、滤芯、水泵分离,配合旁白“每个部件都能拆洗”,解决养宠家庭的卫生顾虑;
- 对比镜头:同一只猫先看空碗,再看向饮水机,用画面蒙太奇形成“选择产品”的暗示;
- 多宠家庭场景:三只猫同时围着饮水机,强化容量大、够全家用;
- 出差场景:主人拖着行李箱出门,饮水机指示灯亮起,字幕“3 天一箱水”,直击出差党痛点。
30 秒版的分镜逻辑是“痛点更多、场景更全、主角更多”,但每一镜的提示词写法完全沿用上面的公式。
4. AI 视频工具选型与参数设置
4.1 文生视频、图生视频、首尾帧怎么选
目前主流 AI 视频生成工具,基本都支持三种输入模式:文生视频、图生视频、首尾帧。我当时做这份脚本时,三种模式全都用上了,搭配原则如下。
- 文生视频:适合镜头 1、2、6 这类以场景氛围为主导的镜头,给它一段完整提示词,它自己发挥的空间大,画面质感往往比较自然;
- 图生视频:适合 3、4、7 这种带明确宠物的镜头,因为前期有角色基准图,先用工具生成一张高质量的分镜图,再用这张图去生成视频,宠物长相不会跑偏;
- 首尾帧:适合镜头 5 这种需要衔接的水流特写,指定首帧是水流入水,尾帧是涟漪扩散,它能把两个状态连贯起来。
实操下来,我最常用的是“图生视频”。因为分镜脚本已经做了足够细的画面描述,先用 AI 绘画把每一帧的静态图做出来,等于给视频生成加了一道保险,翻车率明显低于直接文生视频。如果你的 AI 视频工具支持参考图功能,那更是首选。
4.2 关键参数怎么调
不同工具的参数设置会有差异,但几个核心参数学会了,是可以通用的。
| 参数 | 建议值 | 说明 |
|---|---|---|
| 分辨率 | 1920x1080 或 1280x720 | 电商短视频建议至少 1080P,方便后期裁剪 |
| 帧率 | 24fps 或 30fps | 24 有电影感,30 更顺滑,宠物题材我选 30 |
| 单段时长 | 3-5 秒 | 超过 5 秒生成难度和失败率都明显上升 |
| 运动幅度 | 低到中 | 运动幅度太大,宠物边缘容易扭曲 |
| 镜头运动 | 固定或缓慢推近 | 固定镜头成片率最高,运动镜头需多抽卡 |
| 种子值 | 固定 | 同一镜头要重生成几次时,锁住种子能保持风格统一 |
“种子值”这个概念对新手来说可能比较陌生。简单说,AI 生成是有随机性的,同样提示词每次出来的结果都不完全一样。种子值就是这次随机过程的编号。如果你生成了一张非常满意的画面,记下这个种子值,下次想微调时在同样提示词下沿用种子值,画面风格会保持高度一致。
4.3 提示词结构公式与负面提示词
我把这次项目里反复验证有效的提示词结构整理成了一个公式,基本上适用于所有产品类 AI 分镜:
[主体详细描述] + [动作/状态] + [场景环境] + [光线/氛围] + [镜头语言] + [画质/风格]用镜头 3 套一遍:柯基(主体)+ 跑进画面低头喝水(动作)+ 现代客厅(场景)+ 暖色自然光(光线)+ 中景略带跟随感(镜头语言)+ 写实风格 4K(画质)。六要素齐全,AI 才能输出及格线以上的画面。
另外,负面提示词必须写。很多 AI 工具支持填入不希望出现的内容,我会固定写这些:
模糊,低分辨率,扭曲,变形,多余肢体,多个尾巴,水碗破碎,文字乱码,水花飞溅过度,畸形的手指,五官错位写负面提示词的目的是给模型设边界。宠物题材特别容易翻车在“多余肢体”和“五官错位”,你把负面词写全,至少能把翻车概率压掉一半以上。
5. 从分镜到成片的完整实操流程
5.1 用分镜图搭建画面基底
拿到脚本后,我的第一步不是直接生成视频,而是先生成 8 张分镜静态图。这一步很多人会跳过,觉得浪费时间,但实际操作时你会发现,静态图的成本远低于视频,改起来也快,还能在团队内部快速对齐视觉方向。
具体做法是:把每个镜头的 AI 提示词粘贴到绘图工具里,逐个生成静态分镜图。同一镜头多生成几张,挑最符合脚本气质的一张。然后把 8 张图按时间顺序排列成一条“视觉样板”,发给产品方确认。产品方如果觉得某张图感觉不对,当场就能指出来,改图比改视频轻松太多了。
等 8 张分镜图全部确认后,再拿到视频工具里逐张生成动态效果。此时因为静态图已经锁定了画面构图和角色形象,视频生成的成功率大幅提高。
5.2 视频拼合、配音与字幕
8 段素材生成出来后,进入剪辑环节。我用的剪辑工具就是最常见的剪辑软件,操作逻辑都差不多。顺序是:按镜号排到时间线上,每段素材先粗剪到目标时长,然后整体变速对齐节奏。
配音我用的方案是 AI 语音合成。选择一个偏向生活化的女性音色,语速调到 1.0-1.1 倍,这样听起来既清楚又没有播音腔。以下是一份可以直接念的配音稿:
0-3s:还在让毛孩子喝这碗不新鲜的水?(留白) 3-6s:活水循环, 6-8s:每一口都新鲜。 8-10s:四层过滤, 10-12s:超静音运行。 12-14s:2.5 升大容量,出差三天也不用换水。 14-15s:让毛孩子爱上喝水。字幕不要用 AI 视频里的内置文字,那些经常乱码。正确做法是在剪辑软件里自己加字幕条,字体选黑体或思源黑体,字号 70 左右,放在画面下方安全区内。品牌名和卖点词可以用稍微大一点的字号做强调。
5.3 后期调色与导出参数
AI 视频生成的素材,每个镜头因为生成批次不同,色调会有轻微差异。我的处理习惯是:整体统一做一个暖色调 LUT,把色温拉到一致;然后微调对比度和饱和度,让画面既通透又不失真。
导出参数直接照这个设置:分辨率 1920x1080,帧率 30fps,码率 10Mbps 以上,格式 MP4(H.264 编码)。这个参数完全满足电商平台上传要求,画质在手机上播放干净锐利。导出前记得从头到尾完整看一遍,重点检查:宠物形象是否一致、字幕是否错位、镜头切换处有没有闪白或跳帧。
6. 常见问题与排查技巧实录
6.1 宠物形象崩坏怎么办
我遇到最多的翻车就是宠物形象崩坏:猫长了五条腿、狗的眼睛跑到脸颊外面、尾巴分叉成好几条。这类问题的排查思路从提示词层面解决。
第一,负面提示词里必须写明“多余肢体、畸形”等。第二,主体描述不要用过于复杂的修饰语,比如“一只花色很复杂的猫”就容易崩。第三,尽量使用“图生视频”模式,先出图再出视频,形象稳定性是最高的。第四,如果一个镜头在某一帧崩坏了,不要整个镜头重生成,试着把这段素材的长度缩短,用在剪辑上快速切走,观众几乎注意不到。
6.2 水流和水花效果不自然
饮水机项目里,水流是重头戏,但 AI 生成水花时经常出现两种问题:要么水流像果冻一样凝结不动,要么水花飞溅得毫无物理逻辑反而像在喷水。
我的解决方式是这样的:提示词里不要用“大水花”“激烈喷射”,要用“细流”“缓缓溢出”这类温和词汇。生成后在剪辑软件里给水流镜头做一个 20% 左右的慢放,水流在慢放下会自然得更接近实拍质感。如果对画面还不满意,就用蒙版叠加一层真实的音效,比如水杯倒水的清脆声,观众听觉上会默认画面里的水也是真实流动的。
6.3 画面闪烁与镜头漂移
画面闪烁常见于多个镜头拼接处,原因是相邻镜头的光线、色调和噪点不一致。排查顺序是:先看是不是调色参数没统一,再看镜头切换处有没有加转场过渡,最后检查视频素材本身在生成时是否有闪烁。如果是最后一种,重生成该镜头并固定种子值,能有效降低闪烁概率。
镜头漂移则出现在带运镜的镜头里,AI 推近或横移时,背景和宠物之间的边缘会像水波纹一样扭动。降低运动幅度、改用固定镜头,是成本最低的解法。如果必须保留运镜感,可以在剪辑时给画面加一点轻微的缩放关键帧,人工模拟推近效果,把不自然的漂移盖住。
6.4 文字、logo、字幕的处理
AI 生成文字依然是目前最薄弱的环节。产品包装上的 logo、字幕条上的汉字,基本都会乱码。我的建议是彻底放弃让 AI 生成文字,所有文字都用剪辑软件后期添加。
好的做法是准备一个品牌文字样式模板,包括字体、字号、颜色、描边、描边阴影等,之后所有镜头需要加字时,一键套用同一套样式。这样不仅能规避乱码问题,还能让整条视频的品牌感更强。
6.5 平台审核与版权提醒
最后提醒一句版权问题。AI 生成素材的商用授权规则,不同工具不一样,用之前去官网确认一下授权范围。尤其是宠物饮水机的产品视频最终要投放到电商平台,素材是否能商用、能不能用于广告投放,都必须在动手前确认清楚。另外,如果使用了真实品牌的声音或音乐作为配乐,需要确保有版权授权。配乐方案我一般两个选择:一是用工具自带的版权曲库,二是自己合成简单的环境音+白噪音,避免版权纠纷。
在投放平台上,宠物用品类目审核相对宽松,但视频里如果出现“最”“第一”“绝对”这类极限词,就要小心了。哪怕是 AI 生成的旁白,也同样被平台审核系统识别,记得在脚本阶段就避开敏感用词。
说实话,宠物饮水机这个 AI 分镜脚本项目,我前前后后改了三版才稳定出片。第一版镜头太少节奏太拖,第二版提示词写得太简略导致宠物形象全崩,到第三版我开始用角色基准图加固定种子值,才终于跑通完整流程。后来我又把同样的方法用在了空气炸锅和智能猫砂盆的短视频上,效率翻了不止一倍。如果你正准备做类似的产品短视频,别一上来就去找摄影棚,先花两天时间把 AI 分镜脚本跑通,你会发现这可能是整个项目里性价比最高的投入。