AI视频生成实战:提示词与分镜打造可乐喷鼻搞笑短视频
2026/9/23 0:14:36 网站建设 项目流程

你有没有留意到,最近短视频平台上的搞笑素材越来越“离谱”了:上一秒还是坐在便利店门口喝可乐的普通日常,下一秒 AI 生成的画面里,气泡和液体就顺着鼻腔喷出老远,表情夸张但血管清晰。评论区一边刷“哈哈哈哈哈”,一边有人追问“这到底是怎么做出来的”。

这类视频的制作门槛,比很多人想象中低得多。它不需要你准备可乐、曼妥思,也不需要真人去冒险拍摄,甚至不需要演员。真正改变玩法的是 AI 视频生成工具——你只需要把分镜写清楚,让模型依次生成“人物表情、液体轨迹、慢动作回放”,最后剪辑配音就可以发布。这个“文案 → 图像 → 视频 → 剪辑”的流程,把一个原本需要摄影团队和道具组的项目压缩到了单人单机几小时完成。

这篇文章会按真实制作流程来拆解:先帮你看清楚这类 AI 搞笑视频的构成,再讲提示词怎么写、关键帧怎么控、视频怎么生成,最后给到一套可以直接上手的后期剪辑和排错思路。如果你是想做短视频账号的内容创作者,或者正在用 AI 工具做视频测试的技术爱好者,读完应该能跑通第一条完整作品。

需要先说一句容易被娱乐效果掩盖的事实:这类视频的价值在于它只是 AI 生成的虚构画面,并不代表真实物理现象。可乐加曼妥思的真实喷发具有相当强的作用力,把液体弄进鼻腔或者近距离观察喷发口都有安全风险,日常请绝对不要真人模仿。搞清楚边界之后,我们再把注意力和想象力放到 AI 工具上。

1. 这类视频到底在“拍”什么

要制作一个 AI 搞笑视频,第一步不是打开工具,而是搞清楚画面里真正有喜剧效果的结构是什么。

单看“可乐从鼻子里喷出来”这个标题,很多人会以为核心是一张夸张的图。实际上,短视频平台上传播效果好的素材,通常包含三个层次:

第一层是“物理动作”的荒诞感。液体不按常规路径从嘴里流出,而是从鼻腔喷出,这本身改变了观众对物理规律的预期,形成第一个笑点。第二层是“表情反应”的延迟感。主人公在液体喷出前可能是正常喝饮料的表情,随后才意识到不对劲,这种滞后反应会叠加搞笑效果。第三层是“循环播放”的节奏感。短视频平台的用户经常会把高能片段反复播放,如果画面在喷出后有一股自然的延续动作,比如甩头、捂脸,会更容易形成循环素材。

按照这个逻辑,再反过来看标题里出现的写作标签,思路就更清晰了:

标签 / 灵感画面结构适合的视频类型
可乐进鼻子人物喝可乐,气泡从鼻孔喷出脸部表情特写 + 慢动作
可乐加曼妥思挑战人物投入曼妥思后,液体喷发延时回放 + 夸张冲击
AI 曼妥思加可乐卡通/拟人角色做实验角色动画 + 实验失败反应

所以,当你准备开始之后的分镜和提示词时,不要只写“一个人鼻子喷可乐”。你需要拆成三个镜头:喝下前的正常状态、液体喷出的高能瞬间、喷完后的人物崩溃或淡定反应。这三段连起来,才是一个完整的叙事节奏。

这个思路引出一个关键判断:AI 搞笑视频做得好的作者,很多时候不是 AI 工具用得最好的人,而是最会把笑点拆成分镜的人。工具只能减少制作成本,不能替你设计节奏。

2. AI 视频制作的全流程概览

在进入工具操作之前,先用一张流程图说明整个项目的生产链路。这里不需要复杂设备,一台普通电脑或手机,加上可联网的 AI 工具就能开始。

整个流程可以概括成五个环节:

创意脚本 -> 分镜设计 -> 图像生成 -> 视频生成 -> 剪辑发布

每个环节的任务不同:

  • 创意脚本:决定视频的“梗”是什么。比如“可乐从鼻子里喷出来”,就是梗的核心。脚本要具体到动作、反应和结尾。
  • 分镜设计:将梗拆成多个镜头。镜头之间要有因果关系,不能让观众觉得画面是随机拼接。
  • 图像生成:为关键镜头生成静态画面,作为后面视频生成的基础。这一步决定人物的长相、场景和构图。
  • 视频生成:把静态图变成动态视频。可以选择让 AI 直接文生视频,也可以输入起始图和结束图做图生视频,来控制动作方向。
  • 剪辑发布:把生成好的片段剪在一起,加上音效、文字和转场,配上适合平台的标题和标签。

对于单人创作者来说,最耗时的不是工具操作,而是前面两步。原因在于,图像生成和视频生成工具已经相当成熟,只要提示词得当,输出质量稳定。但如果你没想清楚每一段画面里人物在做什么、镜头如何处理,生成结果会非常随机。

因此,下面的章节会按先构思、再写提示词、再生成视频的顺序展开,这也是比较省时间的做法。

3. 提示词编写:把“好笑”变成 AI 能理解的指令

要制作一段“可乐进鼻子”的 AI 搞笑视频,无论选择哪种生成工具,提示词都扮演了灵魂角色。很多人第一次使用会写“一个男人鼻子喷可乐”,然后得到完全不知道是什么的结果,原因是漏掉了表情、镜头、背景、液体形态以及画风等关键信息。

3.1 提示词的基本公式

通用画面生成的提示词,可以参考下面这个结构:

[主体描述] + [动作过程] + [镜头/构图] + [场景/环境] + [画风/材质] + [画质关键词]

对应到“可乐从鼻子里喷出来”的效果,可以这样拆解:

  • 主体描述:一名戴眼镜的年轻男子,坐在家里客厅沙发上
  • 动作过程:正在喝一罐冰可乐,突然被呛到,可乐液体从鼻子中喷出,眼睛睁大
  • 镜头/构图:正前方近景,面部居中,背景轻微虚化
  • 场景/环境:明亮的客厅,茶几上有几罐可乐
  • 画风/材质:写实风格,流畅动画质感,光照自然
  • 画质关键词:high quality, cinematic lighting, 4k

组合成一段完整提示词,大概是这样的:

一名戴眼镜的年轻男子坐在客厅沙发上喝冰可乐,突然被呛到, 可乐液体从他鼻腔中喷出,液体飞溅成夸张水花, 他眼睛睁大、表情从淡定到惊慌,近景面部特写,背景虚化, 写实动画质感,自然光,电影感画质,8k

在英语工具上使用英文提示词,效果通常会更稳定,因为许多底层模型对英文语料的理解更充分:

A young man wearing glasses sits on a sofa in a bright living room, drinking an iced cola. Suddenly he is choked, cola liquid sprays out from his nose in an exaggerated splash. His eyes widen, his expression changes from calm to panic. Close-up facial shot, soft blurred background, realistic animation style, cinematic lighting, high quality, 8k.

这里有一个很容易忽略的细节:不要只描述“液体从鼻子喷出”,还要描述喷出的形态(水花、细流、喷泉状)和人物的表情变化(从正常到惊慌)。AI 模型对“飞溅”“流出”“喷泉状”的理解差异很大,写清楚液体形态,能明显减少重抽的次数。

3.2 提示词模板化

如果你打算批量制作类似视频,比如一个账号固定生产 AI 搞笑内容,不建议每次临时写提示词。更推荐维护一套自己的提示词模板,用变量替换人物、饮料、反应和场景。

下面是一个简化版的 Python 模板示例,方便你构建文案并后续调用接口:

# prompt_template.py def build_cola_prompt( character: str = "戴眼镜的年轻男子", action: str = "可乐液体从鼻腔中夸张喷出", reaction: str = "从淡定瞬间变成惊慌", scene: str = "明亮的客厅沙发旁" ) -> str: template = ( f"{character},在{scene}喝冰可乐,突然被呛到。" f"{action},液体飞溅成夸张水花,{reaction}。" "近景面部特写,背景轻微虚化,写实动画风格,自然光照,电影感画质。" ) return template if __name__ == "__main__": prompt = build_cola_prompt() print(prompt)

输出效果:

戴眼镜的年轻男子,在明亮的客厅沙发旁喝冰可乐,突然被呛到。可乐液体从鼻腔中夸张喷出,液体飞溅成夸张水花,从淡定瞬间变成惊慌。近景面部特写,背景轻微虚化,写实动画风格,自然光照,电影感画质。

这个模板化思路的好处是,后续你只需要维护characteractionreactionscene几个变量,就能快速生成不同风格的同构视频。对你做内容矩阵测试很有帮助。

4. 画面生成实操技法

提示词只是第一步,真正决定生成质量的是交互方法和参数控制。市面上常用的工具分为三类:

  • 在线生成平台,例如即梦、可灵、Pika、Runway 等,适合普通创作者,界面直观。
  • 结合图像处理引擎的本地方案,例如用 Stable Diffusion 配合 ControlNet 等控制插件,适合需要精细控制人物姿势、景深和构图的开发者。
  • 各平台开放的接口,适合把内容生成流程产品化的团队。

无论选哪一类,制作这样的 AI 搞笑视频时,下面几个控制手段非常关键。

4.1 先生成关键帧

先让模型生成一张静态图,确定构图、人物形象、液体位置,再把这张图作为视频生成的起始帧。这样做能显著提升视频的可控性,也能避免直接文生视频时人物五官随机变化。

制作“可乐进鼻子”时,可以直接生成一张关键帧:人物坐在沙发上,手里拿着一罐打开的可乐,已经开始出现呛到的表情,气泡液体从鼻子位置朝前方喷出。这张画面里要预留足够的运动空间,不要让液体占满取景框,否则 AI 没有发挥动态效果的余地。

4.2 起点图与终点图控制

图生视频通常支持“首帧”和“尾帧”。你可以给模型一张“正常喝可乐”作为首帧,再给一张“液体从鼻子喷出、表情夸张”作为尾帧,让模型自动补全中间的运动过程。这种方法对液体飞溅和表情过渡特别重要,因为它相当于给模型划定了动作路径。

实际操作时,如果两张图差异过大,比如构图完全不同,模型可能无法生成连贯的过渡。你需要尽量保证首尾帧人物的位置、背景视角和光线一致,只改变表情和液体状态。

4.3 常见参数含义

不同平台的参数名称不完全一样,但核心概念是共通的:

参数名称作用常规建议
Motion / Motion Strength控制物体运动的幅度生成液体喷溅时可以略高,人物表情类可以中低
Duration / Seconds视频时长单段 3-5 秒比较适合后期拼接
Seed / 随机种子控制生成随机性找到理想画面后固定种子,方便微调
Negative Prompt不希望出现的内容可以写多余肢体、变形手指、模糊、水印
Camera Movement镜头运动方式固定镜头或轻微推进,不要让镜头大幅晃动

负面提示词在生成人物特写时尤其重要。AI 对液体和手部细节的还原容易出错,建议在负面提示词中固定加入:

多余的手指, 变形的脸, 液体形状异常, 模糊, 水印, 文字

4.4 一个可参考的生成参数组合

以生成“少年喝可乐,被呛到,可乐从鼻子喷出”的镜头为例,参数可以考虑这样配置:

resolution: 竖屏 720x1280 或 1080x1920 duration: 4秒 motion_level: 中高 start_frame: 年轻男子拿着可乐,神态正常 end_frame: 可乐液体从鼻腔喷出,面部夸张 camera: 固定机位,面部特写 negative_prompt: 多余手指, 变形五官, 模糊, 低质量, 水印

竖屏比例更适合短视频平台发布,也方便后续直接导入剪辑工具。如果希望人物稳定复现成同一个形象,需要保留固定的参考图或保持相同的图片种子;不同平台的处理方式差异较大,以官方说明为准。

5. 从单镜头到完整片段:脚本与分镜设计

一个能看下去的搞笑视频,至少需要三到四个镜头。把镜头拆开制作,再在剪辑软件里拼起来,这是目前最稳定的生产方式。

下面是一个专门为“可乐从鼻子喷出”设计的简化分镜表,可以直接作为拍摄脚本使用:

镜头序号景别画面描述建议时长
镜头01中景主人公坐在客厅沙发,拿一罐可乐,心情放松1-2秒
镜头02特写拧开或者喝下一口,气泡开始翻涌2秒
镜头03近景-特写突然被呛到,可乐液体从鼻腔喷射出来,表情崩溃3-4秒
镜头04中景主人公愣住,甩了甩头,无奈地擦脸2-3秒

四个镜头连起来,才算构成一个带起承转合的小故事。单独生成一个“鼻子喷可乐”的片段不是不行,只是很难让观众形成记忆点。更容易获得传播效果的做法是让镜头03的高能片段只出现一刀,让观众预期“又会喷一次”但不再重复,节奏点在反复点击播放中自然形成。

不只是短视频脚本,这里也体现了 AI 工程实践中一个值得养成的习惯:不要把所有复杂度都交给模型,而是把任务拆成多个可控子任务逐个解决。每个镜头独立生成,失败就单独重写提示词重新生成,不会影响其他镜头的画面。

6. 后期剪辑与合成

完成多个视频片段之后,需要在剪辑软件里把它们合在一起。这里提供两套方案:小白也能上手的图形界面剪辑,以及适合批量处理的 FFmpeg 命令行方案。

6.1 图形界面方案

推荐使用剪映或其他常见的短视频剪辑工具。核心步骤包括:

  1. 新建竖屏项目(9:16),将四个片段按镜头顺序导入。
  2. 在镜头03出现喷液体的瞬间,把片段速度调慢到 0.5 倍速,让“喷出”这个动作更有冲击力。
  3. 在喷出的前一帧位置添加“液体飞溅”音效和夸张的“噗”音效,音量可以适当偏大。
  4. 为人物表情变化添加快速缩放转场,模拟“镜头被画面震到”的效果。
  5. 添加字幕,例如“第一口:很爽”“第二口:为什么会这样”,辅助观众理解笑点。
  6. 导出时保持高清画质,并按平台要求设置封面。

6.2 用 FFmpeg 拼接多个片段

如果你生成了 10 段素材,想先快速拼接出一个粗剪版本看节奏,可以用 FFmpeg 提高效率。下面的命令把clip1.mp4clip2.mp4clip3.mp4clip4.mp4按顺序拼接成cola_funny_final.mp4,统一编码和分辨率。

# 先统一素材规格,防止拼接时因编码不一致失败 ffmpeg -i clip1.mp4 -vf scale=1080:1920,format=yuv420p -c:v libx264 -r 30 clip1_ready.mp4 ffmpeg -i clip2.mp4 -vf scale=1080:1920,format=yuv420p -c:v libx264 -r 30 clip2_ready.mp4 ffmpeg -i clip3.mp4 -vf scale=1080:1920,format=yuv420p -c:v libx264 -r 30 clip3_ready.mp4 ffmpeg -i clip4.mp4 -vf scale=1080:1920,format=yuv420p -c:v libx264 -r 30 clip4_ready.mp4 # 写入拼接清单 cat >> filelist.txt <<EOF file 'clip1_ready.mp4' file 'clip2_ready.mp4' file 'clip3_ready.mp4' file 'clip4_ready.mp4' EOF # 执行拼接 ffmpeg -f concat -safe 0 -i filelist.txt -c copy cola_funny_final.mp4

运行结束如果没有任何 error 输出,就会生成一个包含四个镜头的完整视频文件。由于这类工具生成素材的编码格式可能不一致,强烈建议先统一转码再拼接,否则中间可能出现音画不同步的黑帧或花屏问题。

实际项目里,我更推荐先手动剪辑一次,确定好节奏点之后,再回头把这些操作固化成脚本。这样批量产出同类视频时会非常快。

7. 安全与合规边界

这一节不写模板化的免责声明,而是说清楚一个真实的判断依据。

“可乐加曼妥思”在真实世界里的反应是一场快速产生大量二氧化碳气体的物理喷发,近距离观察或用鼻子接触液体,都可能造成呛咳甚至黏膜损伤。因此,乐子只存在于 AI 生成的虚拟画面里,任何真人实拍挑战都应该被拒绝。真正专业的视频创作者不但不会做危险动作,反而会在标题或简介中主动注明“画面由 AI 生成,请勿模仿”,这既是对自己账号的保护,也是一个创作者的基本素养。

不止是危险挑战,所有 AI 生成内容都需要注意平台规范。目前很多平台对 AIGC 内容有标识要求或流量限制,不同时期规则不同。作为发布者,你需要在发布前查看目标平台对“AI 生成视频”的标注要求,并在合适的位置加上相应的内容声明。这样可以避免账号被限流或误判为搬运内容。

另外,AI 视频生成工具在生成人脸时也有使用边界。如果是虚构人物,问题不大;如果使用了真实公众人物形象,或者未经授权生成某个可辨识个体的画面,可能涉及肖像权和侵权问题。做搞笑账号可以脑洞大,但思路要朝虚构角色方向引导,不要拿真实人物做恶搞。

8. 常见问题与排查方法

大量实践过 AI 视频的人,一定会碰到下面这些问题。这里给出了一套可以直接对着排查的思路。

问题现象可能原因排查方式解决方案
画面里人物的手部扭曲原图本身就存在手部畸形,或负面提示词缺少相关词放大关键帧检查手部细节重新生成关键帧并加入手部负面提示词,优先选择半身或避开手掌特写
液体喷出的方向不符合预期起始图和尾帧没有明确液体轨迹检查提示词是否写清楚液体从鼻腔向前喷出的方向修改提示词为“液体飞溅成扇形向前喷出”,或提供参考图
多段视频之间人物长相不一致没有使用固定参考图或没有固定种子对比各段人物的五官和发型使用同一张 AI 生成的正面形象作为参考图,生成不同镜头时保持角色描述一致
生成出的动作幅度太小运动强度/motion 参数设置偏低查看平台的 motion 或运动强度参数提高运动幅度,或把起始帧和尾帧的差异拉大
拼出来的视频卡顿、花屏片段编码格式不一致,直接 concat 导致异常查看各片段编码信息先用 ffmpeg 统一转码,再执行拼接
背景里出现莫名其妙的水印或文字提示词里没有排除文字,模型在画面中添加了文字用负面提示词排除 text、watermark、logo重新生成并增加负面提示词,或后期裁切掉多余部分
视频内容被提示风险或不适人物形象或动作可能触发内容审核仔细阅读平台的风控规则换成卡通化角色,弱化液体与脸部接触的写实程度,或调整画面表达

每条排查路径都没有什么神秘感。核心要点只有一个:先定位问题发生在“原图生成阶段”“视频生成阶段”还是“后期合成阶段”,再考虑改提示词还是改参数,能少走非常多的弯路。

9. 最佳实践与工程化建议

如果你已经成功做完一条视频,下一步不是马上再做一个新的,而是沉淀一套可复用的制作规范。内容生产只要进入重复阶段,工程化思维的价值就体现出来了。

我建议你至少维护三类素材:

  1. 提示词库:把角色描述、动作描述、场景描述、负面提示词分模块维护。
  2. 图片素材库:把质量过关的角色图、场景图、表情图按标签存放,方便后续生成视频时反复引用。
  3. 剪辑模板库:把常用的音效、转场、字幕样式保存在剪辑软件的自定义模板中,后续新视频只需要替换画面。

更进一步,如果你会写代码,还可以把“改提示词 → 调用生成接口 → 下载产物”做成一个半自动脚本。在 AI 视频工具 API 接入时,一般都需要准备 API Key、设置模型参数、上传参考图/首帧图、指定视频时长和宽高比,最后轮询任务状态并下载结果。不同平台接口差异较大,以下代码只演示通用结构,具体字段需要以你所使用平台的最新文档为准:

import requests import time # 以通用异步任务接口为例,非特定平台,使用前务必替换为实际接口 API_URL = "https://api.example.com/v1/video/generation" API_KEY = "your_api_key_here" def generate_video(prompt: str, image_path: str = None): headers = {"Authorization": f"Bearer {API_KEY}"} data = { "prompt": prompt, "image": image_path, # 部分平台支持公开图片 URL 或 Base64 "duration": 4, "width": 1080, "height": 1920, } resp = requests.post(API_URL, json=data, headers=headers, timeout=30) print("提交结果:", resp.status_code, resp.text) task_id = resp.json().get("task_id") return task_id def wait_for_result(task_id: str, interval: int = 10, timeout: int = 300): headers = {"Authorization": f"Bearer {API_KEY}"} start = time.time() while time.time() - start < timeout: resp = requests.get(f"{API_URL}/{task_id}", headers=headers, timeout=30) result = resp.json() state = result.get("state") or result.get("status") print("当前任务状态:", state) if state in ("succeeded", "completed"): return result.get("output_url") or result if state == "failed": raise RuntimeError(f"生成失败: {result}") time.sleep(interval) raise TimeoutError("任务超时") if __name__ == "__main__": demo_prompt = ( "一名年轻男子在客厅喝冰可乐,突然被呛到," "液体从鼻腔喷出,表情从淡定变成崩溃,近景镜头" ) task = generate_video(demo_prompt) print("生成结果链接:", wait_for_result(task))

这类脚本的关键是“任务状态轮询”,因为视频生成耗时通常比图片长得多,接口一般会返回异步任务 ID,需要隔几秒查询一次。写完脚本后,建议先用一次小规模测试任务核对返回字段,不要直接跑大批量任务,否则可能浪费接口额度,还容易暴露参数问题。

最后提一个选题运营层面的建议:这类 AI 搞笑视频容易火,但同质化也很快。今天“可乐进鼻子”能火,明天会有“橙子进鼻子”“冰红茶进鼻子”。只有不断在“人物设定、反应方式、叙事结构”上做变化,账号才有生命力。比如把主角换成一只戴围巾的企鹅,或者把场景搬进办公室会议,都会让同一个物理梗获得完全不同的喜剧气质。

AI 工具给了创作者一个很公平的机会:不用租场地、不用请演员、不用买道具,就能把那些现实中危险或不可能发生的搞笑画面做出来。但技术和工具只是杠杆,真正决定作品好坏的是你的分镜想象力和安全意识。先放下工具,把镜头拆清楚,再回到工具里调一个能用的片子出来,这会是你完成第一条“可乐进鼻子”视频最值得付出的练习。

下一步建议你选一个最想做的镜头,照着上面提示词公式写三段不同版本,放到生成工具里对比效果,再挑出最满意的一张作为关键帧开始制作。只有真正跑通一轮,你才能感受到 AI 搞笑视频生产的真正瓶颈是在创意拆解,而不是点击生成的那一下。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询