AI漫剧不是什么黑科技玄学,而是把“AI出图出视频、AI辅助编剧、剪辑软件组装、短视频平台分发”串成一条生产线的过程。用即梦 + 豆包 + 剪映 + 红果这个组合,路径很短,但踩坑点不少。本文按我实际跑过的流程拆开讲,适合想从 0 到 1 做 AI 短片的创作者,尤其是想接单、做连载账号或者把 AI 视频当副业方向的人。最值得关注的不是“能不能生成一张好看的图”,而是怎么保证人物前后一致、怎么批量出素材、怎么控制资源占用,以及别被“学完即可接单”这种说法带偏。项目标题里提到耗时 256 小时,这个数字不夸张。你真要手搓一个完整短剧项目,从剧本、分镜、出图、生成视频、剪辑、配音到字幕,几十个小时起步很正常。大部分时间不是卡在生成,而是卡在“先生成什么、怎么描述、选哪张、怎么拼”。
1. 先搞清楚这条链路里四个工具的角色,别把分工用反
很多人一开始就搞混:一会儿用豆包去画图,一会儿跑到剪映里找 AI 生图,结果每一步都不顺手。AI 漫剧制作的关键不是某个工具有多强,而是让每个工具只干自己最擅长的事。
1.1 即梦负责“看得见的画面”,是成片的地基
即梦是画面生成环节,既做文生图,也做图生视频。漫剧里的人物、场景、道具、镜头运动,基本都从这里来。
我一般会先用即梦生成关键帧图片,再用图生视频让画面动起来。比如人物站在雨里,单张图只是静态,接上“细雨落下、衣摆轻微飘动、镜头缓慢推进”这类视频生成提示词,才有“剧”的感觉。
这里要记住:即梦产出的是素材,不是成片。不要指望一次生成就是一个完整片段,更合理的做法是每个镜头生成 3 到 5 个候选,逐个挑。
1.2 豆包负责剧本、分镜和提示词,是前期的编导
豆包在这里的价值是文本能力。让它写短剧剧本、分集梗概、台词、画外音,甚至分镜表,都比自己从空白文档开始快得多。
更重要的是,豆包能帮你想清楚每一幕的镜头语言。我经常这样问:
- “写一个 1 分钟短剧脚本,主角是两个女高中生,冲突点是一张旧照片,结局留悬念。”
- “把上面剧本拆成 8 个镜头,每个镜头写出景别、画面描述、台词、音效。”
- “把第 3 个镜头改成古风悬疑风格,画面描述里加上灯笼、雨巷、背影。”
这一步输出的分镜表,是后面所有提示词的基础。分镜不清楚,出图和剪辑都会乱。
1.3 剪映负责把所有素材拼成能发的成片
剪映是生产线的组装车间。关键帧图片、生成好的视频片段、配音、背景音乐、字幕、转场,全部在时间线上整合。
很多人低估了剪辑在 AI 漫剧里的比重。实际上,画面素材生成得再漂亮,如果在时间线上节奏不对,整体观感也会差很多。剪映的自动字幕、文本朗读、变速、关键帧动画,都是 AI 短片最常用的能力。
我建议先把剪映的导出预设搞清楚:竖屏 1080 x 1920、横屏 1920 x 1080、码率、帧率,都要提前设好。等生成完了再改比例,素材重出,时间成本翻倍。
1.4 红果负责分发,但别把它当成自动提款机
红果这类短剧平台,承担的是内容分发和观众触达。AI 漫剧做出来之后,整理成短视频、短剧或者连续系列上传,借此获得推荐和关注。
但要注意:平台规则、原创审核、内容质量和更新频率,都会影响后续表现。“上传视频赚钱”反映的是很多人的需求,实际路径并没有标题里那么顺畅。第一批作品大概率是用来测流程和积累数据的,不要指望一上架就有稳定收入。
2. 开工前把环境和素材准备到“能立刻上手”的状态
第一次做 AI 漫剧,最容易犯的错误是连素材目录都没有就冲进去生成。生成了一堆文件,文件名全是乱码,三天后自己都不知道哪张图对应哪个镜头。
2.1 硬件和账号条件:普通电脑也能做,但要控制节奏
这套组合里,即梦和豆包主要是网页端使用,压力不在本机 GPU 上。日常办公电脑完全可以跑通整个流程。
真正吃资源的地方在剪映导出,尤其是视频片段多、字幕特效多、分辨率高的时候,内存和磁盘占用会涨得很快。如果你用 16GB 内存的电脑,建议一次不要堆太多素材,生成源文件也要定期清理。
网络方面,需要保证网页端能稳定打开、上传下载不中断。如果经常卡在“生成中”,先检查网络稳定性,再检查浏览器版本,不要一上来就怀疑平台服务有问题。
2.2 素材目录和命名:从第一集开始就养成编号习惯
我会在本地建一个项目根目录,结构类似这样:
project_meiju/ ├── 00_script/ ├── 01_prompts/ ├── 02_images/ │ ├── shot_01/ │ ├── shot_02/ │ └── shot_03/ ├── 03_videos/ │ ├── shot_01/ │ ├── shot_02/ │ └── shot_03/ ├── 04_audio/ ├── 05_edit/ └── 06_output/每个文件名都用“集数_镜头号_版本号”的格式,比如ep01_shot03_v2.png。别小看这个习惯。等到第 20 集,你会感谢自己当初规规矩矩给文件命名。批量生产最怕的不是速度慢,而是不知道哪个文件能用、哪个已经废弃。
2.3 先定一个半小时能跑完的最小样例:一分钟一集
不要一上来就做 10 集长剧。先把目标收敛成“一集 1 分钟、8 到 12 个镜头、一个人物、一个场景”的最小样例。
这个样例的意义是验证整条链路能不能走通:剧本到分镜、分镜到提示词、提示词到画面、画面到视频、视频到剪辑、剪辑到导出。如果能跑通,再考虑加人物、加场景、加特效、加批量任务。如果链路上某个环节卡住,修复成本也比后期低得多。
3. 从 0 到 1 的完整流程:五步走,每一步都要看到结果
下面按我实际干活时的顺序拆解。每次执行到某个环节,先看结果,再决定要不要继续,不要一口气闷头生成一整天。
3.1 第一步:让豆包产出剧本和分镜表
给豆包提供的剧本需求,至少包含这几项:
- 剧集类型:古风、都市、悬疑、甜宠、奇幻。
- 每集时长:建议先 60 秒到 90 秒。
- 人物设定:主角名字、外貌、性格、身份。
- 核心冲突:这一集要解决或者推进什么问题。
- 结尾状态:是完成一个小目标,还是留悬念。
提示词可以这样写:
请帮我写一个 1 分钟 AI 漫剧脚本。 类型:都市奇幻。 主角:林默,28 岁,穿深灰色风衣,左眉有一道疤,性格冷静。 核心冲突:他发现一家便利店会在凌晨出现,天亮后消失。 要求:开头 5 秒抓人,结尾留悬念。输出 10 个镜头,每个镜头包含景别、画面描述、台词、音效。豆包返回结果之后,不要直接拿来用。逐条检查画面描述是否可拍,台词是否太长。台词超过 15 个字,竖屏字幕就不好排。
3.2 第二步:把分镜改写成画面提示词
分镜表是“导演语言”,画面提示词是“生成器语言”,两者不能直接画等号。
一个可用的画面提示词,至少包含:
- 主体:人物长相、服装、姿态。
- 场景:环境、年代、氛围。
- 镜头:景别、机位、视角、运动方式。
- 光影和风格:光线方向、色调、画风。
- 运动信息:只有图生视频时需要。
举个例子:
国漫厚涂风格,都市夜晚,便利店门口。 男青年林默,28 岁,深灰色风衣,左眉有疤痕,站在路灯下回望。 中景,镜头缓慢推近,雨丝落下,地面反光。 冷蓝色调,氛围压抑,画面略带电影感。不要为了追求“像电影”而堆砌大量单词。关键词要具体,尤其是人物外貌,必须和前面设定完全一致。我最常用的方式是把人物描述单独复制到每个提示词里,保证不漂移。
3.3 第三步:在即梦里批量生成关键帧和视频片段
这一步是耗时最长的。推荐顺序是:先生成关键帧图片,再选满意的图去生成视频片段。
生成图片时,控制几个要点:
- 竖屏优先:漫剧大多上短剧平台,竖屏比例更合适。
- 一次性生成多张候选:同一个提示词多生成几张,方便后续挑选。
- 优先使用参考图:如果平台支持参考图,可以把上一张结果图作为下一张的参考,保持人物一致。
- 同一镜头可以多跑几轮:不要把第一次结果当成唯一答案。
生成视频时,运动提示词要克制。我一般会写“镜头缓慢推进”“头发轻微飘动”“眼神从看向前方转为低头”,而不是“人物快速奔跑,背景剧烈晃动”,后者很容易出现画面撕裂。
如果画面里有多个人物同时动作,生成难度会成倍上升。新手阶段,尽量设计成“一人一动,背景缓慢变化”,先保证画面稳定,再追求复杂运动。
3.4 第四步:在剪映里完成粗剪、配音、字幕和包装
剪映拿到素材后,顺序应该是:粗剪,再配音字幕,最后包装。
粗剪阶段,把每个镜头按分镜表放上时间线,确定前后顺序,删掉明显废帧。
配音部分,可以用豆包生成口播台词,也可以直接在剪映里用内置朗读功能。AI 配出来的音色选择很多,但要注意:一个角色从头到尾最好用同一个音色,不要前两集用男声,第三集突然变成另一个音色,观众会察觉。
字幕建议单独做一次。剪映的自动识别字幕在普通话清晰的情况下表现不错,但 AI 漫剧里的台词经常涉及人名和特殊设定,识别错误率不低。我一般会先自动识别,再统一检查一遍。字幕字体和位置也要统一,竖屏短剧的字幕不要压太下面,防止平台 UI 遮挡。
包装包括:片头 2 秒、片尾 2 秒、集数标题、关键帧封面。这些可以做成模板,后面每一集只改数字,不用每次都重新设计。
3.5 第五步:导出检查,确认格式后再考虑上传红果
导出不是“点一下导出就结束”。你还需要检查下面这些点:
- 画面比例是否是 9:16。
- 视频时长是否在目标范围内。
- 字幕是否完整,有没有错别字。
- 音频是否过载,有没有爆音。
- 码率和文件大小是否适合上传。
导出格式建议用 MP4,编码以 H.264 为主,兼容性好。导出后先在本地播放一遍,不要直接上传。很多时候问题只有全屏播放时才能发现,比如画面抖动、字幕错位、音频不同步。
4. 核心参数、判断标准和真正决定质量的细节
4.1 画面比例、时长和分辨率先定死,后面再改会很难受
AI 漫剧最常见的规格是竖屏 9:16,也就是 1080 x 1920。单集时长一般控制在 1 到 3 分钟。
为什么不建议先做横屏?因为短剧平台、短视频信息流都以竖屏为主。横屏内容也可以发,但观感会差一些。分辨率方面,生成阶段并不需要追求 4K,1080P 完全够用,4K 只会在导出和存储上增加负担。
时长也别拍脑袋定。1 分钟剧本大概对应 8 到 12 个镜头,每个镜头 3 到 6 秒。镜头拖太长,观众会流失;镜头切换太频繁,画面生成数量又跟不上。我第一次做的时候定了 90 秒,结果光画面素材就生成了一百多个,后期根本选不过来。
4.2 角色一致性:这是 AI 漫剧最容易翻车的地方
看 AI 漫剧的人第一眼关注的不是剧情,而是“主角是不是同一个脸”。角色在不同镜头里长得不一样,是这个品类的头号劝退原因。
要保证角色一致性,能做的事情主要有这几类:
- 把所有镜头的人物描述都写成同一段,一个字都不改。
- 优先让生成器生成正面、半侧面这些稳定角度,避免离谱的大角度俯拍、仰拍。
- 记录关键参数,比如种子、参考图信息,如果平台支持保存提示词和历史记录,就把每个镜头都归档。
- 用参考图作为下一张图的输入时,选最接近角色设定的那张,不要选表情夸张的。
有些平台已经支持人物模型或角色参考功能,有就用。没有的话,靠“描述不变 + 参考图 + 反复筛选”也能把一致性拉到可接受的水平。
4.3 批量生成时,怎么判断速度、占用和成功率
批量制作是接单和持续更新的必经之路,但要先学会判断资源边界。
看速度,不能只看“平均生成一个视频多少秒”,要加进排队时间、上传下载时间、筛选时间和返工时间。我实测时经常遇到:生成 10 个视频,只有 3 个能用,最终 3 个里面还要挑 1 个。所以时间预估要按“生成量除以可用率”来算。
看占用,主要看浏览器内存和本地磁盘。网页端生成素材时,浏览器标签页一旦开太多,内存占用会飙升。我建议一次只开三个生成任务,不要像开盲盒一样疯狂并发。
看成功率,先把所有镜头各生成一次,统计可用率。如果某个镜头的可用率特别低,不要硬刷,回去改提示词或者重新出关键帧。盲目重复同样的生成条件,只会得到同样的问题。
4.4 输出质量怎么验收:从能看到能剪到能发,不是一个标准
我把质量分成三个等级,验收标准不同:
- 能看:画面没有明显穿帮,人物基本可辨识,动作没有严重变形。
- 能剪:画面之间可以衔接,运动方向和光源一致,素材时长足够支撑剪辑。
- 能发:故事完整,字幕清晰,音画同步,封面标题符合平台规范。
能发并不代表能火。真正的长期标准是稳定复现:这集能用这套流程做出来,下一集也能用同样流程做出来,而不是每集都靠运气。
5. 最常见的卡住场景和报错,按这个顺序排查
AI 漫剧制作中,问题不一定是“功能不支持”,更多是提示词、输入、环境或参数出了问题。我习惯按下面这个顺序排查。
5.1 画面出了怪东西,先别怪模型,从提示词和参考图查起
多手指、人物多了一只脚、背景出现漂浮物,这类问题首先看提示词是否描述得过于复杂。人物数量、动作数量、场景元素数量,能减就减。
如果提示词不复杂,再看参考图。参考图模糊、人物很小、画面里有杂物,都可能让生成结果偏移。换一张更干净的参考图,通常比反复改提示词更有效。
5.2 角色前后不像同一个人,检查提示词和种子
角色不一致,先检查每一段提示词里的人物描述是否完全一致。很多时候不是工具问题,而是你改了某个形容词,比如“深灰色风衣”变成了“灰色外套”,模型对形象的理解就会漂移。
其次看种子和参考图。能固定参数就固定参数,不能固定就尽量用同一张参考图作为底图。
5.3 剪映导入、导出和字幕卡顿,按工程问题处理
剪映报错,很多不是素材本身的问题,而是工程状态和软件状态。比如一次导入大量视频素材,预览卡顿,可以先关掉实时预览;导出时报错,可以尝试分段时间线、清理缓存、升级客户端版本。
如果遇到“复合片段”相关提示,先检查时间线上是否嵌套了多层复合片段。有些复合片段内容比较复杂,导出时就会出问题。处理方式是先取消复合,再把需要的片段直接放到主轨道上。这里不建议去找所谓的免激活或离线版本,正规渠道的客户端更新和官方支持才是稳的。
5.4 网页生成慢或提示资源不足,先确认是不是并发太高
网页端生成工具也有并发限制。一次开太多任务,或者一个任务里同时生成多个候选,都可能导致排队变长。
排查顺序:
- 关掉不用的浏览器标签页,释放内存。
- 把正在进行的生成任务减到 1 到 2 个。
- 换一个网络环境,排除网络波动。
- 刷新页面重新登录,确认账号状态正常。
- 清理浏览器缓存,重启浏览器再试。
5.5 上传红果时格式被拒,检查容器、编码和比例
上传失败,第一件事是看平台给出的提示。常见情况是:视频比例不是 9:16、文件编码不是 H.264、帧率或码率超出要求、时长不符合分类限制。
正确做法是导出一份符合通用标准的 MP4 文件,不要用特殊编码去挑战平台审核。每个平台的详细参数要求都以上传页说明为准,我这个是通用排查顺序。
6. “学完即可接单”的真实情况:先跑通流程,再谈收入
6.1 接单的前提不是会点按钮,而是能稳定交付
“学完即可接单”听起来诱人,实际上接单要面对的是明确需求、交付时间、修改次数和客户体验。
客户不会因为你用的是 AI 工具就降低要求。相反,AI 短剧客户往往更在意:人物是否统一、画面是否稳定、剧情是否连贯、能不能按时交付。如果你连一集完整作品都拿不出来,接单基本无从谈起。
更稳妥的路径是:先做出 3 到 5 集完整的 AI 漫剧样片,把单集制作时间统计出来。能稳定一周出 1 到 2 集,再接小单;连自己的发布账号都没跑通之前,不要急着宣传接单。
6.2 平台分成和原创规则,要当成基本功来读
红果这类平台确实有创作者激励、版权分成、广告分成等机制,但具体规则会随运营阶段变化。不要听别人说“一个月能赚多少”,要自己去读平台的创作者规则、原创声明、内容规范。
AI 生成内容能不能在没有明确标识的情况下上传、哪些题材受限、封面和标题有什么限制,这些都要提前确认。合规不是加分项,是基础项。
内容创作上,我建议把“原创性”做扎实:剧本自己写或深度改编、画面提示词自己设计、配音和字幕自己控制。越依赖标准化 AI 输出,内容同质化越严重,平台推荐也会越来越不友好。
6.3 可持续生产的核心,是提示词库、分镜模板和素材命名规范
如果只做一集,靠手感就行。如果要做 20 集、50 集,必须有模板。
我会维护三样东西:
- 分镜模板:包含镜头序号、景别、画面描述、台词、音效、备注。
- 提示词库:按风格、场景、人物分类,方便复制改参数。
- 素材命名规范:集数、镜头号、版本号、生成时间,全部写清楚。
有了这三样,换人接手也能快速上手,批量生成时也不会乱套。
7. 每次开新项目前,我必然会确认的六个点
第一,这一集的核心冲突是什么。没有冲突的 AI 漫剧,画面再华丽也只是动态壁纸。
第二,主角长什么样,人物描述有没有写死。我一般会把人物描述单独存成一个文本,所有提示词直接复制这一句。
第三,分镜表是否每一行都能生成。不能生成的分镜,要么简化,要么删除,不要硬留在脚本里。
第四,资源和时间是否够用。一分钟成片,素材生成加筛选加剪辑,通常会花掉几个小时甚至一天,排期要留足余量。
第五,导出的格式是否满足目标平台要求。比例、时长、封面、标题,都在上传前检查完。
第六,预期是否合理。AI 漫剧能做,能学习,能做成系列,但能不能接单、能不能赚钱,取决于你的交付能力、内容质量和平台规则,不取决于报名一个课程或看一篇文章。
踩过几次坑之后我发现,很多问题不是工具能力不够,而是前置环境和输入材料没有处理干净。把这套准备工作做好,AI 漫剧的制作速度和质量都会上一个台阶。