做 AI 短剧的人,应该都体会过一种“抽卡焦虑”:写一个角色提示词,生成 10 张图,可能只有 1 张能看;把这张满意的图丢进视频模型,出来的前几秒还行,下一秒角色就换了一张脸。于是大家把这种随机生成称为“抽卡”。运气好,一次出货;运气不好,抽了一晚上,素材库里全是废片。
这篇博客要聊的是一个新人的 AI 海外剧练手项目:用 MiniMax 平台的多模态能力,制作一部虚构的海外剧《埃尔多利亚》01+02 集。项目给自己定了一个硬约束——关键角色只抽卡一次。这不是为了省几次调用费用,而是要验证一个判断:AI 短剧能不能从“碰运气”变成一套可复制、可复用、可交付的流程。
如果你正准备入坑 AI 短剧,或者已经在做但被角色一致性困扰,这篇文章会给你一套可以直接照搬的工作流:选题定位、角色定稿、提示词模板、图生视频、语音合成、剪辑交付。文中给出的脚本和模板,都是放到本地就能改着用的。关于 H3,这里先做一个说明:社区里对“MiniMax H3”的定义并不统一,有人把它理解为 MiniMax 视频生成能力的新版本,也有人把它当作本地部署的模型权重代号。本文不把结论押在某个具体版本上,而是把它视为一次 AI 短剧实验的项目代号,讨论更通用的创作流程。只要你正在用的是 MiniMax 平台或其兼容接口,下面这套方法都适用。
1. 这篇文章真正要解决的问题
AI 短剧在最近两年几乎成了 AIGC 领域最热闹的落地场景之一。打开短视频平台,能看到大量 AI 生成的古风剧、科幻剧、都市剧,其中不少已经跑通了商业变现。但热闹之下,真正的创作者都在叫苦:AI 生成不可控,产出不稳定,项目很容易烂尾。
如果把“用 AI 做短剧”拆开看,新人至少会撞上三个坎。
第一是角色一致性。前一秒还是金发碧眼的女主,下一秒就变成了深色头发的中年女性。这不是模型“坏”了,而是扩散模型每次生成都是一次独立采样,没有“记忆”可言。要让角色稳定,必须主动设计一整套约束机制,把“角色是谁”这个信息固化下来。
第二是叙事连贯性。单张图好看不难,难的是让 20 个镜头连在一起,仍然能讲清楚一个故事。很多新人拿到一个惊艳的片段就急着发出去,但观众看的是整条视频,不是某一张画面。镜头之间的景别、光线、人物行为和情绪都需要统一,否则成品会变成一段漂亮的素材拼接,而不是一部剧。
第三是成本与时间失控。AI 生成按量计费,反复抽卡的时间成本和费用成本都会快速累积。一些团队做一部短剧,光角色定稿就花掉了预算的一半。这是典型的流程设计问题:没有在开始生成之前把“标准答案”定下来,导致后续每一次执行都在重新做决策。
这篇文章要解决的就是上面三个问题。核心思路是:在动手生成之前,先用文本把角色、场景、镜头和情绪全部定义清楚,把“抽卡”从决定成败的关键因素降级为一个普通执行步骤。文章会以《埃尔多利亚》这部虚构海外剧为项目背景,从前两集的制作流程切入,给出可以复制的工程方法。
如果你是 AI 创作者、AIGC 工具使用者,或者正准备尝试 AI 视频制作的技术型新人,这篇文章比那些只教你“写提示词”的教程更接近真实项目。它不承诺“生成一次就完美”,而是告诉你:即使中途失败,也能知道该改哪里、为什么改。
2. AI 海外短剧是什么,MiniMax H3 又是什么
在进入实操前,需要先统一几个概念。
AI 短剧,简单说是用生成式 AI 完成短剧生产链路中大部分环节的作品。传统短剧需要演员、摄影、灯光、场地、化妆、道具,而 AI 短剧通过文本、图像、视频和语音生成模型,把其中不少环节替换成了“提示词 + 计算资源”。当然,AI 短剧不等于没有人的创作,编剧、导演、美术视觉设计、后期剪辑依然需要人来完成,只是工具和流程发生了根本变化。
“海外剧”在这里指的是题材和视觉风格。它通常包含欧美风格的演员形象、异域场景(欧洲小镇、荒漠古堡、未来都市)、强冲突的叙事节奏。这类题材之所以受欢迎,一是视觉上有新鲜感,二是 AI 对欧美风格的人像和建筑表现相对稳定,容易出效果。
接下来是 MiniMax。MiniMax 是国内一家 AI 公司,旗下有海螺 AI 等产品,也提供面向开发者的开放平台。它的能力覆盖文本对话、图像生成、视频生成、语音合成等多个模态。对短剧制作者来说,这意味着一个平台就能覆盖大部分生产环节,不需要在十来个工具之间来回搬运文件,也不必额外实现复杂的中间格式转换。
那么 H3 呢?关于“MiniMax H3”这个名称,社区里没有统一说法。从相关讨论看,有人把它理解为 MiniMax 视频生成模型的新版本,也有人把它当作某种本地部署权重的代号。这里不能替你确认具体版本和参数,因为这部分信息变化太快,而且不同渠道说法不一致。更稳妥的做法是:把 H3 当作这次短剧实验的项目代号,重点看它背后代表的“多模态生成能力”如何组合到一条生产管线里。
用一个通俗类比来理解 AI 短剧的生产方式:传统剧组是“每个工种请一个专业的人”,AI 短剧是把这些工种的能力装进一个工具箱,而你需要做的是像导演一样调度它们,而不是像程序员一样去改每个工具的源码。MiniMax 这类平台就是工具箱的提供者,H3 可以理解为工具箱里当前版本的一组核心能力组合。
| 环节 | 传统短剧 | AI 短剧 |
|---|---|---|
| 剧本 | 编剧创作 | 编剧 + LLM 辅助创作 |
| 选角 | 演员试镜 | 文生图/角色一致性生成 |
| 拍摄 | 剧组、摄影棚、实景 | 图生视频/文生视频 |
| 配音 | 配音演员 | TTS 语音合成 |
| 剪辑 | 剪辑师 | 剪辑软件 + AI 辅助 |
| 成本起点 | 数十万起步 | 数百到数千元可尝试 |
| 可控性 | 高度可控但昂贵 | 成本低但需要严格流程约束 |
这个表格的主旨不是厚此薄彼,而是说明两种生产方式各有优势。AI 短剧真正的价值在于降低试错成本,让个人和小组也能做出“看起来像剧组出品”的内容。前提是你愿意把流程管理起来,而不是放任模型随机发挥。
3. “抽卡一次”背后的角色一致性设计
标题里“仅抽卡一次”很容易被误解成“运气好”。实际上,一次抽卡成功的前提是:你把随机性关进了笼子。
AI 生成角色图,本质上是从一个高维概率分布里采样。同一个提示词,即使参数完全一样,两次生成的结果也可能不同。这是随机性的来源。当随机性体现在“一张独立角色图”上时,问题不大;但当这个角色要出现在几十个镜头里,随机性就会变成灾难。因为第 5 个镜头的角色和第 1 个镜头的角色,可能只是“长得比较像”,而不是“同一个人”。
解决角色一致性,业界有几种常见路径。
第一种是使用具备角色参考能力的模型或功能,把参考图作为输入条件传入。这是当前性价比最高的方式。你只需要在生成阶段固定参考图,角色面貌就能基本保持稳定。
第二种是在提示词里写死角色的所有视觉特征,包括发型、瞳色、服装、配饰、年龄等。这种方法适合角色特写,但在复杂场景和动态运镜下,单靠文字描述很难完全锁定外观。
第三种是先生成角色定稿图,再以定稿图为基准,做图生视频。这也是本文推荐的主路径。先解决“角色是谁”,再解决“角色在做什么”。
在《埃尔多利亚》这个项目里,角色定稿之前,我先建立了一份角色档案。你会看到,这份档案比一句提示词复杂得多,但它才是“只抽卡一次”的真正底气。
{ "character_id": "eldoria_01", "name": "莉娅", "role": "女主", "appearance": { "face": "年轻欧洲女性,深蓝色眼睛,高颧骨", "hair": "银白色长发,微卷", "body": "身高约170cm,偏瘦", "costume": "深红色长款斗篷,内搭灰色亚麻裙,胸口有星形银质胸针" }, "style": "写实电影风格,柔光,浅景深", "common_prompt_suffix": "same character as reference image, consistent face and outfit" }角色档案的关键作用,是让“稳定”这件事变得可维护。你可以根据剧情给角色换服装,但面部特征字段保持不变;你可以调整镜头角度,但提示词里关于“这是同一个角色”的约束始终存在。在多人项目里,这份 JSON 也可以作为团队统一的素材规范,避免不同成员各自写各自的提示词,导致同一个角色出现多个版本。
有了角色档案,抽卡就变成了一次“验证”而不是“赌博”:你已经知道角色应该长什么样,生成结果只需要做一次相似度和风格校验。如果通过,进入下一环;如果失败,微调提示词再生成,而不是盲目重抽。
4. 环境准备与前置条件
进入实操前,先准备好工具链。这里按“最少配置”来列,避免用不上的东西浪费你时间。
4.1 注册平台与获取 API Key
使用 MiniMax 开放平台,你需要注册账号并开通 API 权限。申请完成后,在控制台里获取 API Key,并妥善保存。API Key 相当于账号密码,不要提交到 Git 仓库,不要明文写在代码里。推荐用环境变量或本地配置文件管理密钥。
如果你拿到的是本地部署的 H3 权重,则还需要准备 GPU 环境和推理服务。这一项对硬件要求较高,新手如果只是想验证工作流,建议先用平台 API,跑通全流程后再考虑本地部署。
4.2 本地 Python 环境
制作流程中的脚本建议使用 Python 3.9 及以上版本。主要依赖如下:
pip install requests pillow numpy- requests:调用平台 API。
- pillow:处理图像,读取和保存图片。
- numpy:做像素级别的相似度计算。
如果你的电脑还没有安装 Python,可以先到 Python 官网下载安装包,安装时勾选“Add Python to PATH”,否则命令行里无法直接使用 python 命令。
4.3 视频合成与剪辑工具
生成出来的素材通常是图片或短视频片段,需要合成。推荐两个工具。
FFmpeg 是命令行视频处理工具,适合批量合成,本文示例会用到。剪映是可视化剪辑软件,适合做字幕和最终包装。两者并不冲突,通常流程是先用 FFmpeg 做批量标准化,再用剪映做精剪和包装。
FFmpeg 在 Windows 和 macOS 上均可安装。Windows 用户可以下载已编译版本并加入系统 PATH,macOS 用户可以用 Homebrew 安装:
brew install ffmpeg4.4 本地部署还是云端 API
这里需要做一个明确建议:新人优先用云端 API。原因有三个。第一,视频生成类模型对显存要求很高,本地部署一套可用的推理服务,硬件成本可能超过你预期的项目预算。第二,云端 API 的版本更新和维护由平台负责,你只需要关心业务层。第三,AI 短剧的核心难点不在部署,而在流程设计,先把流程跑通,再考虑部署才有意义。
5. 核心流程拆解:从剧本到《埃尔多利亚》成片
下面把制作过程拆成 7 步。每一步都在回答三个问题:这一步做什么,为什么需要,做错会怎样。
5.1 确定故事框架与分集目标
AI 短剧最容易犯的错误,是想一上来就生成“完整剧情”。实际上,AI 更适合当执行者,而不是总编剧。先用手写方式确定前两集的剧情走向、主要人物、情绪曲线和每集结尾的钩子。
《埃尔多利亚》前两集的设定很简单:主角莉娅是一个边境小镇的年轻女子,某天在森林里捡到一块会发光的星形徽章,随后被神秘组织追杀。第 01 集讲她发现徽章