把463个AI视频拆成一个可复用的技能库和提示语模板库,这件事我做了整整两个多月。今天把全部成果开源出来,不是为了炫耀有多少资源,而是想告诉所有正在做AI视频但总觉得“差口气”的朋友:你缺的不是算力,不是工具,而是一套能把视频拆回提示语的逆向思维。
先说清楚这个项目到底是什么。我收集了463个来自不同平台、不同创作者、不同风格的AI视频成片,把它们按题材、镜头语言、转场方式、角色设定、光影风格全部拆解了一遍,最终提炼出70多套Skill文件和120多条提示语模板,全部开源在仓库里。任何做AI视频的人,只要打开这个仓库,就能直接找到适合自己场景的提示语结构、参数组合和可执行的动作流程,不需要再从零开始试错。
适合谁来用?三种人:一是刚入门的AI视频新手,不知道提示语怎么写、参数怎么调,可以直接抄模板;二是做AI短视频量产的人,需要稳定复现某种风格和镜头,Skill文件能帮他们把流程固定下来;三是跟我一样的提示语研究者,想看看463个视频背后到底藏着哪些规律、风格之间是怎么迁移的。下面我会把整个项目的拆解方法、Skill制作思路、实际使用方式和对常见问题的处理都整理出来,算是给这个开源项目配套的一份完整说明。
1. 为什么要把463个AI视频“反向拆解”成提示语?
很多人做AI视频的方向是“从提示语到视频”,也就是想好一句话,然后生成成片。但我的思路完全反过来:先看大量优质成片,把成片里的每一个可观察特征逆向推断成提示语,再把提示语组织成可复用的Skill。这个做法的出发点非常现实——AI视频的成片质量,本质上是提示语质量的投影。你看到的每一帧有电影感的画面,背后一定有一条在场景、主体、镜头、光影、运动轨迹上都写得很准确的提示语。
1.1 视频是结果,提示语才是源头
打个简单的比方。拍传统视频时,成片效果取决于导演、摄影、灯光、美术,他们的经验藏在镜头参数和布光图里。而AI视频里,这些“导演经验”全部压缩在提示语和设置参数中。同一个模型,有人能生成大片质感,有人只能生成一眼假的动态壁纸,差距几乎全部来自提示语的精细程度。
所以我做的第一件事,就是改变观看视角。我不再把AI视频当成成品来欣赏,而是当成一道需要反推的方程。看到一段雨夜霓虹街头的镜头,我会问:它的主体描述应该怎么写?环境光色温是什么?镜头是从哪个焦段在推近?雨滴的运动模糊具体到什么程度?这些问号填得越满,反推出来的提示语就越值钱。
1.2 463个视频的来源与数据清洗思路
这批视频并不是随机抓来的。我用了大概三周时间,从国内外多个AI视频创作平台上筛选了463个高质量视频,初筛条件是:画面无严重畸变、主体明确、镜头运动不突兀、在不使用音效的情况下仍然有叙事感。我刻意避开了纯炫技的“变形金刚式”视频,因为那种视频虽然吸睛,但依赖大量负面提示语和模型偶发性,很难沉淀出稳定模板,不适合拆解。
收集之后,我按统一格式给每个视频打了标签。标签包括视频主题、主体类型、镜头运动、场景类型、光影氛围、风格关键词、时长区间、疑似使用的模型和参数区间。这一步非常枯燥,但它是整个项目的地基。没有这批标签数据,后面所有规律分析都是空谈。
这里补充一个我的个人判断标准:一个AI视频是否值得拆解,核心不在于它有多少万播放,而在于它的画面风格是否具备清晰的可复制因子。爆款视频里有很多是“一次性运气”,那种视频我不会收进来。真正值得拆的,是那种风格统一、叙事明确的视频,因为它们的提示语大概率是经过结构化的、可复用的。
1.3 项目定位:不是数据集,而是方法论
我开源的不是463个视频本身,而是一个方法论的载体。视频原片可能涉及各创作者的版权,不适合直接分发;但提示语是语言组合,是规则和结构的抽象。我把它们提炼成Skill和模板,等于把常见做法里的“画面经验”变成了“文字配方”。
Skill的含义这里要多说一句。在AI应用语境里,Skill指的是一套封装好的、可被反复调用的能力模块。放到AI视频场景,可以理解为:一个Skill内包含该场景所需的提示语片段、参数推荐、负面提示语、使用时机和执行顺序,让使用者不必理解内部全部原理,就能稳定产出某种质量的视频。
我对这个项目的定位是“方法论工具箱”。使用者不需要完全理解我拆解视频的全过程,但拿到工具后,能用同样稳定的方式,生产出和质量基准线相当接近的作品。这也解释了为什么我花大量精力在研制模板结构上,而不是继续堆数量。只堆视频数量,那是收藏家;把视频拆成别人也能复用的结构,才是工程师该干的事。
2. 463个视频的拆解方法与规律总结
拆解工作如果只凭肉眼逐个看,效率太低,而且容易遗漏细节。我的办法是三层拆解法:先做粗分类,再做特征拆解,最后做提示语反推。这三步走完,一个视频的价值才算真正被榨干。
2.1 视频分类体系:这才是我拆解的第一步
我把463个视频分成六个大类,这也构成了Skill库的第一层目录结构:
| 分类 | 数量 | 代表风格 | 对应Skill目录 |
|---|---|---|---|
| 人物叙事类 | 128 | 人物近景、情绪氛围、眼神光 | skill/human_story/ |
| 场景漫游类 | 96 | 环境空镜、航拍、宏观调度 | skill/scene_walk/ |
| 动作节奏类 | 85 | 快速剪辑、运镜冲击、粒子特效 | skill/action_flow/ |
| 概念幻想类 | 74 | 科幻、奇幻、异世界生物 | skill/fantasy_world/ |
| 抽象艺术类 | 45 | 流体、光线、微粒、柔和变形 | skill/abstract_motion/ |
| 日常写实类 | 35 | 生活片段、手部特写、器物细节 | skill/realistic_daily/ |
对绝大多数AI视频创作者来说,找到自己所属的分类,就等于缩小了一半的搜索空间。我见过很多人做一个赛博朋克城市空镜,跑去搜索“未来城市视频提示语”,结果搜出来一堆概念堆砌。而在我这个分类里,“场景漫游类”下有专门针对宏观调度和镜头轨迹的模板,直接套用就比自己攒词靠谱得多。
分类的价值不仅在于归类,更在于暴露出不同类别的重灾区。人物叙事类里,重灾区是手部畸变;动作节奏类里,重灾区是运动模糊过度;概念幻想类里,重灾区是主体与背景的比例失衡。知道这些,就可以在Skill里提前内置对应的负面提示语。
2.2 从画面到提示语的“翻译”方法
拆解一个视频,最核心的动作是“把视觉信息翻译成文本信息”。这需要一定的摄影语言基础,也需要对AI生成模型的提示语逻辑有理解。
我设计了一套五维拆解框架,每个视频都按这五个维度提取关键词:
- 主体与属性维度:主体是什么(人/物/生物/抽象形态),颜色、材质、姿态、数量、朝向。
- 场景与环境维度:室内还是室外、宏观还是微观、时代背景、地域特征、天气与光照。
- 镜头与运动维度:机位高度、焦段感、运动方式(推/拉/摇/移/跟/升)、运动速度、是否有手持感。
- 光影与色彩维度:光源方向、光源色温、反差度、色调节奏、是否有体积光或丁达尔效应。
- 氛围与叙事维度:情绪基调、时间感、故事暗示、留白程度、艺术流派风格。
这套框架在反推时非常管用。举一个真实案例:有一段40秒的AI视频,画面是沙漠中一个半透明的人形发光体在缓慢行走,镜头绕主体做圆周运动,光随时间从暖黄变为冷蓝。翻译出来的提示语核心部分就是:
A translucent luminous humanoid figure walking across desert dunes, volumetric glow, circular camera orbit around the subject, slow motion, warm amber lighting transitioning to cool blue, cinematic composition, atmospheric depth, lonely and mysterious mood, 4k detail加上负面提示语后,这个模板在测试中生成的成功率相当稳定。所谓稳定,是指主体不变形、光效不爆破、镜头运动不跳轴这三个关键点都能被控住。
2.3 我提炼出的三类核心套路
拆完463个视频后,我发现在提示语层面存在大量重复的思想,压缩掉表象差异,最后剩下三类核心套路:
第一个是“场景先置法”。在提示语开头就把场景和光线完全确定,再往里放主体。很多AI视频提示语写不好,就是因为主体提前入场,场景才描述到一半,模型只能靠猜补全环境。场景先置法可以显著减少背景漂移和前后不一致。
第二个是“镜头动词后半置法”。把镜头运动描述放在提示语的后半段。一开始就写镜头运动,会让模型过早生成运动模糊和透视变化,导致主体细节丢失。放在后半段,模型会先把主体和场景固化,再叠加运动信息,实测生成的画面更扎实。
第三个是“情绪词锚定法”。在氛围维度里固定一个情绪词,比如孤独、克制、惊讶、压抑,并给出明确的视觉对应物。因为AI模型理解情绪词比理解抽象概念更直接。比如写“孤独感”,模型可能给出空旷场景;写“孤独感,人物背对镜头,远处只有一盏灯”,模型基本能锁定构图。
3. Skill与提示语模版的制作过程
从拆解到成品,中间隔着大量设计与测试工作。463个视频最终凝练出的不是463条提示语,而是一套有层级、有上下文、可组合的Skill框架。如果只输出一堆零散提示语,那这东西根本不算开源工具,充其量是一份词表。
3.1 技能定义与文件结构设计
我设计Skill文件时,参考的是主流AI Agent技能配置的惯例,用纯文本和结构化字段来描述。每个Skill目录下包含三个核心文件:SKILL.md用于描述使用场景,template.md存放提示语模板,params.json存放参考参数。
SKILL.md的核心是场景说明。它告诉使用者,这个Skill适合生成什么类型的视频、什么时候不要用它、需要额外准备哪些素材。这个文件在自动化工作流里非常重要,因为Agent可以读它来判断是否套装当前任务。
template.md是核心资产。它内部包含三类提示语片段:基础片段、增强片段和负面提示语片段。基础片段负责定义主体与场景;增强片段根据使用者想要的变化叠加风格;负面提示语片段专门用来压制常见畸变。
params.json则存放生成视频时可参考的模型参数。这部分我标得很克制,因为不同模型暴露的参数差异很大,我只保留了通用的项目,比如时长建议、运动强度、宽高比、风格一致性权重等。
下面是一个真实Skill文件的结构展示:
skill/fantasy_world/water_elf/ ├── SKILL.md ├── template.md └── params.jsonSKILL.md里写清适用条件是“水下场景、奇幻人物、透明材质”,不适用条件是“需要写实水下摄影、需要快速动作”。template.md里给出完整提示语组合,并在备注里解释每一段的作用。params.json则给出一组中等运动强度下的参考值。
这种文件结构的好处是傻瓜化。即使是完全没看过我拆解过程的用户,只要读一遍SKILL.md,就知道这个Skill是干什么的;再看一遍template.md,就能直接替换主体关键词去生成。
3.2 提示语模版的层级设计
我在制作提示语模板时,没有做成“一行掉到底”的单一格式,而是分成四个层级,方便不同程度的使用者按需取用。
第一层是极简模板,只包含主体、场景、风格三个核心变量,适合完全的新手。比如想生成雨夜都市,模板就是“雨夜都市,霓虹倒映,电影质感”。这层模板保证下限,但不需要使用者有太多知识。
第二层是结构模板,在极简模板基础上补充镜头运动和光影方向。让画面从静态描述变成有调度感的视频。适合有一定基础、但还没有系统的用户。
第三层是分镜模板,将一段视频拆成多个镜头,每个镜头给独立的提示语,同时标注镜头之间如何通过主体和光线保持一致。适合想做出完整叙事视频的人。
第四层是参数化模板,模板里变量以占位符方式存在,使用者在调用前替换关键词即可。这层才是真正用于量产和自动化的模板,也是Skill文件的主力形态。
我强烈建议初学者不要一上来就用第四层。我见过太多人拿着复杂模板去生成,结果变量替换错了一个位置,画面就崩了,然后反过来怀疑模板有问题。先用第二层,观察输出效果,再逐步加变量,这是最稳的路径。
3.3 模板效果测试的量化标准
模板不是“感觉差不多”就行,我给每个模板设定了一套简单的量化测试标准。别小看这一步,只有可量化,才能判断一个新模板是否配进入Skill库。
我的测试标准有四项:
- 主体一致性:同一模板连续生成5次,主体形态不出现明显变形的次数不低于4次。
- 场景可视度:画面中关键场景元素能被肉眼清晰识别的次数不低于4次。
- 镜头合理性:镜头运动不出现跳轴、倒退、突然缩放等异常的次数不低于3次。
- 指令完整度:生成结果中能看到提示语里提到的70%以上核心元素。
任何一个新模板,如果达不到上述标准,我不会放进正式目录,只会留在待优化区。这套测试标准虽然粗糙,但对筛选模板非常有效。实际上,在我做Skill的过程中,第一批做出来的200条模板里,真正达标的只有不到一半。这说明“有人发出来效果很好”和“可稳定重现”之间还有很大的鸿沟。
这也是为什么我一直强调,开源Skill的价值不在于提示语词汇有多华丽,而在于每一句提示语都经过重复测试和稳定性验证。华丽的词谁都会堆,稳定地出片才是功夫。
4. 开源内容怎么用:Skill、提示语模版配合工作流
仓库开源后,很多人问我同一个问题:这些东西到底怎么用?答案分两个层次:单条模板直接抄,Skill搭配工作流自动跑。两种方式我都验证过,下面把流程和效果分别说清楚。
4.1 单条提示语模版的直接使用方式
如果你只是想快速生成一条AI视频,不进自动化流程,最简单的做法,就是从仓库的模板目录里找对应场景,把变量替换成自己的内容,然后粘到AI视频生成工具里。
以“场景漫游类”的一条航拍模板为例,原模板长这样:
低空航拍视角,穿越峡谷,刀锋般狭窄岩壁,晨雾弥漫,阳光从东侧斜射,运动速度中等,画面纵深强烈,色调偏冷青,写实地理纪录片风格如果我想做成秋天的峡谷,只需要把“晨雾弥漫”改成“薄雾与金黄落叶”,“偏冷青”改成“偏暖橙黄”。其他结构不动。这种替换方式哪怕完全不懂提示语结构的人也能操作,因为模板里的每个词都是独立的视觉单元。
需要提醒的是,初次使用时,先保持模板原样生成一次,再替换一个变量生成一次,然后对比两次输出。这么做能在几分钟内摸清这个模板的敏感点。有的模板对光线方向非常敏感,改一个词画面质感天翻地覆;有的模板对主体材质更敏感,改光线反而影响不大。这些规律只有通过对比才能找到。
4.2 基于Skill的半自动化视频生产流程
如果你要批量产视频,比如做短视频矩阵或者做系列化内容,单条手改模板就太慢了。这就需要把Skill接入工作流,实现半自动生产。
我实际验证过的流程是这样:先写一个任务描述,比如“用赛博朋克风格生成5个人物近景镜头,每个镜头侧重不同情绪”,然后把它交给支持Skill调用机制的AI工作台。工作台读取Skill库后,自动匹配“人物叙事类”下的近景情绪子类,从template.md中选取适合的模板,替换参数后,按顺序生成视频片段,最后由人工挑选可用的出片。
这个过程里,人只需要控制两件事:方向和筛选。方向就是给任务描述划定边界,筛选就是对AI生成的结果做质量验收。其他重复劳动全部交给自动化流程。
我在测试中还做到过一个更细的点:把参数化模板里的情绪词设计成枚举值。比如人物近景中,情绪词可以在平静、警觉、悲伤、克制、欣喜五个选项里切换。工作流会根据任务描述自动抽取情绪词,塞进模板对应位置。这一下就让批量视频之间的差异度大幅提升,不会出现十段视频表情全都一样的问题。
仓库里Skill和模板的关系可以这样理解:模板是“单发子弹”,Skill是“枪身后再加一套快速装填系统”。单发子弹适合手动点射,Skill则支撑了一种可重复、可扩展的生成模式。
5. 踩坑实录与常见问题排查
做这个项目的两个多月里,最大的收获不是最后那套Skill库,而是踩坑踩出来的经验。下面这几条问题是我在开发、使用和开源维护中反复遇到的,写下来,希望能帮后面的人少走点弯路。
5.1 提示语“过拟合”问题
所谓过拟合,就是模板在测试集里效果很好,一旦换了一个相似但不完全相同的场景,立刻失灵。最典型的例子:我早期做了一套“人物雨夜回头”的模板,在原场景测试中效果惊艳,但使用者换成“人物雪夜回头”之后,生成画面里雪花的形态非常奇怪,像白色噪点。
排查后发现,问题不是出在“雪”这个词上,而是模板里隐含了一套雨滴运动逻辑,比如“条纹状下落”“湿润的街道反光”。这些元素对雨夜很合理,但对雪夜完全是干扰,模型被这些残留词带偏了方向。
解决办法,是把模板里高度依赖特定环境的词拆出来,单独做成增强片段,而不是写死在基础模板中。基础模板只保留主体、动作、镜头等通用结构;特殊环境词交给使用者按需添加。这套改造之后,过拟合发生率大幅下降。这也是我在仓库里坚持把“基础片段”和“增强片段”分开的原因。
5.2 版权与伦理边界处理
463个视频来自大量创作者,我不能直接把原片打包进仓库。我的处理原则是:只开源提示语框架和提炼出的通用规则,不包含原视频文件,也不包含原视频里识别度极高的独特角色外观。遇到那些有明确IP属性的形象,我直接跳过,绝不让Skill库成为抄袭工具。
这里要特别说明一点:提示语本身是否受版权保护目前在业界还有讨论,但我的原则是尽量做“风格规律的抽象”,而不做“具体创意的复刻”。举个简单的例子,我可以提炼“赛博朋克雨中街头,霓虹反射,慢速推近”的通用模板,但不会把某个创作者独创的、带独特角色名和独特世界观设定的提示语原样收进来。
开源项目一旦分发出去,使用者做了什么,项目方是管不住的。我能做的,是让仓库里的每一份内容在源头就尽可能干净。这一点我写在仓库的显眼位置,希望所有使用者都能抱着“学习规律”而不是“抄袭成品”的心态来用。
5.3 开源维护中的常见反馈与修正
开源后收到的反馈里,最高频的一类是“部分模板在本地模型上效果不好”。排查下来,绝大多数情况不是因为模板写得差,而是本地模型和在线模型的参数响应机制不同。比如某个动作节奏类模板针对在线模型调试时,运动强度设为5,但本地模型对运动强度的响应曲线完全不同,照搬5就出现运动过度。
针对这个问题,我在params.json里额外增加了一个说明字段,标注每个参数是在什么模型条件下测试的。使用者如果换了模型,需要先小幅度调整运动强度和光影相关参数。项目管理上的经验是:在这种跨模型兼容性问题出现之前,就直接在文档里预设“换模型必读”一节,能省掉大量重复问答。开源项目不是把文件丢出去就完了,文档里写清楚边界条件,才是最负责任的做法。
另一个常见反馈是模板数量太多,新手不知道从哪里开始。我采取的修正办法,是在仓库根目录添加了一个“新手入口”文件,把36个经过最多轮测试、稳定性最高的模板标为推荐模板。新人只需要先跑这36个模板,建立手感,再按兴趣深入其他目录。一个合理设计的新手路径,能显著降低开源项目的使用门槛。
6. 实操心得与后续想做的事
项目做到这份上,最值得说两句的,反而是那些看似不起眼的个人体会。
6.1 我在实际使用中的几点真实体会
第一,模板库永远赶不上真实世界的多样性。463个视频听起来不少,但覆盖不了所有风格。与其奢望“一个模板打天下”,不如把精力放在理解模板结构上。结构理解了,面对任何新风格都能自己补模板。
第二,反推提示语最锻炼人。做这个项目的过程中,我的提示语能力提升最快,不是因为看了多少教程,而是因为反复“从画面到文字”的训练,让我对每个视觉元素和语言表达之间的对应关系形成了条件反射。如果你也想提升提示语水平,最快的方法不是背模板,而是找10个视频,逼自己反推,再对比生成结果,这个训练比任何课程都有效。
第三,做开源项目最忌讳闭门造车。我的初版Skill库其实是按自己的审美偏好设计的,内部测试很顺畅,但外部使用者一上手,就暴露出“部分场景无匹配模板”“参数说明不够清晰”的问题。后来我改了工作方式,每完成一个目录就丢给几个朋友试用,收集反馈后再调优。开源项目本质上是一个持续交互的过程,而不是一次性的发布。
6.2 后续可能的扩展方向
接下来的计划,是继续做两件事。一是把Skill库扩展到更多风格分类,特别是现在很多人在尝试的中国风、水墨动画、复古胶片方向,这些是我目前应收录量还不足的领域。二是把提示语模板和主流AI视频工具的操作流程做更细的绑定,让模板库直接适配到具体工具的窗口界面里,降低复制粘贴的成本。
这次开源的全部Skill文件和提示语模板,我都会持续维护,也欢迎有相同方向研究的人在仓库里提交问题和改进建议。我最期待的不是下载量,而是看到有人基于这套结构,做出比我更好的Skill分层方法和视频出片效果。那样的话,这个项目才算真正发挥了它应有的价值。