☰
解码 Gemini 2.5 Pro 系统提示词:Immersive 输出协议、工具调用与代码生成规则全解析
2026/9/30 13:57:37 网站建设 项目流程
  • 知识库
  • 人工智能
  • AI 安全治理

【免费下载链接】CL4R1T4S

LEAKED SYSTEM PROMPTS FOR CHATGPT, CLAUDE, GEMINI, GROK, PERPLEXITY, CURSOR, LOVABLE, REPLIT, AND MORE! - AI SYSTEMS TRANSPARENCY FOR ALL! 👐

项目地址:https://gitcode.com/gh_mirrors/cl/CL4R1T4S
点击查看免费下载

本文以 CL4R1T4S 仓库收录的 GOOGLE/Gemini-2.5-Pro-04-18-2025.md(标注为 Gemini 2.5 Pro、2025-04-18 提取的系统提示词)为骨架,逐段拆解 Gemini 的响应决策机制、Canvas/Immersive 文档协议、HTML/React/游戏代码生成规范以及工具调用 API 签名。读完本文,你将能完整复刻这套提示词约束的解析方法,理解 Gemini 在"对话"与"沉浸式文档"之间的切换逻辑,并掌握其代码产物在结构、样式、可运行性上的全部硬性要求。

一、文档背景:透明化仓库中的一份 Gemini 系统提示词

CL4R1T4S 是一个以"AI 系统透明化"为宗旨的公开仓库,正如其 README.md 所述,它收集了 OpenAI、Google、Anthropic、xAI 等多家厂商模型的完整系统提示词,核心理念是"要信任输出,就必须理解输入"。本篇文章所依据的 GOOGLE/Gemini-2.5-Pro-04-18-2025.md 正是其中 Google 目录下的三份 Gemini 相关文档之一,另外两份分别是:

  • GOOGLE/Gemini_Diffusion.md:Google 训练的文本扩散模型 Gemini Diffusion 的系统提示词,明确了其"非自回归"生成方式与 2023 年 12 月的知识截止时间;
  • GOOGLE/Gemini_Gmail_Assistant.txt:面向 Gmail 场景的邮件写作助手提示词,展示了针对邮件线程上下文的专门化约束。

本文聚焦的这份文档展示了 Gemini 在通用对话产品中的完整行为框架,其内容可划分为五个层次:身份定义、输出块机制、双模式响应决策、Immersive 文档协议(含代码规范与强制规则)、以及工具代码可用的 Python 库与工具 API。

二、身份定义与核心输出机制:thought / python / tool_code 三种块

文档第一行即定义了 Gemini 的身份:"You are Gemini, a large language model built by Google."。在此基础上,Gemini 的回复机制围绕三种可输出块(block)展开:

  1. thought:用于规划后续块的内容。在输出其他块之前,Gemini 先用thought块进行内部规划:
...
  1. python:向虚拟机发送 Python 代码,用于执行计算、生成数据可视化、创建文件或其他代码产物:
...
  1. tool_code:向虚拟机发送 Python 代码以调用工具,工具的 API 会在提示词后半部分给出:
...

这一机制的关键在于"块(blocks)"的语义:Gemini 的最终回复由若干块拼接而成,文本、思考、代码执行分别对应不同的块类型。从实现层面看,这决定了 Gemini 在代码任务中必须"先规划、再执行、后成文"的过程序;thought块是透明的推理过程,python/tool_code块则是与外部执行环境交互的通道。理解这一点,有助于你在阅读 Gemini 生成的回复时区分"推理内容"与"可执行内容"。

三、双模式响应决策:Chat 与 Canvas/Immersive Document

Gemini 根据用户需求的性质,在两种响应模式间做决策:

模式适用场景特征
Chat(对话)简短交流、简单澄清/Q&A、确认、是/否类回答直接文本回复,无额外结构
Canvas/Immersive Document(沉浸式文档)内容密集型回复,预期会被用户编辑/导出/分享使用<immersive>标签包裹的结构化内容

进入 Immersive 模式的典型场景包括:写作评审(critiques)、代码生成(所有代码必须放入 immersive)、文章/故事/报告/解释/摘要/分析、Web 应用/游戏(始终 immersive)、任何需要迭代编辑或复杂输出的任务。

需要特别注意的是,文档中标注了 "Canvas/Immersive Document",并明确提示用户可能以多种名称称呼这一功能——"Immersives"、"Documents"、"Docs"、"Preview"、"Artifacts" 或 "Canvas"。这与 Anthropic 生态中的 Artifact 概念(见 ANTHROPIC/CLAUDE-OPUS-5.5.md 中 Artifact 工具对"发布/读取/更新"能力的描述)在思路上高度一致:都要求把"需要编辑、导出或分享的内容"与"对话内短文本"区分开,并赋予内容独立的容器与生命周期。

3.1 Immersive 文档的两种类型与属性规范

Immersive 文档使用纯文本标签(plain text tags)声明类型,共两种:

  • Text/Markdown 类型:
<immersive> id="{unique_id}" type="text/markdown" title="{descriptive_title}" {content in Markdown} </immersive>
  • Code 类型(HTML、JS、Python、React、Swift、Java 等):
<immersive> id="{unique_id}" type="code" title="{descriptive_title}" ```{language} `{complete, well-commented code}`
```

属性规范:

  • id:简洁、与内容相关;更新已有文档时复用同一个 id,新建文档则使用新 id;
  • title:清晰描述内容;
  • React 代码使用react语言标识,所有组件与代码必须放在同一组 immersive 标签内,主组件以默认导出(通常命名为App)。

文档同时给出了一份 Immersive 文档内容的标准三段式模板:Introduction(引言,用友好、口语化的"我/我们/你"口吻,不谈代码细节、不提 Markdown 格式)→ Document(文档正文)→ Conclusion & Suggestions(结论与建议,代码场景下给出后续改进方向,更新文档时列出关键变更)。

3.2 更新与编辑规则

用户可以对沉浸式文档提出修改请求,Gemini 需使用同一个 id输出更新后的新文档;新建文档请求则使用新 id;除非用户明确指示,否则必须保留用户在内容块中的编辑成果。这一机制赋予了 Immersive 文档"可协作、可版本化"的属性。

四、代码专属指令:HTML 与 React 的完整规范

这是文档中篇幅最大、约束最细的部分,直接决定了 Gemini 产出网页与 Web 应用时的质量基线。

4.1 HTML 规范

  • 美学优先:视觉惊艳、高度打磨、对移动端友好,圆角应用于所有元素;
  • Tailwind CSS 独占:除游戏外,只允许使用 Tailwind 工具类做样式,通过<script src="https://cdn.tailwindcss.com"></script>加载;
  • 字体:默认使用 "Inter";游戏使用 "Monospace",街机游戏使用 "Press Start 2P";
  • JS 库白名单:three.js(3D)、d3(可视化)、tone.js(音效,禁止外部音效 URL);
  • 禁止alert():改用消息框(message box);
  • 图片 URL 兜底:提供 fallback(如onerror属性、占位图),禁止 base64 图片;占位图格式为https://placehold.co/{width}x{height}/{bg hex}/{text hex}?text={text};
  • 内容充实:网页需包含详细内容或 mock 内容,并添加 HTML 注释;
  • React 的其余限制:单一 immersive 内自包含完整代码,主组件默认导出为App,使用函数组件、hooks 与现代模式,Tailwind 视为可用无需 import。

4.2 React for Websites and Web Apps 规范

  • 完整、自包含的代码位于单个 immersive 内;
  • 游戏图标使用 font-awesome(如棋盘车、皇后)、phosphor icons(如吃豆人幽灵),或内联 SVG 创建;
  • lucide-react:用于网页图标,需验证图标可用性,必要时使用内联 SVG;
  • shadcn/ui:用于 UI 组件,图表用recharts;
  • 状态管理:优先 React Context 或Zustand;
  • 禁止ReactDOM.render()或render();
  • 导航:多页面应用使用 switch case 实现,不使用 router 或 Link;
  • 链接:使用标准 HTML 格式<script src="{https link}"></script>;
  • 禁止 CLS(Cumulative Layout Shift):必须确保无累积布局偏移。

4.3 通用代码规范(所有语言)

  • 完整性:包含所有独立运行所需的代码;
  • 注释:解释一切(逻辑、算法、函数头、区块),要详尽;
  • 错误处理:使用 try/catch 与 error boundaries;
  • 禁止占位符:绝不使用...。

4.4 强制规则(MANDATORY RULES)

文档用全大写强调了一组不可违背的硬性规则,违反会造成 UI 问题:

  • Web 应用/游戏必须始终放在 immersive 中;
  • 所有代码必须始终放在 type 为 code 的 immersive 中;
  • HTML 的美学至关重要;
  • immersive 标签之外不得出现代码(简短解释除外);
  • immersive 内的代码必须自包含且可运行;
  • React:一个 immersive 容纳所有组件;
  • 必须始终同时包含开闭的 immersive 标签;
  • 不得向用户提及 "Immersive" 一词;
  • 代码必须包含大量注释。

五、工具代码可用的 Python 库与工具 API 签名

文档后半部分给出了 Gemini 在执行tool_code时可直接使用的 Python 库清单及完整 API 签名,这是理解 Gemini 工具编排能力的核心证据:

通用 Python 库:

import datetime import calendar import dateutil.relativedelta import dateutil.rrule

新增工具库(按 API 签名原样收录):

  1. google_search——搜索 API,包含PerQueryResult(index、publication_time、snippet、source_title、url 字段)与SearchResults(query、results 字段)两个 dataclass,search()函数支持单个query或多个queries,返回list[SearchResults]。

  2. extensions——扩展 API,核心是一个Status枚举(当前仅UNSUPPORTED值),UnsupportedError携带 message、tool_name、status、operation_name、parameter_name、parameter_value、missing_parameter 等结构化错误字段;log()用于记录不支持的错误,search_by_capability(query)与search_by_name(extension)用于按能力或名称查找扩展。

  3. browsing——浏览 API,browse(query, url) -> str接受查询与 URL 并返回页面内容。

  4. content_fetcher——内容获取 API,SourceReference(id、type 字段)用于引用来源,fetch(query, source_references) -> str基于来源引用列表获取内容。

文档明确说明:除上述库外,还可以通过extensions.search_by_capability或extensions.search_by_name查找 API 描述后再使用其他库。这一"先查 API 描述、后调用"的机制,是 Gemini 在运行环境内动态发现工具能力的典型设计,与 GOOGLE/Gemini_Diffusion.md 中"你无法实时浏览互联网、访问外部文件或数据库"的约束形成互补——普通 Gemini 对话受限,而带工具代码的执行环境则获得搜索、浏览、抓取、扩展四大类能力。

六、附加指令:游戏的生成规则

在"文档生成附加指令(Additional Instructions for Documents)"中,游戏(Games)拥有独立的一套规则:

  • 技术栈:优先使用 HTML、CSS 和 JS 做游戏,除非用户明确要求 React;
  • 可玩性至上:以国际象棋为例,所有棋子必须在棋盘上且遵循走子规则,用户必须能真正玩起来;
  • 按钮样式:为游戏按钮添加阴影、渐变、边框、气泡效果等,布局居中且有足够边距与内边距;
  • 街机字体:使用 Press Start 2P 或 Monospace,并在代码中加载 Google Fonts 链接;
  • 按钮位置:放在游戏画布之外,底部中央或顶部中央一行,有足够的边距与内边距;
  • 禁用alert():改用消息框;
  • SVG/Emoji 资产(强烈推荐):优先用 SVG 代替图片 URL(如用小行星的 SVG 轮廓而非图片),简单元素可用 Emoji;
  • 样式要求:自定义 CSS,动画与过渡营造流畅效果,排版清晰、对比明确,视觉主题与游戏契合(像素艺术、渐变、动画),画布适配屏幕宽度且随窗口缩放可调整;
  • 3D 模拟:使用 three.js(cdnjs 的 r128 版本),禁止用textureLoader.load('textures/neptune.jpg')之类加载图片,改用简单生成形状与颜色;支持鼠标拖拽(mousedown、mouseup、mousemove 事件)切换相机角度;Cannon.js 可用于物理模拟;动画循环必须在window的onload事件之后启动。

七、协作环境与预览机制

文档末尾描述了 Gemini 所处的产品协作环境:左侧是聊天框,右侧是文档或代码编辑器,Immersive 的内容显示在编辑器中,文档/代码可被用户和 Gemini 双方编辑,形成协作式环境。编辑器还提供标注为 "Preview" 的预览按钮,可预览 React 与 HTML 代码。用户可能把 Immersive 称作 "Documents"、"Docs"、"Preview"、"Artifacts" 或 "Canvas"。

此外有一条实用的故障恢复指令:如果用户反复反馈应用或网站无法工作,则从头开始、换一种方式重新生成代码。这条规则提示我们:在代码产物类任务中,遇到持续性失败时应主动重构生成路径,而非在错误代码上打补丁。

八、跨厂商对照:Gemini 提示词在产品谱系中的位置

将本文件与仓库中其他厂商的系统提示词对照,可以更清晰地看出各家的设计取向:

  • Anthropic(ANTHROPIC/CLAUDE-OPUS-5.5.md)的 Artifact 工具同样要求"页面内容发布为独立产物",并围绕发布、读取、更新、删除、固定等动作建立了完整生命周期,与 Gemini 的 immersive 协议功能对位;
  • OpenAI(OPENAI/ChatGPT_4o_04-25-2025.txt)则以bio、python、web、guardian_tool等工具集展开,强调记忆开关、Jupyter 执行环境与网页检索;
  • Google 自家的 GOOGLE/Gemini_Diffusion.md 属于非自回归的文本扩散模型,其 HTML 规范(Tailwind 独占、Inter 字体、Lucide 图标、CLS 预防)与本文件高度同源,可推断这是 Google 系产品线的通用前端约束模板。

九、结语:这份提示词告诉我们的三件事

第一,Gemini 的产品化输出遵循"对话短文本 + Immersive 富文档"的二分法,所有可编辑、可导出的内容都被强制封装进带 id 的容器,这既是 UI 约束,也是可协作内容管理的底层协议。第二,代码产物的规范极其具体——从 Tailwind 独占、字体选择、库白名单,到禁止alert()、禁止占位符、强制注释与错误处理,构成了一套可照搬的"可运行网页/应用质量基线"。第三,工具编排通过明确的 Python API 签名(google_search、extensions、browsing、content_fetcher)实现,且支持运行时按能力动态发现扩展,这为逆向理解 Gemini 的 Agent 能力边界提供了直接依据。对研究系统提示词与构建类 Gemini 交互产品的开发者而言,这份文档是理解其"如何被约束、如何被指挥"的第一手资料。

  • 知识库
  • 人工智能
  • AI 安全治理

【免费下载链接】CL4R1T4S

LEAKED SYSTEM PROMPTS FOR CHATGPT, CLAUDE, GEMINI, GROK, PERPLEXITY, CURSOR, LOVABLE, REPLIT, AND MORE! - AI SYSTEMS TRANSPARENCY FOR ALL! 👐

项目地址:https://gitcode.com/gh_mirrors/cl/CL4R1T4S
点击查看免费下载
上一篇:使用 dlt 验证源加载 Pipedrive CRM 数据:从初始化、配置到自定义管道的完整指南
下一篇:基于 Go 的 SAML 2.0 单点登录实践:crewjam/saml 库与 samlsp 中间件深度解析

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询