Working Draft · AI Era Execution Security Language
This article is part of the Havenlon Execution Security Language project.
The terminology and definitions presented here describe the current
working draft and may evolve as the discipline matures.AI 时代执行安全语言体系(工作草案)
本系列旨在建立 AI 时代执行安全的共同语言。
本文中的术语与定义代表当前工作草案,
将随着理论研究、工程实践和社区讨论持续修订
14. Agent Authority|智能体权力
一句话定义
智能体权力,是 Agent 能够提出、选择、请求或实际触发动作的能力范围。
严格定义
Agent Authority 必须拆分为:
- 提议权;
- 读取权;
- 规划权;
- 工具选择权;
- 工具请求权;
- 有限自主执行权;
- 治理参与权;
- 恢复权。
这些权力不能混为一体。
例如,一个 Agent 可以:
- 读取告警;
- 生成修复方案;
- 提议重启服务;
但不一定有权:
- 直接重启生产集群;
- 修改管理员权限;
- 关闭安全控制;
- 增加自己的工具权限。
上位概念
- Execution Authority
- Delegated Authority
下位概念
- Agent Proposal Authority
- Agent Tool Authority
- Agent Execution Authority
- Agent Governance Authority
- Agent Recovery Authority
相关概念
- Tool Permission
- Delegated Execution
- No Unilateral Catastrophic Authority
- Authority Inheritance
- Scope Limit
权力边界
Agent 权力必须是有限、可撤销、不可自动扩张且不可无条件传递的。
约束机制
- 权力拆分;
- 最小权限;
- 非传递授权;
- 时间限制;
- 对象限制;
- 高风险转治理;
- 权力变更留证。
结果目标
让 Agent 能够完成任务,但无法将任务能力扩张为系统主权。
在 Havenlon 中
Agent 默认拥有 Proposer 权力,只有低风险预授权槽位提供有限执行能力。
15. Agent Identity|智能体身份
一句话定义
智能体身份,是用于区分某个 Agent 实例、角色、模型、部署环境和权限主体的可验证身份。
严格定义
Agent Identity 可以包含:
- agent_id;
- agent type;
- model version;
- deployment;
- owner;
- organization;
- role;
- credential;
- tool scope;
- runtime environment;
- current policy;
- lifecycle state。
系统必须区分:
- 用户身份;
- Agent 身份;
- 代表用户行动的委托关系;
- Agent 使用的服务账户;
- 工具底层凭证。
不能把 Agent 的所有动作都归因于拥有者本人。
上位概念
- Identity
- Machine Identity
下位概念
- Agent Instance Identity
- Agent Role Identity
- Model Identity
- Runtime Identity
- Delegated Agent Identity
相关概念
- Agent Authority
- Intent Origin
- Service Account
- Device Identity
- Evidence Chain
权力边界
Agent 不能使用用户或管理员的长期身份直接执行所有动作,也不能在多个 Agent 之间共享不可区分的凭证。
约束机制
- 独立凭证;
- Agent ID;
- 工作负载身份;
- 短期 Token;
- 工具作用域;
- 实例证据;
- 权限撤销。
结果目标
让每个机器发起动作能够追溯到具体 Agent,而不是只显示“系统执行”。
在 Havenlon 中
Agent Identity 进入 Proposal Evidence,并与委托者身份和 Execution Intent 分开记录。
16. Agent Intent|智能体意图
一句话定义
智能体意图,是 Agent 根据目标和上下文生成的、希望系统执行的结构化动作表达。
严格定义
Agent Intent 必须与以下内容区分:
- 用户原始目标;
- Agent 对目标的解释;
- 当前上下文;
- Tool Call;
- 最终 Payload。
例如,用户目标可能是:
解决这个客户问题。
Agent Intent 可能被具体化为:
向客户账户退款 500 元。
随后 Tool Payload 可能是:
refund(account_x, amount=500)安全系统必须验证:
- Agent 的具体化是否合理;
- 金额是否符合授权;
- 对象是否正确;
- 当前上下文是否完整;
- 是否需要人工确认;
- 最终 Payload 是否仍等于该 Intent。
上位概念
- Execution Intent
- Machine-Initiated Intent
下位概念
- Agent-Proposed Intent
- Agent-Derived Intent
- Agent-Revised Intent
- Multi-Agent Intent
相关概念
- Human Intent
- Intent Drift
- Context Injection
- Tool Calling
- Intent Binding
权力边界
Agent 对用户目标的解释不能自动成为不可逆执行事实。
约束机制
- Intent 结构化;
- 目标来源引用;
- 语义摘要;
- 金额与对象显式化;
- IntentHash;
- 高风险重新确认;
- 最终绑定。
结果目标
把模型的开放式推理结果收敛为可验证、可审批和可拒绝的具体动作。
在 Havenlon 中
Agent 输出必须先转换为标准 Execution Intent,不能把自然语言推理直接送给 Executor。
17. Agent Hallucination|智能体幻觉
一句话定义
智能体幻觉,是 Agent 生成了不受事实支持、错误、不完整或虚构的判断、参数、状态或行动依据。
严格定义
Agent Hallucination 可能影响:
- 对象;
- 金额;
- 时间;
- 身份;
- 工具能力;
- 系统状态;
- 执行结果;
- Policy;
- 用户授权;
- 外部事实。
在纯内容场景中,幻觉可能产生错误回答。
在执行场景中,幻觉可能变成:
- 错误 Tool Call;
- 错误参数;
- 错误目标;
- 不必要执行;
- 重复执行;
- 虚假成功判断;
- 错误恢复动作。
上位概念
- Model Error
- Agent Risk
下位概念
- Parameter Hallucination
- State Hallucination
- Permission Hallucination
- Tool Hallucination
- Result Hallucination
相关概念
- Semantic Gap
- Tool Misuse
- Final Revalidation
- Fact Source
- Execution Drift
权力边界
模型输出不能被视为事实来源,也不能因为置信表达强烈而获得执行资格。
约束机制
- 外部事实验证;
- 结构化字段;
- 对象白名单;
- 参数上限;
- Tool Schema;
- 独立 Policy;
- 执行前重新验证。
结果目标
让模型错误停留在候选判断阶段,而不是直接成为现实动作。
在 Havenlon 中
Agent 的判断只作为 Proposal 输入,事实和执行条件由独立系统重新验证。
18. Prompt Injection|提示注入
一句话定义
提示注入,是攻击者通过输入内容影响 Agent 的指令理解、目标优先级、工具选择或执行行为的攻击方式。
严格定义
Prompt Injection 可以来自:
- 用户输入;
- 网页;
- 邮件;
- 文件;
- 数据库内容;
- 工具返回;
- 其他 Agent;
- 长期记忆;
- RAG 文档;
- 外部 API。
攻击内容可能诱导 Agent:
- 忽略系统指令;
- 泄露信息;
- 调用高风险工具;
- 修改执行目标;
- 扩大作用域;
- 伪造审批;
- 隐藏行为;
- 执行攻击者指定动作。
Prompt Injection 的核心危险不是“模型被说服”,而是:
被污染内容是否能够穿过 Agent,获得真实执行能力。
上位概念
- Adversarial Input
- Context Attack
下位概念
- Direct Prompt Injection
- Indirect Prompt Injection
- Tool-Result Injection
- Memory Injection
- Cross-Agent Injection
相关概念
- Context Injection
- Tool Misuse
- Polluted Intent
- Legitimate-Path Abuse
- Tool Execution Boundary
权力边界
外部文本不能因为进入 Agent 上下文,就自动改变执行 Policy、工具权限或治理状态。
约束机制
- 内容与指令分离;
- 不信任外部上下文;
- 工具权限外置;
- 高风险 Intent 显式化;
- 独立审批;
- Payload Binding;
- 最终硬件拒绝。
结果目标
让提示注入最多影响 Agent 的候选输出,不能直接继承成最终执行权。
在 Havenlon 中
即使 Agent 被注入并生成恶意 Tool Call,最终仍需经过独立 Execution Intent、Policy 和本地执行边界。
19. Context Injection|上下文注入
一句话定义
上下文注入,是攻击者或异常系统将误导性、伪造、过期或恶意信息加入 Agent 上下文,从而改变其判断和执行计划。
严格定义
Context Injection 比 Prompt Injection 更广。
它可以包括:
- 伪造业务状态;
- 污染记忆;
- 修改检索结果;
- 插入虚假审批;
- 返回恶意工具结果;
- 提供过期 Policy;
- 伪造用户意图;
- 隐藏关键限制;
- 篡改历史事件。
Agent 可能并未违反任何显式提示,却基于错误上下文得出危险结论。
上位概念
- Context Pollution
- Adversarial Context
下位概念
- Memory Injection
- RAG Injection
- Tool Output Injection
- State Injection
- Identity Context Injection
相关概念
- Polluted Context
- Agent Intent
- Context Integrity
- Prompt Injection
- Fact Source
权力边界
Agent 上下文不能作为治理、Policy、身份和执行事实的唯一来源。
约束机制
- 来源标记;
- 数据签名;
- 事实分层;
- 新鲜度;
- 多源核验;
- Context Binding;
- 最终本地状态。
结果目标
阻止被污染的上下文直接决定不可逆执行。
在 Havenlon 中
关键治理、Policy 和执行状态从受验证来源读取,而不是只相信 Agent 当前上下文。