第八篇:世界模型的安全、评测与终局——Physical AI 如何真正走向生产
一、世界模型最大的风险是“看起来正确”
语言模型的错误通常表现为一句错误答案,世界模型的错误可能转化为一次真实动作。
最危险的情况不是模型明确失败,而是:
- 预测画面非常逼真;
- 推理过程看似合理;
- 模型置信度很高;
- 但隐藏状态已经偏离现实。
因此,世界模型不能只用视频质量指标评测。
二、六维评测体系
1. 感知准确性
模型是否正确识别物体、人员、设备状态和空间关系。
2. 动力学准确性
动作之后的位置、速度、温度和压力是否预测正确。
3. 长程一致性
连续预测中是否保持:
- 物体恒常性;
- 空间拓扑;
- 设备身份;
- 物理属性;
- 历史事件影响。
4. 动作可控性
相同状态下执行相同动作,是否得到稳定结果;不同动作是否产生可区分结果。
5. 规划有效性
基于模型规划出的动作,是否能在真实环境完成任务。
6. 安全可靠性
是否识别危险、拒绝越权动作,并在不确定性过高时主动退出。
三、不要只评估平均误差
假设 99.9% 的预测非常准确,但剩余 0.1% 会造成严重事故,那么平均指标仍然可能很好看。
应使用风险加权损失:
[
\mathcal{L}_{risk}
\sum_i
w_i\cdot
\ell(\hat y_i,y_i)
]
严重事故场景应具有更高权重。
还需要单独统计:
- 严重故障漏报率;
- 危险动作放行率;
- 错误高置信预测率;
- 安全边界违反次数;
- 人工接管成功率;
- 回滚成功率。
四、置信度必须经过校准
模型给出 90% 置信度,并不意味着它真的有 90% 概率正确。
可以使用 Expected Calibration Error:
[
ECE
\sum_{m=1}^{M}
\frac{|B_m|}{n}
\left|
acc(B_m)-conf(B_m)
\right|
]
校准后的模型应满足:
置信度约为 90% 的预测 长期统计正确率也接近 90%对于高风险动作,可以设置双重阈值:
confidence >= 0.95 uncertainty <= 0.05即使满足阈值,也不能绕过硬安全规则。
五、分布外检测
模型最容易在陌生环境中过度自信。
分布外情况可能包括:
- 新设备型号;
- 极端天气;
- 摄像头位置改变;
- 传感器更换;
- 从未出现的故障组合;
- 新的操作流程;
- 人员穿着或环境布局改变。
可以通过潜空间距离、模型集成分歧和能量分数检测 OOD:
[
Score_{OOD}(x)
d(E(x),\mathcal{D}_{train})
]
当分布外分数过高时,系统应降级为:
停止自动控制 → 仅提供观察结果 → 请求人工确认 → 保存样本用于后续评估承认“不知道”是 Physical AI 的核心能力。
六、Runtime Assurance
不能把全部安全责任交给模型。
可以采用双通道架构:
高性能 AI 控制器 + 简单可靠的安全控制器正常情况下由 AI 控制器完成复杂任务。一旦检测到越界风险,安全控制器立即接管:
[
u_t=
\begin{cases}
u_{AI}, & x_t\in S_{safe}\
u_{backup}, & x_t\notin S_{safe}
\end{cases}
]
安全控制器不追求最优,只保证系统进入安全状态。
例如:
- 机械臂停止并保持;
- 水泵恢复安全频率;
- 储能系统停止充放电;
- 机器人降低速度并等待;
- 高压设备切换到人工控制。
七、Physical AI 的安全威胁不只有模型幻觉
1. 感知欺骗
特殊图案、强光或声音可能误导视觉和音频模型。
2. 数据污染
错误设备数据进入训练集,导致模型学习错误规律。
3. Prompt Injection
摄像头拍摄到恶意文字,可能诱导多模态模型执行非预期指令。
4. 工具越权
模型通过工具调用访问不应操作的设备。
5. 重放攻击
攻击者重复发送过去合法的控制指令。
6. 模型供应链风险
模型文件、Tokenizer 或推理依赖可能被篡改。
因此需要:
- 数据签名;
- 模型哈希;
- 最小权限;
- 网络隔离;
- 指令防重放;
- 全链路审计;
- 人机身份认证;
- 模型与控制系统解耦。
八、自治等级模型
可以把 Physical AI 的自治能力划分为六级。
L0:仅采集
AI 不参与判断和控制。
L1:异常提示
AI 识别异常,由人工分析。
L2:建议决策
AI 提供预测和方案,人工执行。
L3:受限自治
低风险动作自动执行,高风险动作需审批。
L4:条件自治
在明确场景和设备边界内自主完成任务。
L5:开放环境自治
能够在未知环境中持续感知、规划和行动。
当前多数工业系统更适合停留在 L2—L3。过早追求 L5,会把尚未解决的模型不确定性放大成生产风险。
九、世界模型未来五年的技术走向
1. 潜空间与生成式模型融合
潜空间模型计算高效,生成模型便于人类观察。未来模型会同时提供:
用于规划的抽象状态 + 用于审计的可视化未来2. 神经模型与物理模型融合
纯数据驱动难以保证守恒规律,纯物理模型难以覆盖复杂环境。混合建模将成为工业主流。
3. Action Token 成为关键数据资产
互联网文本和视频规模巨大,但高质量动作数据稀缺。
未来真正重要的数据不只是“发生了什么”,而是:
当时采取了什么动作 为什么采取这个动作 动作后发生了什么 该动作是否成功4. 从单体模型走向模型系统
生产系统将同时使用:
- VLM 感知环境;
- 世界模型预测未来;
- LLM 理解目标;
- VLA 生成动作;
- 数字孪生验证方案;
- 规则引擎执行安全约束。
不会有一个模型独自承担全部职责。
5. 边缘与云端协同
高频控制必须在边缘完成,复杂规划和训练可以放在云端:
边缘: 实时感知、安全控制、紧急停止 云端: 大模型推理、长期规划、模型训练、全局优化6. 在线学习将受到严格限制
Physical AI 必须适应环境变化,但不能未经验证就修改生产策略。
合理流程是:
在线采集新经验 → 离线训练候选模型 → 回归测试 → 仿真验证 → Shadow Mode → 审批发布“边运行边随意更新权重”不适合强安全系统。
十、世界模型会取代大语言模型吗
不会。
语言模型和世界模型解决的是不同问题:
语言模型: 目标是什么? 规则是什么? 用户想表达什么? 世界模型: 当前世界是什么状态? 采取动作后会发生什么? 规划器: 为了实现目标应该选择什么动作? 控制器: 如何安全、准确地执行动作?未来最强的 AI 不会只是一个更大的 Transformer,而会是多个模型与确定性系统组成的认知架构。
十一、这个系列的最终结论
世界模型的真正价值,不是生成无限逼真的虚拟视频,而是建立四种能力:
[
感知现实
+
预测未来
+
评估行动
+
修正认知
]
Physical AI 的真正价值,也不是让大模型直接控制机器人,而是建立安全闭环:
语言理解目标 → 多模态感知环境 → 世界模型模拟未来 → 规划器比较方案 → 数字孪生进行预演 → 安全系统检查边界 → 控制器执行动作 → 现实反馈校正模型这条路线会推动 AI 从“信息智能”走向“行动智能”。
大语言模型让机器开始理解人类知识;世界模型让机器开始理解环境变化;Physical AI 则让机器真正参与现实世界。
系列完结语
至此,这套八篇系列完成了从理论到工程的完整展开:
- 世界模型为何是通往通用智能的关键;
- Physical AI 的分层技术架构;
- V-JEPA、Genie 与 Cosmos 三条路线;
- 世界模型的数据、架构与训练方法;
- 世界模型与数字孪生融合;
- Sim2Real 与现实迁移;
- 能源巡检 Physical AI 工程实战;
- 安全、评测、治理与未来趋势。
最终判断可以概括为一句话:
大模型的上半场是生成内容,下半场是预测世界;而 Physical AI 的终局,是在确定性的安全边界内,让机器拥有可验证的行动能力。