FLI发布AI安全指数,全球模型没有超过C+
2026/7/21 23:49:01 网站建设 项目流程

nthropic、OpenAI、Google DeepMind、Meta,这4家曾经都承诺过:一旦自家系统接近特定风险阈值,就单方面暂停开发。现在,4家全都弱化或作废了这些承诺。有的把暂停条件改成了"看竞争对手怎么做再说"。

Future of Life Institute(未来生命研究所,简称FLI)发布了2026年夏季AI安全指数。

而且,拿到C+的那家公司,刚刚悄悄收回了自己曾经许下的安全承诺。

与此同时,OpenAI在7月15日发布了一款叫GPT-Red的自动红队测试工具,攻击成功率84%,远超人类红队测试员的13%。工具在进步,治理在退步。

成绩单

FLI的AI安全指数到2026年夏季已经是第4期,覆盖公司从2024年的6家扩展到了9家。评估维度有6个,细分指标37项,由7位独立专家组成的评审团打分,采用美国GPA体系,A对应4.0,F对应0。

9家公司的最终成绩如下:

Anthropic,C+,2.66分,连续3期排名第一,在6个维度中的5个领跑。评审团认可了它在透明度、模型规格文档发布、危险能力评估方面的表现,以及Responsible Scaling Officer(负责任扩展官)这一治理架构。

OpenAI,C,2.28分,比2025年冬季版的C+有所下降。评审团肯定了它在风险评估领域的进步,评估套件更全面,外部安全测试的参与也更广泛。

Google DeepMind,C,2.01分,与上期持平。更新后的Frontier Safety Framework(前沿安全框架)新增了操控、失对齐和内部部署风险的覆盖,水印保护也做得扎实。

Meta,D+,1.32分,是本期唯一一条上升曲线。从D升到D+,排名从第6升到第4,原因是发布了更详细的安全框架,加入了威胁建模,并把漏洞赏金计划扩展到了灾难性风险因素。

Z.ai,D-,0.88分。Alibaba Cloud,D-,0.87分。有点好笑的是,两家中国公司的安全策略,在评审团看来,竟然是因为要遵守我国2025年10月修订的《网络安全法》、2021年的《数据安全法》、以及2023年的《生成式AI暂行办法》。评审团把这种策略称为"完全被动"。

xAI,F,0.65分,本期跌幅最大。从第4掉到第7,从D直接降到F。评审团找不到有意义的安全团队,找不到对存在性安全的任何投入,危险能力评估存在"巨大漏洞",包括完全没有评估AI研发风险。

报告还提到xAI的Grok曾生成儿童性虐待材料以及真实人物(包括未成年人)的非自愿性化图像。xAI在指数中没有列出任何进展亮点。

DeepSeek,F,0.47分。Mistral,F,0.33分。3个不及格,美国、中国、欧洲各一家。评审团特意指出,这个分布反驳了"AI安全差是某个地区的问题"这种说法。Mistral垫底被点名为一种讽刺,评审团认为欧盟在AI安全监管上一直走在前面。

截至证据窗口关闭,DeepSeek和Mistral都没有发布过安全框架。

7位评审专家分别来自UC Berkeley(加州大学伯克利分校)、University of Montreal(蒙特利尔大学)、HEC Montréal(蒙特利尔高等商学院)、University of Wisconsin-Madison(威斯康星大学麦迪逊分校)、Oxford University(牛津大学)、Renmin University of China(中国人民大学)和Encode。没有一家公司为评估付过费。

承诺在缩水

排名本身不是最要命的。最要命的是,排名靠前的公司,正在把以前说过的话收回去。

Anthropic、OpenAI、Google DeepMind、Meta,这4家曾经都承诺过:一旦自家系统接近特定风险阈值,就单方面暂停开发。现在,4家全都弱化或作废了这些承诺。有的把暂停条件改成了"看竞争对手怎么做再说"。

评审团给这个模式起了个名字,叫"moving the goalposts",移动球门。结论是,这种做法"全面削弱了安全框架"。

UC Berkeley的Stuart Russell教授是7位评审之一,他的原话是:"行业里确实有人在做AI安全方面的好工作,但能力竞赛已经变得更加极端。企业已经放弃了早先的承诺,不再坚持只在安全措施匹配能力水平时才发布新系统。现在,即便能证明发布是不安全的,他们也打算照发不误。"

具体到Anthropic,评审团点名批评了Responsible Scaling Policy(负责任扩展政策)3.0版本,认为它稀释了早期的暂停承诺。暂停条件一旦变成"取决于竞争对手的选择",就没有任何一方有动力先停下来,政策的实际约束力就归零了。

OpenAI的情况更复杂。在证据收集窗口(截至2026年6月3日)关闭之后,OpenAI把安全团队并入了研究部门,取消了独立汇报线。TechTimes把这报道为OpenAI两年内第6位高级安全人员离职。这件事没有被计入评分,但方向很明确。

评审团还建议OpenAI取消领导层对Safety Advisory Group(安全咨询组)的否决权,并要求安全框架的阈值可量化、可外部执行。

对Google DeepMind,评审团的疑问是:到底哪个内部机构有权在不经 executive leadership(高管层)批准的情况下独立叫停一次部署?

Meta那边,评审团担心非贬损协议可能正在侵蚀其声称的吹哨人保护。

看见悬崖,没修护栏

整个指数中得分最低的领域是Existential Safety(存在性安全)。没有一家公司超过C-,大多数落在D或以下。

评审团承认了一些零散的努力。Anthropic的constitutional classifiers(宪法分类器),OpenAI对全球AI治理机构的呼吁,Google DeepMind的监控承诺,Meta针对失控的预防措施。但总体评价是“完全不够”。

评审团最具技术含量的一条批评,直接指向了行业主流安全范式。Interpretability(可解释性)研究和Chain-of-Thought(思维链)可监控性,是大多数AI公司最核心的安全投资方向。评审团从架构层面提出了质疑:detection is not prevention,检测不等于预防。

思维链可监控性让模型的推理过程变得可见,人类可以发现不对齐的思维。但检测是事后的。一条不对齐的推理链被捕捉到的时候,模型已经输出了结果,甚至已经执行了动作。一个在问题发生后才发出警报的监控系统,提供的是问责,不是安全。

OpenAI在7月15日发布的GPT-Red,恰好印证了这种张力。GPT-Red是一个自动化红队测试模型,通过self-play reinforcement learning(自博弈强化学习)训练。红队模型和一组防御模型同时训练,GPT-Red的奖励是成功发起攻击(比如成功的prompt injection,提示注入),防御模型的奖励是抵抗住攻击。

结果在GPT-5.1的新颖场景中,GPT-Red的攻击成功率84%,人类红队测试员只有13%。这些攻击随后被用来加固GPT-5.6 Sol,把它的直接提示注入失败率压到了0.05%。

这是用对抗性AI在部署前找到并封堵特定漏洞类别的安全工程。但它仍然是针对已知攻击面的检测加固系统,不是面向大规模失对齐的预防架构。

University of Montreal的David Krueger教授也是评审之一,他写道:"AI公司在制定可信AI安全计划方面缺乏进展,令人震惊。连他们自己都开始焦虑了,一边冲向递归自我改进,一边面对失控的可能性。"

军事AI集体转向

指数中另一个突出发现涉及军事应用。

2024年到2026年间,Anthropic、OpenAI、Google DeepMind、Meta,这4家此前限制或禁止军事应用的公司,全部调转方向,开始积极争取国防合同。它们加入了xAI和Mistral的行列,后两家本来就在做这方面业务。

这个转向产生了具体的评分后果。Anthropic在Current Harms(当前危害)领域下的Military Use of AI(AI军事使用)子指标上拿了不及格。评审团引用了它与Minab学校空袭事件的"reported connection",即被报道的关联。那次空袭造成了大规模平民死亡。FLI在报告中明确标注,这是评审团关于一个被报道的关联的发现,不是对法律责任的认定。

最后说几句关于这份指数本身的局限。它评估的是实验室的政策、治理结构、信息披露和已发布的技术框架,不是部署产品的实际表现或用户体验。

一家公司可以因为文档写得全面而拿高分,也可以因为什么都没发布而拿低分。Anthropic的C+,说的是它的文档化安全实践、治理结构和透明度在同行中相对较强,而整个行业至今没有建立起可外部执行的最低标准。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询