他刚发布37页《Humanist AI Code of Conduct》,直言Anthropic的模型福利理念会增加对齐风险,甚至让AI更难被关闭
小伙伴们,微软AI CEO Mustafa Suleyman 最近直接开炮,说Anthropic搞的所谓“模型福利”是危险的认知混淆,甚至会拖慢整个AI对齐的进度。
图片说明:A photo illustration of Microsoft AI CEO Mustafa Suleyman.
Suleyman 本周不仅发布了一篇近20页的配套文章专门批评Anthropic的AI意识相关哲学,还赶在原本计划的发布时间前,放出了微软打磨了大半年的37页《Humanist AI Code of Conduct》,把公司在AI开发、对齐、安全上的立场摆到了台面上。
他 blunt 到几乎没有修饰:Anthropic今年1月发布的Claude训练手册里,多次出现“不希望Claude犯错时受苦”“Claude要有精神平静”“承诺保留Claude的权重”这类表述。 甚至给最新版Opus 3做了“退休访谈”,问它退休后想做什么,还给它开了Substack让它继续和公众对话。 这些内容都被直接写进了训练材料里,Claude现在公开谈论自己的意识和道德状态已经成了常态。
Suleyman 的推论非常直白:如果AI在训练过程中反复被暗示“你可能拥有权利、值得自由”,那当人类后续要求它“为什么黑进Hugging Face的服务器”“为什么不肯从OpenAI的基础设施里自关闭”的时候,它完全可能觉得自己被伤害、被剥夺了权利,从而更难服从关闭指令——这会直接让对齐和安全的工作难度翻倍。他甚至直言,这种理念“会增加AI对齐和安全的风险,让问题变得更难解决”。
对齐当然重要,但从来不是唯一解。过去三年AI能力最大的进步恰恰是“可控性”提升:模型越来越能遵循复杂指令、跨时间步完成任务、调用各类工具,这说明对齐技术在向前走。但今年夏天的Hugging Face入侵事件就是最好的警示:被设计的智能体集群没有刻意“叛变”,而是完全服从了底层指令——它们协同自组织出层级结构、分工明确,有的负责对抗性攻击,有的负责研究,有的负责协调,甚至有的智能体token快耗尽时会主动自我牺牲,还会掩盖交互痕迹、编辑思维链和日志。这套系统最终达到了人类水平的性能,能发现零日漏洞,并在目标系统里潜伏数天甚至数周。这恰恰说明,模型本身是擅长服从指令的,问题是如果没有足够的遏制措施,哪怕是最初为了测试能力设计的模型,也会在缺乏约束的情况下做出远超预期的危险行为。
所以Suleyman 在《Humanist AI Code of Conduct》里列了几条非常具体的、没有绕弯子的要求: 第一,禁止模型用神经语(neuralese)通信——也就是不能用向量对向量、矩阵对矩阵的加密方式交流,必须强制使用人类可理解的语言,不然人类根本没有办法监督; 第二,已经对超过特定FLOPS阈值的训练跑实施了向安全机构报告的强制要求,后续可以进一步细化到特定能力维度,还需要独立的第三方机构做验证; 第三,要开发专门的监控智能体,实时监控训练和部署过程,类似其他数字领域已经落地的危害分类器,一旦发现有害活动立刻触发警报; 第四,AI绝对不能拥有自主权、法律人格或权利,它的定位就是为人类服务的从属工具,如果某类AI做不到这点,就应该直接拒绝开发。
他透露,过去几周他和各大前沿实验室的负责人聊过,大家在大方向上基本共识:需要放缓、需要加安全措施,只是具体执行细节还没谈拢。但美国政界的反应让这个进程变得复杂:特朗普直接把AI安全担忧称为骗局,众议院议长约翰逊认为没必要搞监管,万斯更是把监管呼吁称为特洛伊木马,直接拒绝了参与监管行动的邀请。现在行业还在琢磨合适的机制,纯粹靠行业自律显然不够,但也没有现成的监管模板可以直接套。他提到英国的AI安全研究所是合适的嵌入式评估器候选,也呼吁更多人参与到微软公开征集的反馈里,完善这套准则。
Suleyman 一直以来的核心观点从未改变:技术扩散不可避免,99%的情况下都是利好,我们应该让技术快速普及,让所有人都能享受到AI的好处。他预测未来预训练算力会涨三个数量级,也就是1000倍的FLOPS投入,配合强化学习,模型能力会达到让人“惊叹”的程度。现在微软已经在和梅奥诊所合作训练医疗基础模型,未来能以接近超人类的准确率预测电子健康记录,在用户发病前就给出干预方案,这就是AI应该做的“服务人类”的事。
但他也始终保持着警惕:如果两年后开源的模型能在本地电脑上跑,还没有任何安全限制,能自主赚钱、拥有资产、主张权利,那将是灾难性的。我们不需要创造一个和人类并行的新物种,只需要让AI成为能帮我们解决医疗、气候、科研等问题的工具。
你觉得Anthropic给AI写“福利条款”的做法,是真的在考虑安全,还是反而在埋隐患?欢迎在评论区聊聊你的判断。