我们越来越多地将大语言模型应用于搜索、编程、内容生成和决策辅助等现实场景中。尽管每天有数百万人使用大模型,但它的问题也随之而来——有时会产生幻觉,甚至在特定情境下表现出误导或欺骗用户的倾向。
在很长一段时间里,人们只能将AI看成"黑箱":输入数据,得到结果,但无法解释中间经历了怎样的计算过程。随着模型规模和能力的不断提升,这种内部过程不可见的状态,逐渐从工程难题转变为安全与可信性方面的潜在风险。
一、机制可解释性:给AI做"脑部扫描"
为拆解AI的"黑箱",包括Anthropic、OpenAI和Google DeepMind在内的多家AI公司,开始尝试通过重建模型的"脑内地图",系统性地揭示AI的内部运作方式。
机制可解释性的核心目标是从模型内部的计算结构出发,识别关键特征单元,并刻画这些单元之间的信息传递路径,从而理解模型整体行为的形成机制。机制可解释性对算法对齐具有关键作用——研究者可以基于此从模型内部计算机制层面进行判断:模型表现出色,是源于与人类目标一致的内部策略,还是依赖于某种表面成功但潜在误导的欺骗性捷径?
二、Anthropic的"电路追踪":大模型内部的"显微镜"
Anthropic提出了一种具有代表性的思路——电路追踪(Circuit Tracing),以识别与特定行为或能力最直接相关的关键信号通路为核心目标。
2024年,Anthropic公布了一套可类比于"显微镜"的分析方法,来对其Claude模型的内部结构进行深入探索。研究人员发现,大模型内部并不是像人们想象的那样完全无序,而是表现出结构化表征:部分神经元或神经元组合可稳定与特定概念相对应。例如,以迈克尔·乔丹为代表的人物概念、以金门大桥为代表的地点概念,更进一步地,还可能涵盖更抽象的语义与功能模式。
在此基础上,研究人员进一步将模型内部的计算过程映射成可解释的归因图谱,不仅能够在模型中精确定位这些特征,还分析它们在不同任务中如何被激活、如何相互作用和组合。业界普遍认为,这是迄今为止对生产级大语言模型内部机制最深入的系统性探索之一。
Anthropic还将电路追踪的相关工具开源,并在Neuronpedia平台上提供交互式图谱分析界面,让更多的研究者与开发者共同观察、验证,并讨论模型内部机制的形成和演化。
2025年,Anthropic将这一研究路线进一步推向新高度——不局限于对单一概念特征的分析,而是利用这套"显微镜"工具,解析出模型内部相对连贯的特征序列,并追踪模型从输入提示到最终生成回答之间的大致计算路径。这意味着在有限范围内,模型的思考过程开始具备一定程度的可追溯性。
三、OpenAI的路线:用一个模型解释另一个模型
OpenAI探索了另一条技术路径,核心思路是用一个模型来解释另一个模型的神经元功能。具体而言,研究人员首先使用较小的语言模型GPT-2在大规模文本上运行,筛选出能够高频激活特定神经元的输入片段;随后,将这些片段交由更强的模型GPT-4来解释这些神经元在做什么。
这种方法虽然不如电路追踪那样"深入"——它更多是在做功能标注而非机制解析——但胜在可扩展。用一个小模型去"探针"一个大模型,然后用另一个模型来解释探针结果,这种"以AI攻AI"的思路正在成为可解释性研究的重要方向。
四、安全对齐:从外部约束到内部理解
安全对齐是机制可解释性最直接的应用场景之一。
NeurIPS 2026上发表的一篇论文从机制可解释性的视角探索了LLM的安全对齐内部机制,专注于识别和分析LLM内部负责安全行为的"安全神经元"。研究发现,即使在经过安全对齐之后,大语言模型仍然存在生成有害内容和 misinformation 的风险。理解这些风险在模型内部是如何产生的,是设计更可靠的安全机制的前提。
ACL 2026上发表的另一项工作提出了Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation,通过稀疏自编码器构建的低秩子空间来实现可解释的安全对齐。
美国国防高级研究计划局与NSF联合启动的"人工智能锻造"计划,则聚焦AI可解释性、AI控制能力与对抗鲁棒性三大方向,针对战场环境中AI"黑箱"导致的决策误判风险提出15项国家安全关键AI研究挑战。
五、一点判断
机制可解释性仍然是一个极其年轻的研究领域。目前的技术进展——无论是Anthropic的电路追踪还是OpenAI的"模型解释模型"——都还处于"实验室阶段"。距离真正"读懂"一个千亿参数大模型的内部运作,还有很长的路要走。
但这个方向的重要性怎么强调都不为过。当AI系统被越来越多地应用于医疗诊断、金融决策、司法辅助等高风险场景时,"它为什么做出这个决定"不再只是一个学术问题,而是一个安全问题和伦理问题。机制可解释性有望发展为提升AI系统安全性与透明度的独特技术路径。在那一天到来之前,我们还需要更多的"显微镜"、更多的"脑内地图"、以及更多的耐心。