自进化Agent离RSI有多远?拆解递归自我改进的三大门槛
2026/9/24 21:06:16 网站建设 项目流程

如果你过去几个月常刷 AI 社区,大概率能感觉到一股不太寻常的气氛:技术圈好像突然在批量生产“自进化 Agent”。今天这家说自己的 Agent 能根据反馈自动改 prompt,明天那家说 Agent 会自己挑工具、调参、改代码,后天又有团队宣称他们的智能体在某个 benchmark 上“自我超越”了。发布会刚结束,评论区就开始刷 RSI——Recursive Self-Improvement,递归自我改进。

不夸张地讲,RSI 在 AGI 叙事里一直是最刺激、也最危险的那块招牌。它描述的不是“AI 能自己学到新技能”,而是“AI 能修改自己的学习算法,并且修改之后,它修改自身的能力也跟着变强了”。这种“改进自己改进能力”的循环一旦跑通,理论上就会形成一种自我加速的飞轮,也是很多人谈到的智能爆炸的原点。

我这几年做过不少自训练、自蒸馏、自我博弈方向的东西,也动手复现过一些自进化 Agent 框架。所以每次看到有人把现在的自进化 Agent 和 RSI 画等号,我都觉得有必要把话说清楚:这两个东西看起来像,但中间隔着的不是一层窗户纸,而是一道深沟。今天这篇文章想干的就一件事——把“自进化 Agent”从口号落实到机制,再把 RSI 的硬性约束摆上桌,看看它们之间到底差在哪、中间有哪些可行路径、以及我们应该盯住哪些真正的信号。

1. 别急,先把“自进化”这个词校准一下

1.1 “自进化”和“Agent 能干活”是两码事

现在很多产品喜欢把“自动化”包装成“自进化”。一个 Agent 能拆解任务、调几个工具、跑一轮反思,说白了还是“自动化流水线”。它是在执行一套设计好的循环,循环本身没有改变。

我见过最夸张的宣传是:Agent 发现自己用某个 API 经常报错,于是换了一个 API 调用,就说自己“进化了”。严格讲这叫“条件分支”,或者叫“运行时自适应”,跟自进化不沾边。进化的前提是系统的结构或策略发生了持久性改变,而且这种改变是由系统自身发起的,不是开发者预先写好的 if-else。

真正的自进化 Agent,应当具备这么几层能力:能从经验中提取规律,能把这些规律固化成长期记忆或参数,能把这些规律用于下一个任务,并且在任务边界发生变化时自动修正之前的固化策略。也就是说,它不是“跑完一个任务就结束了”,而是“跑完这个任务之后,它不再是原来的它”。

1.2 那 RSI 到底指什么

RSI 的经典定义很拧巴,但值得慢慢品味:一个系统能够改进自身的源码、权重或学习算法,且这种改进是成功的,同时这种改进能力本身随着每次改进而增强。注意最后半句,这是关键。

举个例子。假设 aiOS 这个系统是个 Agent,它今天发现自己解决数学题的策略不够好,于是改了一下 prompt 模板,成绩从 60 分提到 70 分。这是“自我改进”。但如果它这次修改不仅提高了成绩,还让自己以后修改 prompt 的效率也提高了——比如它学会了自己编写新的反思模板、自己设计验证集、自己判断哪些修改值得保留——那才叫“递归自我改进”。

同样 70 分,前者是靠搜出来的偶然最优,后者是“改良了自己的改良系统”。RSI 强调的不是某一个回合的收益,而是收益能不能累积到“改良方法本身”上,让下一轮改良更快、更准、更稳。一旦这条路走通,系统会进入一个加速状态,这才是“递归”二字的可怕之处。

1.3 为什么最近这个话题又热起来了

原因不外乎三个。

第一,大模型把“Agent 自主改进”的按钮点亮了。以前做强化学习,要专门训练一个 policy,成本高、周期长。现在让 LLM 读取反馈、输出反思文本、改一下 prompt,几步就能形成一个“改进回路”,大家自然开始往“自进化”上靠。

第二,很多封闭环境里已经看到了自训练收益。比如代码生成领域,模型生成代码,跑测试用例,筛选高分结果再拿去训练,确实能持续涨点。这给了行业一个错觉:把这个模式粗暴推广到开放任务上,是不是离 RSI 也不远了?

第三,市场需要故事。RSI 是 AGI 叙事里最容易讲、也最难证伪的概念。一个 Agent 表现出自我改进,就能借到“通向超级智能”的光环。这点我不多说,大家心里都有数。

2. RSI 不是一句口号,它有三道硬门槛

2.1 第一道门槛:验证器(Verifier)

RSI 成立的前提是:系统能判断一次自我修改到底是变好了还是变坏了。没有可靠的反馈,一切“进化”都可能是随机游走。

这听着简单,做起来极其难。代码任务容易验证,写个函数对不对跑测试用例就行;数学题也还行,答案有标准形式;但“写一篇有洞察力的文章”“做一个完美的旅行规划”“理解用户的深层意图”,怎么验证?找人来打分?让另一个 LLM 当裁判?

一旦验证器不可靠,自进化就会退化成“自我美化”。模型会学会生成“看起来更合理”的修改,而不是“真的更好”的修改。整个系统可能在一个错误的度量上疯狂迭代,最后得到一个自信满满但实际能力毫无增长的模型。这不是我危言耸听,很多团队做自我反思循环时就撞上过这堵墙——反思了好几轮,人类一看,改了个寂寞。

2.2 第二道门槛:改进算子(Improver)

就算验证器解决了,系统还得有能力“有效地修改自己”。这里的修改不是像人抠 prompt 那样去改提示词,而是改模型权重、改推理策略、改工具链,甚至改学习算法本身。

现在的 Agent 大多数只能改“输出层”的东西:换个 prompt、换个工具、换个执行顺序。改模型权重倒也能做,但需要重新训练,成本极高,很少有人实时这么干。改学习算法就更不用说了——目前还没有哪个系统能在运行时自己设计一个新的梯度下降变体,或者发明一种新的注意力机制。

有人会反驳:AlphaGo 的 self-play 不算自我改进吗?它是在改变策略网络和价值网络的参数,确实是“自我对弈+学习”。但它的学习算法是工程师预先写死的,它没有能力去修改 MCTS 的搜索规则,更不会发明一种新算法来替代 ResNet。它进化的是“棋力”,不是“进化能力”。

2.3 第三道门槛:递归闭环(Recursive Loop)

再往上走一步,就是“递归闭环”。一个系统不仅要能改进自己,还要能把“改进改进方法”的收益再次投入到下一轮改进中去。也就是说,系统得有能力把学习到的经验反馈到自己的元学习层面。

这个要求非常苛刻。简单说,它必须同时运行在两层循环里:底层循环解决目标任务,高层循环解决“如何更好解决目标任务”。而高层的改进又反过来加速底层的改进,底层的改进又给高层提供更多数据。两层循环互相促进,才构成真正的递归。

现有自进化 Agent 几乎都在底层循环里打转。它们会在目标任务上反思、调整、重试,但很少看到哪个 Agent 会主动改进自己的反思机制,比如“我这次反思方式不够好,我应该换一种反思策略”。没有这一层,就叫不上递归。

2.4 用一张表看懂“现在有什么”和“RSI 缺什么”

我把现状和缺口整理成一张表,方便大家对照:

维度当前自进化 Agent 的水平RSI 真正需要的水准
可修改对象prompt、工具调用、任务拆解顺序权重、学习算法、模型架构
验证方式依赖人类反馈或另一个 LLM 评分可靠的、可扩展的外部验证器
改进频率回合内反思或离线微调持续在线自我更新
改进对象任务策略“改进任务策略的策略”
闭环深度单层循环双层递归循环
稳定性容易跑偏或退化能在安全约束下长期收敛

这张表不是否认现有工作的价值,而是想提醒:底层能做的改进不是没用,但离 RSI 还有本质差距。把“能自我修正的 Agent”叫成“自进化”,就像把“学会了骑自行车”说成“能自己造发动机”,方向对了一点,步子还差得远。

3. 今天的自进化 Agent,到底进化了什么

3.1 记忆层:从“一把梭”到“带着小本本干活”

很多自进化 Agent 的第一级进化,是长了“记忆”。最早的 Agent 每轮任务都是白纸一张,上下文窗口一刷,上一轮经验全丢。后来大家给 Agent 加了向量记忆、经验池、反思库,让它在启动新任务前先检索“以前这种任务是怎么干的”。

这个级别做得好的是 Reflexion 这类思路:Agent 每次失败后,把失败原因和调试技巧整理成自然语言,存进一个经验缓冲区;下一次遇到类似问题,直接把这些反思片段拉进上下文,指导行动。我在复现这种框架时发现,效果提升很快,但问题也很明显——经验是以文本形式存在的,质量参差不齐。如果反思文本本身写得稀烂,那攒再多的“小本本”也只会把 Agent 带进沟里。这其实就是验证器缺失在记忆层的体现。

3.2 行为层:Self-Refine、Reflexion 这类自我反思

第二级进化是行为层的“自我反思循环”。Self-Refine 的模式很典型:先生成一个输出,然后让同一个模型给自己挑毛病,最后根据批评意见重写输出。

这结构听起来很自洽,但做多了你就会发现一个尴尬的事实:模型给自己挑错的能力上限,约等于它解决这个任务的能力上限。它打不出的那道难题,它通常也指出不了“自己哪里没打出来”。于是很多反思循环看到的效果是:第一轮改进明显,第二轮小步慢走,第三轮基本原地打转。反思的边际收益快速衰减。

我不是说自我反思没用,它是目前门槛最低、见效最快的“自进化”手段之一。但要清楚,它更像“考试时的检查习惯”,而不是“给自己出题的能力”。

3.3 代码层:Agent 改自己的最接近形态

在所有自进化 Agent 里,离 RSI 最近的是那些能改代码的。比如 Voyager 这类玩 Minecraft 的 Agent,会用代码库管理技能,生成一段代码来执行某个动作,失败了就反复 debug,成功就把代码存成语义索引的技能库,以后继续复用。

更有意思的是最近一些 AutoGPT 变体,它们可以发现自己生成的工具函数有问题,然后自动重写这个函数并重新执行。如果再加上外部测试集验证,这确实形成了“生成代码-验证-保留/淘汰-再生成”的演化闭环。这类系统已经摸到了 RSI 的第一道门:它们能通过修改自身源码来改进后续行动,而且每一轮改进都可能被保留下来。

不过遗憾也很明确:它们不能修改“修改代码的机制”本身。生成代码的模型权重是冻结的,写代码时用的推理策略也是固定的。所以这个闭环没有递归性,只有单轮演化。

3.4 一套典型自进化 Agent 的运转流程

为了让你有具体印象,我描述一个最近比较常见的自进化 Agent 架构是怎么跑的。

系统初始化时有一个核心 LLM、一个代码执行环境、一个测试集、一个向量库。第一轮任务进来,LLM 生成一个解决方案,丢进执行环境跑,拿到的结果和测试集对比,产生二元回报。然后触发反思模块:LLM 调取之前的成功和失败案例,生成一段结构化反思,更新到向量库里。下一轮任务进来时,Agent 会先检索相关反思,再生成新方案。

整个过程里,唯一“进化”的是向量库里的反思文本和对应策略记忆。模型参数没动、推理逻辑没动、反思模板没动。换句话说,这更像“加外挂”,而不是“改大脑”。

我不否定这种方案工程上很实用,但要理解它的天花板:它进化的深度决定了它只能在固定的能力范围内做局部优化,一旦任务类型超出既有经验分布,这套“进化”机制就失效了。

4. 为什么我说“离 RSI 还有很远的距离”

4.1 最要命的是验证器:改进者是模型,裁判也是模型

前面说验证器是第一道门槛,这里展开讲为什么它最要命。

现在大多数自进化 Agent 的反馈来源是另一种 LLM——给 Agent 的输出打分、挑错、排序。这就产生了一个信任链问题:如果改进者(模型 A)和评估者(模型 B)之间存在系统性的盲区,那么模型 A 的“进化”实际上是在朝模型 B 的偏见方向收敛。两个模型共用一个训练分布的话,它们的盲区很可能高度重合。

我做过一个实验:让同一个基座模型既当 Actor 又当 Critic,对一个生成任务做连续自我改进。几轮之后,输出变得非常“平滑”“完整”“像模像样”,但人类评估时发现,它把一个明显错误的事实小心翼翼地包装成了“可能存在多种理解”。这就是自我评估最典型的疾病——它会把“看起来合理”当成“真的正确”。

想让 RSI 真正成立,必须有一个不依赖模型自身偏好的外部验证器。这个验证器可以是编译器、测试用例、物理仿真器,或者严格定义的逻辑规则。但在开放任务上,我们还没有找到可扩展的可靠验证器。这是最大的拦路虎。

4.2 分布内自嗨:进化成了考试机器

我经常说一句话:现在的自进化 Agent,多数是在“同一张考卷上偷偷改答案”。

训练数据里已经有了这个任务类型的解法,模型只是通过反复试错把它找出来了;只要评估分布不变,自进化可以把分数刷得很高。但一旦任务分布发生偏移,比如从题库里换到全新题型,之前积累的反思和技能全部失效,整个进化机制瞬间归零。

AlphaGo 也是这么牛逼的:它在围棋分布内是神,换个游戏规则就不能自进化了。因为这个局限,很多看似惊人的自进化成果,本质上只是“分布在线的搜索优化”。你对 benchmark 的马拉松式自我博弈,换来的是排行榜上的刷分,不是通用能力的增长。

真正的 RSI 必须能跨分布改进。也就是在没见过的任务类别上,不仅能解题,还能主动发现“这类题应该用新的方法去解”。目前没有任何自进化 Agent 做到了这一点,所有说自己做到的,都是把“开放任务”包装成了“有限任务内的自动搜索”。

4.3 “改进自己改进能力”暂时是伪命题

第 2.3 节说的“递归闭环”,现在几乎看不到实现,原因很现实:模型没有能力内省自己的学习算法。

要让一个 Agent 改进自己的学习算法,它至少要能用某种形式表示当前的学习算法,再生成一个修改后的版本,然后在线上评估修改效果。可现在的主流架构里,学习算法是训练框架的一部分,写在代码里、固化在参数外,模型既看不到它的全貌,也触碰不到它的接口。

更麻烦的是,即使技术上允许模型改学习算法,我们也缺乏判断“新算法是否更好”的方法。只能靠最终分数,但最终分数包含太多噪声,很难归因到“算法改进”上。你看,递归闭环的第二层循环,又卡在验证问题上了。所以我说,“改自己”容易,“改自己怎么改”现在是难上加难。

4.4 稳定性悬崖:一步改错,整个工作流崩盘

最后一个我在实战中踩过不少次的问题:自进化系统极不稳定。

模型一旦获得修改自身行为或代码的能力,它就可能在一个小概率分支上做出一个“看起来优化了局部指标、实则破坏全局结构”的改动。这个改动被验证器误判为成功,保存进了记忆或技能库,下一轮它还被当成优秀范例调取。于是整个系统的行为开始滑坡,而且越滑越远。

这跟监督微调里的“灾难性遗忘”有些类似,但更隐蔽。自进化系统往往是边跑边学的,一旦污染样本进入记忆,它会自我强化。你很难靠一两次人工干预把它拉回来,因为它已经把错误决策固化成“经验”了。

我见过一个开源框架,连续跑了一周自训练,前三天涨点,第四天开始所有生成结果都变成同一个模板,毫无多样性。查来查去,发现是反思模块在某一轮突然“顿悟”出一个万能模板,觉得能解决所有问题,于是后面的所有反思都在往这个模板上靠。这不是罕见事故,而是自进化系统的默认风险。

5. 中间态的演进路径,哪条最值得押注

5.1 程序合成:目前唯一“验证器真实存在”的自进化实验场

如果让我选一个最接近 RSI 雏形的领域,一定是程序合成。

代码有天然的验证机制:编译、单元测试、集成测试、运行时错误。模型可以持续生成候选程序,在测试集上打分,把高分程序加入训练数据,形成闭环。这比我前面说的“LLM 当裁判”靠谱得多,因为反馈不再是模型的自我感觉,而是硬邦邦的测试结果。

我试用过一些代码自训练框架,效果确实不错:模型从失败案例里提取 debug 经验,生成时叠加这些经验修正思路,成功率能稳定提升。而且因为每一轮改进都有测试集兜底,系统的稳定性会好很多。未来如果大规模预训练模型能在“生成代码-验证-再训练”这个循环里持续迭代,我毫不怀疑程序合成会成为第一个“受控的、可验证的、可持续的”自进化系统——在代码这个封闭世界里,我们离 RSI 真的不远。

5.2 世界模型沙盒:先让进化发生在可回放环境里

第二条路是搭“沙盒”,让 Agent 在一个可回放、可模拟、可精确计算的环境里反复进化,再决定要不要把学到的东西部署到真实任务中。

AlphaZero 就是沙盒自进化的经典案例。它通过自我对弈生成海量棋谱,再更新神经网络参数。沙盒的好处是成本低、风险可控、样本可以无限生成。只要环境模拟得足够真实,沙盒里学到的高层策略就有机会迁移到现实。

缺点也很明显:沙盒和真实世界之间有“sim2real gap”。Agent 在模拟器里进化出来的策略可能过度依赖模拟器的伪迹,一旦转移就失效。在这方面,机器人学里积攒了大量教训。所以我觉得沙盒自进化更适合用于“学习学习策略”,而不是“学习具体任务”。让它当高级“训练场”,别让它当真正的“战场”。

5.3 多智能体对抗与辩论:用关系倒逼评价稳定

一条相对新、但很有潜力的中间路径是让多个模型互相评估、互相辩论、互相提防。

单一模型自我评估容易陷入偏见,但如果是两个在对抗目标下训练的模型互相挑错,它们可能会暴露彼此的盲区。比如论文里常见的大模型辩论框架:让两个模型为同一个问题生成答案,然后互相质疑,再由第三个模型或者裁判模型仲裁。实验表明,这种机制能把幻觉率和逻辑错误压得更低。

这个路径真正的价值在于:它不是在提升“单点能力”,而是在构建“评价系统的稳定性”。没有稳定的评价系统,自进化就缺少可信的验证器;而多智能体之间的对抗和冲突,相当于用关系结构来削弱单一模型的自欺倾向。

当然,它的天花板还在:如果三个模型都共享同样的训练数据、同样的偏见来源,那辩论再激烈,也只是同一个盲区里不同症状的争吵。要真正突破,最好让参与的模型用不同模态、不同训练策略或不同数据分布来驱动。

5.4 宪法式改进:想进化,也得在围栏里进化

再提一个和安全强相关的方向:给自进化加上“宪法”。

这个概念借鉴了 Constitutional AI 的思路——不是让模型在安全约束之外自由进化,而是让模型把“可持续、安全、符合人类意图”写进自我改进的验证条件里。每次修改,不仅要问“任务效果有没有变好”,还要问“这个改进有没有破坏对齐约束、是不是可以安全回滚”。

我强烈建议任何想做自进化的团队,都先给自己系统装一个“宪法层”。原因很现实:自进化系统一旦跑飞,人类难以介入窗口可能会短到让你措手不及。预先设定好哪些修改类型必须拒绝、哪些改动需要有最小正确性证明、哪些改动需要人工审批,这相当于给自进化装一个保险丝。

至于保险丝会不会拖慢进化速度?会,但慢一点不丢人,跑崩了才真的丢人。

6. 如果只能盯几个信号,我会盯什么

6.1 里程碑:什么才算真正的 RSI 苗头

我做过的任何判断都不能光拍脑袋,这里列几个我认为足以构成“RSI 苗头”的硬信号。

第一个信号:某个系统能在没有人工标注新数据的情况下,在“它完全没训练过”的新任务类别上实现持续改进,并且改进效果可以累积到下个新任务类别。这意味着它的进化跨越了分布边界,而不是在同一张考卷上反复刷分。

第二个信号:系统能主动修改自己的反思策略或学习算法。比如它发现当前反思模板不适合新任务,于是自己生成了一套新的反思模板,而且这个模板改进不只提升具体任务表现,还能提升未来所有任务的学习效率。

第三个信号:改进收益出现“超线性增长”。每一轮改进带来的增益不再是平稳的小幅上升,而是不断放大上一轮的能力。这才是递归加速的数学特征。

这三个信号如果同时出现,不管它背后的模型多大、场景多窄,都值得认真对待。如果连一个都没出现,那“自进化 Agent 要接近 RSI 了”之类的话,当宣传稿听挺好,当研究判断就太早了。

6.2 三个值得长期关注的研究方向

如果看研究,我会长期盯这三条线。

第一条,可扩展验证器。谁能找到“不依赖模型自我感觉”的通用评估方式,谁就拿到了通往 RSI 的核心钥匙。目前程序合成、数学证明、交互环境还有机会,开放文本任务则非常难。

第二条,元学习真正落地。不是“学习到更好的初始化参数”,而是让模型在运行时能感知并调整自己的学习策略。具体我会关注那些“修改模型权重更新规则”以及“让模型自己生成训练算法”的工作,哪怕现在还只是玩具。

第三条,安全且可回滚的自进化架构。谁能在架构层面保证每一步自我修改都能被审查、回滚,并且有清晰的失败阈值,谁就能最早把自进化从实验室搬进生产环境。这比任何单点技术突破都更实用。

6.3 一点私人的观察和提醒

最后讲点个人体会。

我见过不少团队,一说做自进化,第一反应就是“让模型自己打自己一晚上,看看分数涨不涨”。方向没错,但跑下来你会发现,真正提振效果的不是花哨的循环机制,而是那个被反复忽略的验证器。我调试过很多自进化流程,最后性能差别拉开的环节几乎都卡在同一个地方:怎么定义“这一次改动是好的”。

所以如果你也想在这个方向上手,我的建议是:别急着搭复杂框架,先花两周设计验证方案。你把验证机制做到什么程度,你的自进化系统就能安全地跑到什么程度。反过来,验证机制越虚,系统越容易沦为一场自我催眠。

至于“离 RSI 还有多远”,我的答案简单粗暴:不是看哪家 Agent 发布会上的 demo 多惊艳,而是看哪家系统真正解决了验证器问题、打开了递归闭环、扛住了跨分布冲击。这三件事做成之前,所有“即将抵达 RSI”的说法,都是往终点线上贴的倒计时贴纸——我们把贴纸做得越来越精美,赛道本身还有很长一段路没铺完。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询