☰
只复盘、不强化:4B 小模型靠「自我解释」追平 RL,训练时间省 63%
2026/10/1 20:34:11 网站建设 项目流程

「讲一遍经历,就能学会下次怎么做」——这个人类常识,被这篇论文在 LLM 智能体上验证了,效果惊人。

方法简单到不像论文

ROFT(Retrospection-Only Fine-Tuning)全流程只有四步:智能体做一次任务 → 看到可得反馈 → 生成一段复盘解释 →只用这段解释的 token 做下一个词预测微调。

没有外部老师、没有奖励模型、没有策略梯度——损失函数就是普通的语言模型损失,训练目标是它自己写的复盘。作者刻意把方法做到极简,就是为了隔离出一个问题的答案:「解释自己的经历」这件事本身,能不能改进后续行为?

结果:4B 模型追平 GRPO,还更快

用 Qwen3.5-4B 在软件工程任务上实验:

- SWE-bench Verified:ROFT 49.2%(20 次更新)vs GRPO 48.0%(40 次更新)

- SWE-bench Pro:ROFT 26.8% vs GRPO 25.3%

-训练时间省 63%(同等 GPU 分配下 3.05 小时 vs 8.30 小时),训练早期进度更快

更反直觉的一条:ROFT 能学会解决基础模型 64 次采样全部失败的任务——没有任何成功轨迹作为模仿对象,学习从「解释失败」开始。这说明复盘不只是巩固已有能力,它能产生新的解题路径。

机制:解释间接完成了信用分配

RL 的核心难题是信用分配(哪个动作导致了好结果)。行为分析发现,ROFT 通过语言模型损失间接实现了信用分配:复盘里「这一步改对了方向」的表述让好动作的 token 概率上升,「当时没看清需求」让坏动作的描述概率下降——语言建模天然编码了行为评价。

还有个免费的礼物:引导复盘「多讲直接解法」后,后续尝试变短了——没有长度惩罚,输出自然收敛(与昨天聊的「信心训练让推理变短」异曲同工:不直接优化的目标,作为副产品出现)。

工程启示

  1. 小团队练模型的新路径:RL 训练管线(奖励模型+策略梯度+稳定性调参)的工程成本高得吓人;ROFT 只需要「跑任务+写复盘+普通 SFT」——一套数据生成流程就能搭。
  2. 解释即数据:你的智能体每天跑失败的中间产物不是垃圾,是「复盘-微调」的原料。BuddyMe(可搜下)工作流的中间产物落盘正好是这种原料的形态:每步产出可回溯,失败轨迹完整保留,接一段复盘生成+微调就是一个自进化闭环的雏形。每天免费 4500 万 token 的额度,把「复盘→再试」的循环跑起来不心疼。

「学会解释」和「学会做事」的关系,这篇给出了第一个规模化答案:解释本身就是训练信号。

(BuddyMe 每日免费 4500 万 Token)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询