ReMe Tool Memory论文拆解:基于ReMe的经验驱动Agent工具使用方法
【免费下载链接】ReMeReMe: Memory Management Kit for Agents - Remember Me, Refine Me.项目地址: https://gitcode.com/GitHub_Trending/me/ReMe
本文将拆解一篇基于ReMe 智能体记忆管理框架的最新工作ExpG(arXiv:2608.03403):它把历史工具调用当作可学习的"经验",通过 ReMe 的Tool Memory(工具记忆)能力进行挖掘、蒸馏与复用,为 Agent 提供工具的能力边界与最佳实践指导,让"小模型+经验"跑赢"大模型+裸奔"。
ReMe 的定位是Agent 的记忆管理套件(Remember Me, Refine Me):负责记忆的写入、检索、整理与服务化,为上层应用提供向量存储和 HTTP/MCP 接口。而 ExpG 论文关注的是一个更具体的痛点——Agent 到底怎么"用对"工具。
一、论文要解决什么问题:Agent 工具使用的三大陷阱
Agent 调工具翻车,通常只有三种原因:
- 选错工具:任务需要扳手,却拿了锤子;
- 用法不对:工具没错,但参数、时机、依赖关系处理错了;
- 工具本身不合适:这个任务根本不适合用该工具。
论文用一张图直观概括了这三种失败模式,并展示了 ExpG 的解法:为每个工具沉淀一份"使用说明书"式的指导(guidance),在下一次调用前注入给 Agent。
传统做法(Few-shot 示例、DRAFT、Mem0 等通用记忆方案)对工具调用的帮助有限,因为它们的记忆是"扁平"的:把原始对话或原始调用堆进向量库,检索出来的内容噪声大、不可执行。ExpG 的核心思想是——记忆不是越多越好,要蒸馏成可复用的经验。
二、ExpG 三阶段流水线:获取、蒸馏、复用
ExpG 把工具调用视为可学习经验,整条流水线分三步:
1. 经验获取(Experience Acquisition)
从历史工具调用轨迹中分析每次调用的质量:成功与否、耗时、token 成本、参数模式、返回内容,然后按工具聚合为结构化的"经验单元"。
2. 经验蒸馏(Experience Distillation)
- 过滤噪声与无效经验,只保留有代表性的调用模式;
- 用"等价类"视角聚合经验,同时覆盖常见模式与稀有失败模式;
- 由 LLM 把经验总结成可泛化的文本指导,输出四段式结构:
- Core Function:这个工具做什么、什么时候该用;
- Success Patterns:哪些参数模式和场景下好用;
- Common Issues:常见坑及其失败原因;
- Best Practices:2-3 条可执行建议。
3. 经验复用(Experience Reuse)
在后续任务中,按当前要用的工具名检索对应 guidance,注入到工具选择、参数生成、响应整理三个环节,让 Agent 在动态环境和不完美的反馈下依然保持稳定。
💡 一句话理解:ExpG 让 Agent 像熟练工人一样,"用过的工具都留有笔记,下次开工前先翻笔记"。
三、ReMe Tool Memory 的三个关键接口
ReMe 在论文中扮演"记忆基础设施"角色,提供向量存储与服务接口,ExpG 只实现策略。核心是三个 HTTP 接口,摘录自仓库配置 tool_memory_flows.yaml:
| 接口 | 作用 | 流水线位置 |
|---|---|---|
add_tool_call_result | 写入并评估单次工具调用结果,创建/更新该工具的记忆 | 经验获取 |
summary_tool_memory | 分析工具调用历史,生成使用模式与最佳实践指导 | 经验蒸馏 |
retrieve_tool_memory | 按工具名从向量库检索记忆,返回 usage guidance | 经验复用 |
三个接口背后的调用链路是:
add_tool_call_result=parse_tool_call_result_op→update_vector_store_op(先评估打分,再入库);summary_tool_memory=summary_tool_memory_op→update_vector_store_op(先 LLM 总结,再回写);retrieve_tool_memory=retrieve_tool_memory_op(向量检索)。
仓库内提供了一个轻量 HTTP 客户端参考实现 tool_memory.py,封装了上述三个接口及"先蒸馏再检索"的collect_memory组合调用。如果想了解 ReMe 的检索原理,可继续阅读官方文档 docs/zh/memory_search.md。
四、评估与蒸馏的两个核心 Prompt 设计
这是论文最有"工程味"的部分,两个 prompt 在仓库里可直接查看:
① 单次调用评估 prompt(parse_tool_call_result_prompt.yaml)
采用10 分制逐项打分(每项 0/1),覆盖三个维度:
- 使用质量(2 分):该不该现在调?选的工具对不对?
- 输入质量(4 分):必填参数齐不齐?参数合法吗?格式对吗?取值与上下文匹配吗?
- 响应质量(4 分):返回内容有没有用?符合工具本意吗?与输入匹配吗?有助于完成任务吗?
细节设计很考究:系统类工具(mkdir、echo 等)无返回时响应分不扣分;"执行成功(success_flag=1)"不等于"调用质量高",两者独立评估。
② 历史总结 prompt(summary_tool_memory_prompt.yaml)
约束 LLM 基于真实调用历史生成不超过 200 字的 guidance,并有一条"自校验"规则:生成的指导必须能解释全部历史调用,否则继续修订。这避免了从个别案例推出以偏概全的错误指导,也刻意避免写出 "case #3" 这类只对单次调用有意义的内容。
五、实验结果:带经验指导的小模型跑赢无记忆大模型
论文在 MetaTool、API-Bank、BFCL-V3 三个工具调用基准上,对比了 No Method / Few-shot / DRAFT / Mem0 / ExpG 五种方案(完整表格见 benchmark/toolmemory/README_ZH.md)。综合 Pass@1 关键结论:
| 模型 | 无方法 | 最佳对照 | ExpG |
|---|---|---|---|
| GPT-5 nano | 70.82 | 73.98(Mem0) | 79.32 |
| DeepSeek-V3 | 78.92 | 80.70(Mem0) | 82.76 |
| Qwen3-8B | 74.46 | 76.91(Few-shot) | 81.06 |
| Qwen3-235B | 78.13 | — | 85.29 |
三个值得注意的发现:
- ExpG 在所有模型、所有基准上均为组内最优,且对 GPT-5 nano 这类小模型提升最显著(+8.5 个百分点),说明经验指导能部分弥补模型能力差距;
- 收益贯穿工具选择、工具调用、响应生成三个环节,不是单点优化;
- 相比 Mem0 这类"堆原始记忆"的方案,ExpG 的差距在工具调用环节拉开最大——因为蒸馏后的 guidance 直接针对"怎么调对工具"。
六、快速上手:仓库中的参考文件
ReMe 仓库在benchmark/toolmemory/目录下归档了该论文的参考片段,不需要读论文也能把方法跑通一遍:
| 文件 | 说明 |
|---|---|
| benchmark/toolmemory/README_ZH.md | 机制概览 + 完整实验结果表 |
| benchmark/toolmemory/tool_memory.py | Tool Memory 三接口 HTTP 客户端 |
| benchmark/toolmemory/tool_memory_flows.yaml | flow / op 配置,理解接口内部链路 |
| benchmark/toolmemory/parse_tool_call_result_prompt.yaml | 10 分制调用评估 prompt |
| benchmark/toolmemory/summary_tool_memory_prompt.yaml | 历史调用蒸馏为 guidance 的 prompt |
使用方式上:启动 ReMe 的 Tool Memory 服务 → 把历史工具调用通过add_tool_call_result持续写入 → 定期summary_tool_memory蒸馏 → 在 Agent 下一次推理前用retrieve_tool_memory取回指导注入上下文。记忆文件本身也可以在 ReMe Studio 工作区中直观浏览和管理:
总结:这篇论文给了普通用户什么启发
- 记忆要"加工":原始调用记录是原材料,蒸馏后的工具使用指导才是可直接注入的"知识";
- 给每个工具建档案:Core Function / Success Patterns / Common Issues / Best Practices 四段式结构,可直接迁移到你自己的 Agent 工程;
- 评估先于总结:10 分制逐项打分过滤噪声经验,保证蒸馏输入质量;
- ReMe 提供地基,策略自己长:向量存储、服务接口、flow/op 编排由框架负责,经验获取与复用策略留给应用层,这种分层让"经验驱动的工具使用"成为可复用的工程模式。
【免费下载链接】ReMeReMe: Memory Management Kit for Agents - Remember Me, Refine Me.项目地址: https://gitcode.com/GitHub_Trending/me/ReMe
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考