读懂Mnemosyne的BEAM基准测试:65.2%的成绩单从何而来,你如何复现
【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne
Mnemosyne 是一个零云端的本地 AI 记忆系统——基于 SQLite、仅需一个纯 Python 依赖,即可为任意 Agent 提供长期记忆。在 ICLR 2026 提出的 BEAM 长对话记忆基准测试中,Mnemosyne v3.0.0 在 100K 规模拿下 65.2% 的端到端成绩。本文将带你读懂这份成绩单的每一个数字:BEAM 测的是什么、65.2% 如何一步步加出来、MEMORIA 事实引擎贡献了多少分,最后给出在你的硬件上复现这套基准测试的完整步骤。
一、Mnemosyne 是什么:给 AI 装一块"本地硬盘"
在讲分数之前,先 30 秒理解被测对象。Mnemosyne 的定位是一句话:
Zero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency. (零云端的 AI 记忆,随处可用,SQLite 存储,仅一个纯 Python 依赖)
它的记忆全部落在一个 SQLite 文件里,不需要任何外部服务。数据写入时走 FTS5 全文检索 + 向量搜索双通道,sleep()整合阶段再把工作记忆压缩为情景摘要。v3.0.0 新增的MEMORIA 事实引擎则负责结构化提取:时间事实三元组(valid-from/to 时间窗)、指令存储、偏好版本链——这正是后面 65.2% 成绩的核心功臣。
二、BEAM 基准测试到底在测什么
BEAM(Benchmark for Evaluating Agent Memory,ICLR 2026)是专门衡量"AI 记忆系统"的考试:给系统灌入超长对话,然后出 10 类能力题考它还记得多少。
Mnemosyne 官方评测走的是完整端到端协议,四个环节缺一不可:
- 摄入——把 BEAM 对话灌入 Mnemosyne 的记忆库(含实体提取、事实三元组、主动链接);
- 检索——针对每道探测题调用
recall()取回相关记忆; - 作答——LLM 基于取回的记忆回答问题(本次跑分用 Llama 3.3 70B);
- 裁判——另一个 LLM 按评分细则(rubric)逐题打分(本次用 DeepSeek V4 Flash)。
⚠️一个必须知道的"裁判差异":横向对比表中 Hindsight 的 73.4% 是用 Llama-4-Maverick 当裁判打的分,而 Mnemosyne 的 65.2% 用的是 DeepSeek V4 Flash。不同裁判打出的分数不能直接比较——项目在文档中对此做了透明披露,这点在解读榜单时很重要。
三、65.2% 成绩单逐行拆解
100K 规模总分对比
| 系统 | 100K 得分 | 说明 |
|---|---|---|
| Mnemosyne v3.0.0 | 65.2% | 本地优先、单 SQLite 文件 |
| Hindsight | 73.4% | 不同裁判模型,见上文提醒 |
| Honcho | 63.0% | 云端服务 |
| LIGHT | 35.8% | — |
| RAG 基线 | 32.3% | — |
100K 即每段对话约 10 万 token 量级的记忆语料,已经超出任何模型上下文窗口——不靠"直接看完",只能靠"记得住、找得回"。
10 项能力分项得分(100K)
| 能力 | 得分 | 一句话解读 |
|---|---|---|
| ABS拒答 | 100.0% | 满分!问到语料里没有的问题时,它知道说"不知道"而不是瞎编 |
| IE信息提取 | 91.5% | 从 MEMORIA 结构化事实表中精准取数 |
| MR多跳推理 | 87.5% | 缺口分析 + 递归再查询,把分散多轮的线索串起来 |
| TR时间推理 | 75.0% | 带 valid-from/to 时间窗的事实三元组支撑日期类推理 |
| IF指令遵循 | 62.5% | 结构化指令存储 + 真实性加权检索 |
| SUM摘要 | 55.6% | LLM 整合压缩情景摘要且不丢信号 |
| PF偏好遵循 | 54.5% | 偏好事实带历史版本追踪 |
| CR矛盾消解 | 50.0% | 情景记忆 + 结构化事实联合搜索捕捉矛盾 |
| KU知识更新 | 50.0% | 上下文感知的键名防碰撞,事实版本链保留历史 |
| EO事件排序 | 25.0% | 最难项:严格 JSON 输出模式减少了跑题,但排序仍困难 |
10 项平均 = 65.2%。可以看出成绩结构非常"健康":信息提取、多跳推理这类"记忆基本功"接近满分,弱项集中在事件排序(EO)这类公认最难的时序任务上,且拒答能力满分意味着系统宁可承认不知道,也不编造——这是生产可用的记忆系统最关键的品性。
四、为什么能从 35.4% 跃升到 65.2%?
这版成绩不是"调参调出来的",而是 v3.0.0 引入 MEMORIA 事实引擎后的架构性提升。对比 v2.5(35.4%)的分项变化:
| 能力 | v2.5 | v3.0.0 | 提升 |
|---|---|---|---|
| MR 多跳推理 | 16.7% | 87.5% | +70.8pp |
| ABS 拒答 | 50.0% | 100.0% | +50.0pp |
| TR 时间推理 | 29.2% | 75.0% | +45.8pp |
| KU 知识更新 | 16.7% | 50.0% | +33.3pp |
| CR 矛盾消解 | 35.4% | 50.0% | +14.6pp |
| IE 信息提取 | 80.5% | 91.5% | +11.0pp |
最大的三个跃升——多跳推理(+70.8)、时间推理(+45.8)、知识更新(+33.3)——恰好就是 MEMORIA 结构化事实三元组与递归缺口分析瞄准的能力。换句话说:成绩单涨分的位置,和架构改造的位置完全重合,这也是这份成绩可信度的来源之一。
摄入性能同样值得关注:188 条消息在36 秒内完成全量 MEMORIA 提取,且全程本地处理、不发起任何外部 API 调用;可选的主动链接(MNEMOSYNE_PROACTIVE_LINKING=1)仅带来约 5% 摄入开销。
五、如何复现:在你自己的硬件上跑 BEAM
好消息是:这套基准测试是确定性的——相同数据集、相同题目、相同评分细则,任何人在自己的机器上都能跑。
复现准备:三步安装
git clone https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne cd mnemosyne pip install mnemosyne-memory[all] pip install datasets numpy # 基准测试专用依赖再配置一个 LLM 服务密钥(官方跑分走 OpenRouter 协议):
export OPENROUTER_API_KEY="your-key"快速试跑:先验证环境能跑通
python _benchmarks/evaluate_beam_end_to_end.py --sample 5 --scales 100K--sample 5表示只抽 5 段对话,100K 规模约15–25 分钟跑完,资源需求:内存约 2–4 GB、数据库磁盘约 500 MB、LLM API 花费约 $0.50–$2。
完整复现:对齐官方成绩单
要复现已发布的 65.2%,需指定与官方相同的作答与裁判模型:
python _benchmarks/evaluate_beam_end_to_end.py \ --model "meta-llama/llama-3.3-70b-instruct" \ --judge-model "deepseek/deepseek-v4-flash" \ --sample 0 --scales 100K--sample 0表示跑全量对话。想换模型也完全可以——任何 OpenRouter 模型都能接上,但换作答模型分数会浮动,属于"换了学生"而非"换了考卷"。
隔离检索质量:纯召回模式
如果你想单独衡量 Mnemosyne 的"记性"而排除 LLM"聪明"的因素:
python _benchmarks/evaluate_beam_end_to_end.py --pure-recall --sample 5 --scales 100K--pure-recall会关闭评测框架里的四条"旁路"(时间线预言机、矛盾提示注入、短语-值侧索引、近 12 条原始消息注入),强制所有答案都经由BeamMemory.recall()产出——这是任何严肃对比实验的必选项。
六、读懂结果:三个输出文件
每次运行完成后,results/目录下会生成三个文件(docs/benchmark-results-analysis.md 有完整字段说明):
| 文件 | 内容 | 用途 |
|---|---|---|
beam_e2e_results.json | 逐题结果 + 环境快照 + 诊断数据 | 深度分析、排查异常 |
beam_e2e_summary.json | 各能力平均分汇总 | 一眼看总分榜 |
paired_outcomes.jsonl | 每题一行,跨运行追加 | A/B 对比实验 |
三个"体检指标"提醒(判断一次跑分是否可信):
- 裁判模式:
metadata.config.pure_recall必须为true,否则分数被框架旁路"注水"; - 回退率:
wm_fallback_rate/em_fallback_rate超过 0.2 说明检索靠弱信号子串兜底,结果要存疑; - 噪声底线:约 50 题/对话的样本量下,±2pp 以内的差异基本是噪声,别盯着 1–2 个百分点的波动下结论。
七、延伸阅读
- 完整成绩单与快速上手:docs/beam-benchmark.md
- 评测基础设施全参考(环境变量、召回路径、A/B 消融开关):docs/benchmarking.md
- 结果文件 Schema 与配对分析配方:docs/benchmark-results-analysis.md
- 端到端评测脚本:_benchmarks/evaluate_beam_end_to_end.py
- MEMORIA 核心实现:mnemosyne/core/beam.py、mnemosyne/core/veracity_consolidation.py
💡最后一句话总结:65.2% 不是玄学——它由 10 项能力逐题 rubric 打分平均而来,涨分点与 MEMORIA 架构改造一一吻合,跑分协议对任何人的硬件开放。想验证它?一个git clone、一个pip install,半小时后你就能在自己机器上看到第一份成绩单。
【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考