☰
读懂Mnemosyne的BEAM基准测试:65.2%的成绩单从何而来,你如何复现
2026/9/28 21:25:24 网站建设 项目流程

读懂Mnemosyne的BEAM基准测试:65.2%的成绩单从何而来,你如何复现

【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne

Mnemosyne 是一个零云端的本地 AI 记忆系统——基于 SQLite、仅需一个纯 Python 依赖,即可为任意 Agent 提供长期记忆。在 ICLR 2026 提出的 BEAM 长对话记忆基准测试中,Mnemosyne v3.0.0 在 100K 规模拿下 65.2% 的端到端成绩。本文将带你读懂这份成绩单的每一个数字:BEAM 测的是什么、65.2% 如何一步步加出来、MEMORIA 事实引擎贡献了多少分,最后给出在你的硬件上复现这套基准测试的完整步骤。

一、Mnemosyne 是什么:给 AI 装一块"本地硬盘"

在讲分数之前,先 30 秒理解被测对象。Mnemosyne 的定位是一句话:

Zero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency. (零云端的 AI 记忆,随处可用,SQLite 存储,仅一个纯 Python 依赖)

它的记忆全部落在一个 SQLite 文件里,不需要任何外部服务。数据写入时走 FTS5 全文检索 + 向量搜索双通道,sleep()整合阶段再把工作记忆压缩为情景摘要。v3.0.0 新增的MEMORIA 事实引擎则负责结构化提取:时间事实三元组(valid-from/to 时间窗)、指令存储、偏好版本链——这正是后面 65.2% 成绩的核心功臣。

二、BEAM 基准测试到底在测什么

BEAM(Benchmark for Evaluating Agent Memory,ICLR 2026)是专门衡量"AI 记忆系统"的考试:给系统灌入超长对话,然后出 10 类能力题考它还记得多少。

Mnemosyne 官方评测走的是完整端到端协议,四个环节缺一不可:

  1. 摄入——把 BEAM 对话灌入 Mnemosyne 的记忆库(含实体提取、事实三元组、主动链接);
  2. 检索——针对每道探测题调用recall()取回相关记忆;
  3. 作答——LLM 基于取回的记忆回答问题(本次跑分用 Llama 3.3 70B);
  4. 裁判——另一个 LLM 按评分细则(rubric)逐题打分(本次用 DeepSeek V4 Flash)。

⚠️一个必须知道的"裁判差异":横向对比表中 Hindsight 的 73.4% 是用 Llama-4-Maverick 当裁判打的分,而 Mnemosyne 的 65.2% 用的是 DeepSeek V4 Flash。不同裁判打出的分数不能直接比较——项目在文档中对此做了透明披露,这点在解读榜单时很重要。

三、65.2% 成绩单逐行拆解

100K 规模总分对比

系统100K 得分说明
Mnemosyne v3.0.065.2%本地优先、单 SQLite 文件
Hindsight73.4%不同裁判模型,见上文提醒
Honcho63.0%云端服务
LIGHT35.8%—
RAG 基线32.3%—

100K 即每段对话约 10 万 token 量级的记忆语料,已经超出任何模型上下文窗口——不靠"直接看完",只能靠"记得住、找得回"。

10 项能力分项得分(100K)

能力得分一句话解读
ABS拒答100.0%满分!问到语料里没有的问题时,它知道说"不知道"而不是瞎编
IE信息提取91.5%从 MEMORIA 结构化事实表中精准取数
MR多跳推理87.5%缺口分析 + 递归再查询,把分散多轮的线索串起来
TR时间推理75.0%带 valid-from/to 时间窗的事实三元组支撑日期类推理
IF指令遵循62.5%结构化指令存储 + 真实性加权检索
SUM摘要55.6%LLM 整合压缩情景摘要且不丢信号
PF偏好遵循54.5%偏好事实带历史版本追踪
CR矛盾消解50.0%情景记忆 + 结构化事实联合搜索捕捉矛盾
KU知识更新50.0%上下文感知的键名防碰撞,事实版本链保留历史
EO事件排序25.0%最难项:严格 JSON 输出模式减少了跑题,但排序仍困难

10 项平均 = 65.2%。可以看出成绩结构非常"健康":信息提取、多跳推理这类"记忆基本功"接近满分,弱项集中在事件排序(EO)这类公认最难的时序任务上,且拒答能力满分意味着系统宁可承认不知道,也不编造——这是生产可用的记忆系统最关键的品性。

四、为什么能从 35.4% 跃升到 65.2%?

这版成绩不是"调参调出来的",而是 v3.0.0 引入 MEMORIA 事实引擎后的架构性提升。对比 v2.5(35.4%)的分项变化:

能力v2.5v3.0.0提升
MR 多跳推理16.7%87.5%+70.8pp
ABS 拒答50.0%100.0%+50.0pp
TR 时间推理29.2%75.0%+45.8pp
KU 知识更新16.7%50.0%+33.3pp
CR 矛盾消解35.4%50.0%+14.6pp
IE 信息提取80.5%91.5%+11.0pp

最大的三个跃升——多跳推理(+70.8)、时间推理(+45.8)、知识更新(+33.3)——恰好就是 MEMORIA 结构化事实三元组与递归缺口分析瞄准的能力。换句话说:成绩单涨分的位置,和架构改造的位置完全重合,这也是这份成绩可信度的来源之一。

摄入性能同样值得关注:188 条消息在36 秒内完成全量 MEMORIA 提取,且全程本地处理、不发起任何外部 API 调用;可选的主动链接(MNEMOSYNE_PROACTIVE_LINKING=1)仅带来约 5% 摄入开销。

五、如何复现:在你自己的硬件上跑 BEAM

好消息是:这套基准测试是确定性的——相同数据集、相同题目、相同评分细则,任何人在自己的机器上都能跑。

复现准备:三步安装

git clone https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne cd mnemosyne pip install mnemosyne-memory[all] pip install datasets numpy # 基准测试专用依赖

再配置一个 LLM 服务密钥(官方跑分走 OpenRouter 协议):

export OPENROUTER_API_KEY="your-key"

快速试跑:先验证环境能跑通

python _benchmarks/evaluate_beam_end_to_end.py --sample 5 --scales 100K

--sample 5表示只抽 5 段对话,100K 规模约15–25 分钟跑完,资源需求:内存约 2–4 GB、数据库磁盘约 500 MB、LLM API 花费约 $0.50–$2。

完整复现:对齐官方成绩单

要复现已发布的 65.2%,需指定与官方相同的作答与裁判模型:

python _benchmarks/evaluate_beam_end_to_end.py \ --model "meta-llama/llama-3.3-70b-instruct" \ --judge-model "deepseek/deepseek-v4-flash" \ --sample 0 --scales 100K

--sample 0表示跑全量对话。想换模型也完全可以——任何 OpenRouter 模型都能接上,但换作答模型分数会浮动,属于"换了学生"而非"换了考卷"。

隔离检索质量:纯召回模式

如果你想单独衡量 Mnemosyne 的"记性"而排除 LLM"聪明"的因素:

python _benchmarks/evaluate_beam_end_to_end.py --pure-recall --sample 5 --scales 100K

--pure-recall会关闭评测框架里的四条"旁路"(时间线预言机、矛盾提示注入、短语-值侧索引、近 12 条原始消息注入),强制所有答案都经由BeamMemory.recall()产出——这是任何严肃对比实验的必选项。

六、读懂结果:三个输出文件

每次运行完成后,results/目录下会生成三个文件(docs/benchmark-results-analysis.md 有完整字段说明):

文件内容用途
beam_e2e_results.json逐题结果 + 环境快照 + 诊断数据深度分析、排查异常
beam_e2e_summary.json各能力平均分汇总一眼看总分榜
paired_outcomes.jsonl每题一行,跨运行追加A/B 对比实验

三个"体检指标"提醒(判断一次跑分是否可信):

  • 裁判模式:metadata.config.pure_recall必须为true,否则分数被框架旁路"注水";
  • 回退率:wm_fallback_rate/em_fallback_rate超过 0.2 说明检索靠弱信号子串兜底,结果要存疑;
  • 噪声底线:约 50 题/对话的样本量下,±2pp 以内的差异基本是噪声,别盯着 1–2 个百分点的波动下结论。

七、延伸阅读

  • 完整成绩单与快速上手:docs/beam-benchmark.md
  • 评测基础设施全参考(环境变量、召回路径、A/B 消融开关):docs/benchmarking.md
  • 结果文件 Schema 与配对分析配方:docs/benchmark-results-analysis.md
  • 端到端评测脚本:_benchmarks/evaluate_beam_end_to_end.py
  • MEMORIA 核心实现:mnemosyne/core/beam.py、mnemosyne/core/veracity_consolidation.py

💡最后一句话总结:65.2% 不是玄学——它由 10 项能力逐题 rubric 打分平均而来,涨分点与 MEMORIA 架构改造一一吻合,跑分协议对任何人的硬件开放。想验证它?一个git clone、一个pip install,半小时后你就能在自己机器上看到第一份成绩单。

【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询