
读懂Mnemosyne的BEAM基准测试65.2%的成绩单从何而来你如何复现【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyneMnemosyne 是一个零云端的本地 AI 记忆系统——基于 SQLite、仅需一个纯 Python 依赖即可为任意 Agent 提供长期记忆。在 ICLR 2026 提出的 BEAM 长对话记忆基准测试中Mnemosyne v3.0.0 在 100K 规模拿下 65.2% 的端到端成绩。本文将带你读懂这份成绩单的每一个数字BEAM 测的是什么、65.2% 如何一步步加出来、MEMORIA 事实引擎贡献了多少分最后给出在你的硬件上复现这套基准测试的完整步骤。一、Mnemosyne 是什么给 AI 装一块本地硬盘在讲分数之前先 30 秒理解被测对象。Mnemosyne 的定位是一句话Zero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency. 零云端的 AI 记忆随处可用SQLite 存储仅一个纯 Python 依赖它的记忆全部落在一个 SQLite 文件里不需要任何外部服务。数据写入时走 FTS5 全文检索 向量搜索双通道sleep()整合阶段再把工作记忆压缩为情景摘要。v3.0.0 新增的MEMORIA 事实引擎则负责结构化提取时间事实三元组valid-from/to 时间窗、指令存储、偏好版本链——这正是后面 65.2% 成绩的核心功臣。二、BEAM 基准测试到底在测什么BEAMBenchmark for Evaluating Agent MemoryICLR 2026是专门衡量AI 记忆系统的考试给系统灌入超长对话然后出 10 类能力题考它还记得多少。Mnemosyne 官方评测走的是完整端到端协议四个环节缺一不可摄入——把 BEAM 对话灌入 Mnemosyne 的记忆库含实体提取、事实三元组、主动链接检索——针对每道探测题调用recall()取回相关记忆作答——LLM 基于取回的记忆回答问题本次跑分用 Llama 3.3 70B裁判——另一个 LLM 按评分细则rubric逐题打分本次用 DeepSeek V4 Flash。⚠️一个必须知道的裁判差异横向对比表中 Hindsight 的 73.4% 是用 Llama-4-Maverick 当裁判打的分而 Mnemosyne 的 65.2% 用的是 DeepSeek V4 Flash。不同裁判打出的分数不能直接比较——项目在文档中对此做了透明披露这点在解读榜单时很重要。三、65.2% 成绩单逐行拆解100K 规模总分对比系统100K 得分说明Mnemosyne v3.0.065.2%本地优先、单 SQLite 文件Hindsight73.4%不同裁判模型见上文提醒Honcho63.0%云端服务LIGHT35.8%—RAG 基线32.3%—100K 即每段对话约 10 万 token 量级的记忆语料已经超出任何模型上下文窗口——不靠直接看完只能靠记得住、找得回。10 项能力分项得分100K能力得分一句话解读ABS拒答100.0%满分问到语料里没有的问题时它知道说不知道而不是瞎编IE信息提取91.5%从 MEMORIA 结构化事实表中精准取数MR多跳推理87.5%缺口分析 递归再查询把分散多轮的线索串起来TR时间推理75.0%带 valid-from/to 时间窗的事实三元组支撑日期类推理IF指令遵循62.5%结构化指令存储 真实性加权检索SUM摘要55.6%LLM 整合压缩情景摘要且不丢信号PF偏好遵循54.5%偏好事实带历史版本追踪CR矛盾消解50.0%情景记忆 结构化事实联合搜索捕捉矛盾KU知识更新50.0%上下文感知的键名防碰撞事实版本链保留历史EO事件排序25.0%最难项严格 JSON 输出模式减少了跑题但排序仍困难10 项平均 65.2%。可以看出成绩结构非常健康信息提取、多跳推理这类记忆基本功接近满分弱项集中在事件排序EO这类公认最难的时序任务上且拒答能力满分意味着系统宁可承认不知道也不编造——这是生产可用的记忆系统最关键的品性。四、为什么能从 35.4% 跃升到 65.2%这版成绩不是调参调出来的而是 v3.0.0 引入 MEMORIA 事实引擎后的架构性提升。对比 v2.535.4%的分项变化能力v2.5v3.0.0提升MR 多跳推理16.7%87.5%70.8ppABS 拒答50.0%100.0%50.0ppTR 时间推理29.2%75.0%45.8ppKU 知识更新16.7%50.0%33.3ppCR 矛盾消解35.4%50.0%14.6ppIE 信息提取80.5%91.5%11.0pp最大的三个跃升——多跳推理70.8、时间推理45.8、知识更新33.3——恰好就是 MEMORIA 结构化事实三元组与递归缺口分析瞄准的能力。换句话说成绩单涨分的位置和架构改造的位置完全重合这也是这份成绩可信度的来源之一。摄入性能同样值得关注188 条消息在36 秒内完成全量 MEMORIA 提取且全程本地处理、不发起任何外部 API 调用可选的主动链接MNEMOSYNE_PROACTIVE_LINKING1仅带来约 5% 摄入开销。五、如何复现在你自己的硬件上跑 BEAM好消息是这套基准测试是确定性的——相同数据集、相同题目、相同评分细则任何人在自己的机器上都能跑。复现准备三步安装git clone https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne cd mnemosyne pip install mnemosyne-memory[all] pip install datasets numpy # 基准测试专用依赖再配置一个 LLM 服务密钥官方跑分走 OpenRouter 协议export OPENROUTER_API_KEYyour-key快速试跑先验证环境能跑通python _benchmarks/evaluate_beam_end_to_end.py --sample 5 --scales 100K--sample 5表示只抽 5 段对话100K 规模约15–25 分钟跑完资源需求内存约 2–4 GB、数据库磁盘约 500 MB、LLM API 花费约 $0.50–$2。完整复现对齐官方成绩单要复现已发布的 65.2%需指定与官方相同的作答与裁判模型python _benchmarks/evaluate_beam_end_to_end.py \ --model meta-llama/llama-3.3-70b-instruct \ --judge-model deepseek/deepseek-v4-flash \ --sample 0 --scales 100K--sample 0表示跑全量对话。想换模型也完全可以——任何 OpenRouter 模型都能接上但换作答模型分数会浮动属于换了学生而非换了考卷。隔离检索质量纯召回模式如果你想单独衡量 Mnemosyne 的记性而排除 LLM聪明的因素python _benchmarks/evaluate_beam_end_to_end.py --pure-recall --sample 5 --scales 100K--pure-recall会关闭评测框架里的四条旁路时间线预言机、矛盾提示注入、短语-值侧索引、近 12 条原始消息注入强制所有答案都经由BeamMemory.recall()产出——这是任何严肃对比实验的必选项。六、读懂结果三个输出文件每次运行完成后results/目录下会生成三个文件docs/benchmark-results-analysis.md 有完整字段说明文件内容用途beam_e2e_results.json逐题结果 环境快照 诊断数据深度分析、排查异常beam_e2e_summary.json各能力平均分汇总一眼看总分榜paired_outcomes.jsonl每题一行跨运行追加A/B 对比实验三个体检指标提醒判断一次跑分是否可信裁判模式metadata.config.pure_recall必须为true否则分数被框架旁路注水回退率wm_fallback_rate/em_fallback_rate超过 0.2 说明检索靠弱信号子串兜底结果要存疑噪声底线约 50 题/对话的样本量下±2pp 以内的差异基本是噪声别盯着 1–2 个百分点的波动下结论。七、延伸阅读完整成绩单与快速上手docs/beam-benchmark.md评测基础设施全参考环境变量、召回路径、A/B 消融开关docs/benchmarking.md结果文件 Schema 与配对分析配方docs/benchmark-results-analysis.md端到端评测脚本_benchmarks/evaluate_beam_end_to_end.pyMEMORIA 核心实现mnemosyne/core/beam.py、mnemosyne/core/veracity_consolidation.py最后一句话总结65.2% 不是玄学——它由 10 项能力逐题 rubric 打分平均而来涨分点与 MEMORIA 架构改造一一吻合跑分协议对任何人的硬件开放。想验证它一个git clone、一个pip install半小时后你就能在自己机器上看到第一份成绩单。【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考