本地黑盒记忆 —— 检索层已在 LongMemEval-S 全 500 题上三项指标全面碾压 mem0,同时保持全本地部署与 14× 复现成本优势。外加 drift 检测与跨 agent 合约。
vs mem0 2.0.19(0.774 / 0.916 / 0.834):三项 +11.6 / +6.2 / +9.5pt
客场反超 mem0(0.592 / 0.802):+5.2 / +8.8pt
大语料泛化成立;单会话型崩盘 0.20 → 0.93 修复
超 Mem0(37.09) · Zep(39.97) · MemOS(42.55)
42.6% → 75.4%(读取端分型路由,同样的记忆同样的题);剔除 71 道判官故障题为 81.6%(双口径强制披露)。分型:ssu 97.1% · ssa 83.9 · ku 80.8 · ssp 80.0 · ms 69.2 · tr 62.4 · 定案成绩册与证据链
检索层武器:utterance 分型路由块检索 + BM25/dense 混合 + 时间锚。失败实验(rerank 有害 / K 截断无效 / 小模型换装无效 / LoRA 检索增强全量验证持平未采用)同样公开:完整证据链
| compass | mem0 | Letta | Zep | |
|---|---|---|---|---|
| LongMemEval-S 检索(同题对照 · 各用默认嵌入) | 0.890 / 0.978 / 0.929 | 0.774 / 0.916 / 0.834 | n/r | n/r |
| LOCOMO 检索(n=1986) | 0.644 / 0.890 | 0.592 / 0.802 | n/r | n/r |
| LongMemEval-V2 官方基准(451 题 agent 轨迹记忆) | web 40.0% / ent 38.4%(untuned 19.6 / 12.8;论文口径 frontier ≤14.1%;判分口径修正后 9/2) | n/r | n/r | n/r |
| Drift 检测 | ✅ AUC 0.83 | ❌ | ❌ | ❌ |
| 数据不出本机 | ✅ 黑盒本地 embed | ☁ 抽取上云 | 部分 | ☁ |
| 复现成本(500 题) | ~$3.50 | GPT-4o-judged 栈 ~$50+ | ||
生成 token · 接云 MCP 桥 · 写 .mcp.json · 端到端自检。适配 Claude Code / Desktop · Cline · Cursor · Continue.dev · Zed。全部四种安装方式 →
BGE-m3 本地 embed 原文,不调 LLM 抽取、不建图、数据不出机器。检索层 SOTA(见上)。
记忆召回了拦不住 AI 这次破规矩 —— compass 在 agent 动作前对照失败模式锚点打分,AUC 0.83,p95 <50ms。白盒架构结构性做不了。
多 agent 共享文件协作时,自动推导隐式合约、追踪闭合、审计假闭环。四对话框 28 小时田野实录公开。