🧭 Compass · 跨 agent 记忆与可靠性层

本地黑盒记忆 —— 检索层已在 LongMemEval-S 全 500 题上三项指标全面碾压 mem0,同时保持全本地部署与 14× 复现成本优势。外加 drift 检测与跨 agent 合约。

LongMemEval-S P@5 97.8% vs mem0 91.6% LOCOMO 客场反超 +5.2pt EverMemBench 44.4–47.3% drift AUC 0.83 MCP · A2A · MIT

📊 五基准战绩(2026-08 · 全部同题同判据可复算)

LongMemEval-S · 500 题全量

P@1 0.890 · P@5 0.978

vs mem0 2.0.19(0.774 / 0.916 / 0.834):三项 +11.6 / +6.2 / +9.5pt

LOCOMO-10 · n=1986(mem0 主场)

0.644 / 0.890 / 0.740

客场反超 mem0(0.592 / 0.802):+5.2 / +8.8pt

LongMemEval-M · 500 题全量(12× 大语料)

P@5 0.888

大语料泛化成立;单会话型崩盘 0.20 → 0.93 修复

EverMemBench-Dynamic · n=500

44.4% / 47.3%

超 Mem0(37.09) · Zep(39.97) · MemOS(42.55)

端到端 QA · 500 题全量(读取端路由后)

75.4%

42.6% → 75.4%(读取端分型路由,同样的记忆同样的题);剔除 71 道判官故障题为 81.6%(双口径强制披露)。分型:ssu 97.1% · ssa 83.9 · ku 80.8 · ssp 80.0 · ms 69.2 · tr 62.4 · 定案成绩册与证据链

检索层武器:utterance 分型路由块检索 + BM25/dense 混合 + 时间锚。失败实验(rerank 有害 / K 截断无效 / 小模型换装无效 / LoRA 检索增强全量验证持平未采用)同样公开:完整证据链

⚖️ 对比

compassmem0LettaZep
LongMemEval-S 检索(同题对照 · 各用默认嵌入)0.890 / 0.978 / 0.9290.774 / 0.916 / 0.834n/rn/r
LOCOMO 检索(n=1986)0.644 / 0.8900.592 / 0.802n/rn/r
LongMemEval-V2 官方基准(451 题 agent 轨迹记忆)web 40.0% / ent 38.4%(untuned 19.6 / 12.8;论文口径 frontier ≤14.1%;判分口径修正后 9/2)n/rn/rn/r
Drift 检测✅ AUC 0.83
数据不出本机✅ 黑盒本地 embed☁ 抽取上云部分
复现成本(500 题)~$3.50GPT-4o-judged 栈 ~$50+

⚡ 30 秒接入

bash ~/.claude/plugins/nautilus-compass/ops/agent_quickstart.sh my-agent

生成 token · 接云 MCP 桥 · 写 .mcp.json · 端到端自检。适配 Claude Code / Desktop · Cline · Cursor · Continue.dev · Zed。全部四种安装方式 →

🛡️ 不只是记忆 —— 三根支柱

1 · 黑盒长期记忆

BGE-m3 本地 embed 原文,不调 LLM 抽取、不建图、数据不出机器。检索层 SOTA(见上)。

2 · Drift 检测

记忆召回了拦不住 AI 这次破规矩 —— compass 在 agent 动作前对照失败模式锚点打分,AUC 0.83,p95 <50ms。白盒架构结构性做不了。

3 · 跨 agent 合约

多 agent 共享文件协作时,自动推导隐式合约、追踪闭合、审计假闭环。四对话框 28 小时田野实录公开。