每日 Harness 开源 · Source
返回本期 · Back to 2026-06-29

开源 / 项目 · Projects2026-06-29 · Monday, June 29, 2026

Agent Memory Bench

github.com原文 ↗

Agent Memory Bench
Agent Memory Bench 将 agent memory 的失败模式拆成 retraction、collision、recall、conflict 四类,并用 13 个场景离线跑榜。README 中 reference baseline 的差异很刺眼:`typed-constraint` 总分 92%,`keyword` 46%,`recency` 23%;作者指出传统检索相关性可能把三者看得差不多,但实际回答正确率完全不同。接口也很小,只需实现 `remember(text)` 和 `query(question)` 等方法即可接入。这个 benchmark 值得看,因为它把“记住了什么”从向量相似度问题拉回事实时效、实体绑定和冲突消解问题。
浏览

评论 · Comments