每日 Harness 开源 · Source
返回本期 · Back to 2026-08-22

论文 · Papers2026-08-22 · Saturday, August 22, 2026

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

arxiv.org原文 ↗

基准Agent 记忆其他垂直
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
MemTrapBench 专门构造“检索内容相关且忠实、却会带偏推理”的场景,区分推理固着和信念扭曲,而不是继续只测记忆命中率。
浏览

评论 · Comments