RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation
arxiv.org原文 ↗
RENDER 固定对话历史,系统改变记忆条目、摘要、类型化记录和原始摘录的呈现,隔离“读者看到什么”对记忆评测的影响。500 个 LongMemEval 问题和 9 个模型上,匹配预算的 resolved packet 比新近度截断原始对话高 42.4 - 72.6 个百分点;模板间最好/最差可差 24.6 - 48.8 点。效果在检索噪声和 HotpotQA 上转移,评测报告若省略 artifact 形态就难以复现。
–浏览
评论 · Comments