AI Agents Do Not Fail Alone: The Context Fails First
arxiv.org原文 ↗
这篇提出 COMPASS 框架,用完整性、一致性、连贯性、相关性、可信度、时效性和可控性七个标准衡量 agent 上下文质量。作者分析检索、编码和客服 agent 的执行 trace,指出许多下游动作失败之前已经出现上下文缺陷。它把 agent 可靠性问题从“模型最后一步答错”前移到信息进入工作记忆的全过程。
–浏览
arxiv.org原文 ↗
评论 · Comments