SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
arxiv.org原文 ↗
SAFARI 处理长轨迹 agent 失败归因时,不把整段 trace 塞给模型,而是让 LLM 用工具主动搜索、读取片段并在短期记忆中组织证据。结果显示 Who&When 在 1M token budget 内比 SOTA 高 20%,TRAIL GAIA subset 在 25K budget 下高 19%,目标 fault 超出原生上下文窗口 5 倍时 precision 仍为 0.58。它把故障分析从“长上下文能力测试”转成信息检索和调查策略问题,适合真实 agent run 的日志规模。
–浏览
评论 · Comments