AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning
arxiv.org原文 ↗
AGORA 面向真实 workplace archive,要求 agent 在杂乱文档集合中找证据、解析单位和术语,并完成需要计算或聚合的回答。数据包含 8 个领域集合、9,664 份真实文档、3.72 亿 token 和 362 个问题,规模超过常见模型上下文窗口;8 个模型中最强也只有 59.4% accuracy。这个 benchmark 把 RAG 从“检索一段文本回答”推进到跨文件审计式推理,能暴露企业文档任务里检索、证据链和数值处理的组合短板。
–浏览
评论 · Comments