ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment
arxiv.org原文 ↗
ForeSci 把“未来研究判断”变成时间受控 benchmark:模型只能看 cutoff 前的 offline knowledge base,post-cutoff papers 只用于验证。它包含 500 个任务,跨四个快速变化的 AI domain 和四类 decision family。实验显示显式证据组织能改善 traceability 和 factual support,但 agent 仍会 cite 相关证据却预测错研究对象,这个 evidence-decision decoupling 是研究型 agent 很现实的失败模式。
–浏览
评论 · Comments