每日 Harness 开源 · Source
返回本期 · Back to 2026-06-06

论文 · Papers2026-06-06 · Saturday, June 6, 2026

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

arxiv.org原文 ↗

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment
ForeSci 把“未来研究判断”变成时间受控 benchmark:模型只能看 cutoff 前的 offline knowledge base,post-cutoff papers 只用于验证。它包含 500 个任务,跨四个快速变化的 AI domain 和四类 decision family。实验显示显式证据组织能改善 traceability 和 factual support,但 agent 仍会 cite 相关证据却预测错研究对象,这个 evidence-decision decoupling 是研究型 agent 很现实的失败模式。
浏览

评论 · Comments