FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
arxiv.org原文 ↗
FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failure update rule。作者在 10 个 LLM-agent 研究主题上比较了受 AI co-scientist、Agent Laboratory、AI Scientist-v2 启发的 prompt baseline;Gemini-2.5-Flash 复评中 FirstResearch 为 4.86/5,最强 baseline 为 4.38/5,平均分 Pearson agreement 为 0.865。论文也把边界说清:结果仍是初步的,主要依赖 LLM judge 而非人类领域专家,但证书化约束让“听起来合理”的问题形成过程变成可检查对象。
–浏览
评论 · Comments