每日 Harness 开源 · Source
返回本期 · Back to 2026-07-09

论文 · Papers2026-07-09 · Thursday, July 9, 2026

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

arxiv.org原文 ↗

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failure update rule。作者在 10 个 LLM-agent 研究主题上比较了受 AI co-scientist、Agent Laboratory、AI Scientist-v2 启发的 prompt baseline;Gemini-2.5-Flash 复评中 FirstResearch 为 4.86/5,最强 baseline 为 4.38/5,平均分 Pearson agreement 为 0.865。论文也把边界说清:结果仍是初步的,主要依赖 LLM judge 而非人类领域专家,但证书化约束让“听起来合理”的问题形成过程变成可检查对象。
浏览

评论 · Comments