每日 Harness 开源 · Source
返回本期 · Back to 2026-09-02

论文 · Papers2026-09-02 · Wednesday, September 2, 2026

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

arxiv.org原文 ↗

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
作者把专业任务拆成公开指令和含私有约定、参考表、utility operator 的小型 artifact,并以 provenance、字节一致指令、泄漏审计和 executable witness 证明任务确实被知识门控。15 个校准任务里,一种 frontier 配置拿到 artifact 的通过率为 68.0%,拿不到时为 0%;给出貌似合理但错误的 artifact,在一个任务的五次试验也全错。这个协议能区分“没见过规则”和“不会执行”,但论文明确没有把校准结果外推成后训练收益。
–浏览

评论 · Comments