Structured Feedback Improves Repair in an LLM Agent Loop
arxiv.org原文 ↗
作者提出 VeriHarness,让外部验证器控制候选接受、预算和执行 trace,并比较不同反馈接口对修复循环的影响。在 ARC-AGI 修复任务中,GPT-4.1-mini 使用结构化反馈达到 9.0%,原始诊断为 0.9%,无反馈为 0.0%。这个结果把“给模型更多错误信息”细分成反馈格式问题,显示结构化接口比堆原始日志更能转化为修复动作。
–浏览
评论 · Comments