Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives
arxiv.org原文 ↗
STITCH 从失败轨迹挖出带适用范围和组合契约的 Harness Primitives,再按任务信息选择并编译执行框架;生成和调试机制代码被移到离线库阶段。实验报告相对固定 harness 最多 +12 个百分点,超过人工设计的 Codex CLI,测试时组合开销仅 2.7%,比从零生成任务专用 harness 高效 638 倍。它把 harness 选择从一次性全局配置变成类似编译器的组合问题,但收益依赖原语库覆盖范围。
–浏览
评论 · Comments