每日 Harness 开源 · Source
返回本期 · Back to 2026-10-02

论文 · Papers2026-10-02 · Friday, October 2, 2026

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability

arxiv.org原文 ↗

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability
Long-Transduction 让模型持续读写并输出依赖上下文的算术、排序、查表和表格变换,同时独立操控上下文长度、输入格式及局部复杂度。七个开放模型从 4K 扩到 128K 时性能跌 62.8%,换输入格式跌 36.5%,提高局部复杂度跌 39.9%。这把长任务失控从笼统的“记忆问题”拆成可重复的状态保持、表示适应和局部操作退化。
–浏览

评论 · Comments