Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability
arxiv.org原文 ↗
Long-Transduction 让模型持续读写并输出依赖上下文的算术、排序、查表和表格变换,同时独立操控上下文长度、输入格式及局部复杂度。七个开放模型从 4K 扩到 128K 时性能跌 62.8%,换输入格式跌 36.5%,提高局部复杂度跌 39.9%。这把长任务失控从笼统的“记忆问题”拆成可重复的状态保持、表示适应和局部操作退化。
–浏览
评论 · Comments