每日 Harness 开源 · Source
返回本期 · Back to 2026-09-15

行业动态 · Industry News2026-09-15 · Tuesday, September 15, 2026

ML research agents and overfitting

amazon.science原文 ↗

Amazon 在 8 个数据集上观察到,32-token 提示就能复现探索器大多数策略,单个模型甚至 16 token;相似性更像压缩瓶颈,而不必然是验证集记忆。人为制造的 102 次运行里有 38 次出现超过 10% 的验证/留出差距,移除压缩后优势消失;预训练侧信道和新数据仍是结论的边界。
–浏览

评论 · Comments