ML research agents and overfitting
amazon.science原文 ↗
Amazon 在 8 个数据集上观察到,32-token 提示就能复现探索器大多数策略,单个模型甚至 16 token;相似性更像压缩瓶颈,而不必然是验证集记忆。人为制造的 102 次运行里有 38 次出现超过 10% 的验证/留出差距,移除压缩后优势消失;预训练侧信道和新数据仍是结论的边界。
–浏览
amazon.science原文 ↗
评论 · Comments