datacurve-ai/deep-swe
github.com原文 ↗
DeepSWE 以 113 个原创长程任务评测编码代理,覆盖 91 个活跃开源仓库和五种语言,参考解平均 668 行。任务不来自公开 issue,手写 verifier 接受不同实现;项目同时指出常见基准平均约 120 行,审计到的 verifier 有 8% 假阳性和 25% 假阴性,因而把污染和评测误差一起纳入设计。
–浏览
github.com原文 ↗
评论 · Comments