返回本期 · Back to 2026-08-15 开源 / 项目 · Projects2026-08-15 · Saturday, August 15, 2026 Self-bench github.com原文 ↗ 基准合成数据与训练环境评测方法编码 Self-bench 从已经完成的本地 agent 会话或合并 PR 找到修改前 commit,自动构造隐藏测试和参考解,再证明原代码失败、参考解通过后导出 Harbor 包。难度分档至少要求 20、50、100 行实现改动并跨 1、2、3 条路径,测试与解答均不暴露给被测 agent。这条流水线让组织用自己的真实变更分布测 coding agent,同时降低公开 benchmark 被训练集记忆污染的问题。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments