每日 Harness 开源 · Source
返回本期 · Back to 2026-06-29

开源 / 项目 · Projects2026-06-29 · Monday, June 29, 2026

Caliper

github.com原文 ↗

Caliper
Caliper 把 agent skill 可靠性测试产品化:同一任务运行 k 次,计算 pass@k,并可同时跑 baseline 判断 skill 是否真的改善了裸 agent。README 示例中 “With skill” 为 98%、“No skill” 为 55%、Delta +43%,任务规格支持 LLM judge 的 `expect:`,也支持本地 Python `assert:` 做确定性检查。每次 attempt 会在隔离临时 home 中运行并保存 transcript 和 JSON 结果,因此它不只是一次性 demo runner,而是能放进 skill 迭代周期里的回归工具。它值得上手的地方在于把提示词、skill 文件和 agent 版本变化造成的随机性变成可比较的实验数据。
浏览

评论 · Comments