Rubric
github.com原文 ↗
Rubric 是面向 LLM agent 的 behavior-first eval 框架:它检查调用了哪些工具、参数是什么、顺序和 trace 是否合规,而不是只评估最终文本。README 的 LangGraph 示例里,账户锁定场景因为漏调 `create_ticket` 且调用 forbidden `send_email`,tool_call_accuracy 直接为 0.000;它还支持 PR 中 baseline diff 和自包含 HTML/JSON 报告。这个项目补的是 agent 回归测试里最容易漏掉的“动作正确性”。
–浏览
评论 · Comments