这篇论文把 Agent skill 当成可单独评估的知识 artifact,而不是把它埋在完整 agent app 的总体分数里。作者从 500 个真实世界 skills 生成 1,000 个任务,附带 instruction-following 与 goal-completion rubric,并在 19 个 proprietary 与 open-source agent-model configurations 上测试。结论不是“skill 总是有用”这么粗,而是模型是否遵循 skill 中编码的 workflow 会显著影响收益;对于正在把团队规范写成 skill 的组织,这提供了更细的验收面。
–浏览
评论 · Comments