AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows
arxiv.org原文 ↗
AEVAL 把包含提示词、脚本、工具和文件操作的 agent skill 封装成可重复测试单元,并记录输入、环境与期望断言。框架支持确定性 fixture、步骤级检查和回归比较,使原本靠人工试玩的 Skill 包可以进入 CI。它解决的是代理工程中经常被忽略的测试层:模型输出可以变化,但工作流契约仍应被稳定验证。
–浏览
评论 · Comments