[TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation](https://arxiv.org/abs/2608.17588) - TRUSS 先做证据导向的静态安全门,再把 Skill 放进可控执行环境,记录每次 brokered tool 的 provenance,并把失败回溯到具体内容。对 168 个 SkillInject、155 个 SkillSafetyBench 和 187 个 SkillGenBench 任务,漏洞检测 precision/recall 均为 100%;修复后 GPT-5.5 攻击成功率从 38.71% 降到 19.35%,任务有效率从 17.11% 升至 52.94%。
arxiv.org原文 ↗
–浏览
评论 · Comments