ToolPrivacyBench
arxiv.org原文 ↗
ToolPrivacyBench 评测 tool-using LLM agents 的 purpose-bound privacy。摘要指出现有 function-calling benchmark 主要看任务完成和 API 正确性,隐私 benchmark 又常看最终回答,二者都容易漏掉工具调用过程中的越界访问。它把隐私问题放在 agent 行动轨迹里观察,适合检验“为了完成 A 目的而获得的数据,是否被挪用到 B 目的”。
–浏览
评论 · Comments