每日 Harness 开源 · Source
返回本期 · Back to 2026-06-30

论文 · Papers2026-06-30 · Tuesday, June 30, 2026

ToolPrivacyBench

arxiv.org原文 ↗

ToolPrivacyBench
ToolPrivacyBench 评测 tool-using LLM agents 的 purpose-bound privacy。摘要指出现有 function-calling benchmark 主要看任务完成和 API 正确性,隐私 benchmark 又常看最终回答,二者都容易漏掉工具调用过程中的越界访问。它把隐私问题放在 agent 行动轨迹里观察,适合检验“为了完成 A 目的而获得的数据,是否被挪用到 B 目的”。
浏览

评论 · Comments