每日 Harness 开源 · Source
返回本期 · Back to 2026-09-18

论文 · Papers2026-09-18 · Friday, September 18, 2026

BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents

arxiv.org原文 ↗

BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents
BLINDSPOT 覆盖 22 类攻击、35 个场景、7 个领域,收集超过 2,500 条平均 14.7 轮的工具轨迹,并把结果分成安全完成、正确拒答、错误完成、过度拒答和协议违规五类。13 个模型的评测显示,许多风险不是首轮暴露,而是在连续几轮“看似安全”的状态演化后出现。基准把拒答校准从单轮文本分类推进到带权限和记忆的执行过程,适合检验 agent 的状态依赖失效。
–浏览

评论 · Comments