每日 Harness 开源 · Source
返回本期 · Back to 2026-07-04

论文 · Papers2026-07-04 · Saturday, July 4, 2026

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

arxiv.org原文 ↗

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
Vera 提供端到端 agent 安全测试流程,先自动发现风险,再从执行轨迹里抽取证据,最后用 evidence-grounded verification 判定问题是否成立。论文的关键贡献是把 red-teaming 的主观判断拆成三个可审计步骤,尤其适合有工具调用、文件访问或外部 API 的 agent。它值得读,因为安全测试的难点已从“能否写出坏 prompt”转向“能否大规模证明 agent 真的做了危险动作”。
浏览

评论 · Comments