论文把 prompt-injection 防御改写成 detector allocation:每个请求先判断哪些检测器可靠、是否需要升级到 LLM judge,而不是固定走单一检测链。SCOUT-450 覆盖更复杂的 agent-facing injections;在安全取向配置下,相比 always-on GPT-4o judge,attack-success rate 降低 46%,total wall-clock 降低 40%,代价是 benign-utility 下降 5.1 个点。它的实用价值在于把安全、延迟和误伤放进同一个可调阈值。
–浏览
评论 · Comments