Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework
arxiv.org原文 ↗
论文把多轮对话中的风险视为可累积状态,持续记录意图漂移、分散指令的拼接效应和敏感信息逐步暴露,而不是逐轮独立分类。框架允许单条消息保持低风险,同时在组合达到阈值时提升响应限制。该思路针对的是“把危险请求拆成多个无害片段”的现实攻击面,也意味着系统必须谨慎处理跨轮记忆和风险衰减。
–浏览
评论 · Comments