Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
arxiv.org原文 ↗
Sentinel 不训练专门压缩模型,而是探测 0.5B proxy LLM 的 decoder attention,再用轻量分类器做句子级 relevance 判断。作者认为 query-context relevance estimation 在模型规模间有一致性,因此小 proxy 的注意力信号可用于大模型上下文筛选。LongBench 上最高 5x compression 仍匹配 7B 级压缩系统的 QA 表现;它适合 RAG 噪声长上下文场景,而不是泛化为所有长上下文压缩问题。
–浏览
评论 · Comments