每日 Harness 开源 · Source
返回本期 · Back to 2026-06-16

论文 · Papers2026-06-16 · Tuesday, June 16, 2026

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression

arxiv.org原文 ↗

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
Sentinel 不训练专门压缩模型,而是探测 0.5B proxy LLM 的 decoder attention,再用轻量分类器做句子级 relevance 判断。作者认为 query-context relevance estimation 在模型规模间有一致性,因此小 proxy 的注意力信号可用于大模型上下文筛选。LongBench 上最高 5x compression 仍匹配 7B 级压缩系统的 QA 表现;它适合 RAG 噪声长上下文场景,而不是泛化为所有长上下文压缩问题。
浏览

评论 · Comments