主题大类 · Topic group
记忆与上下文Memory & Context
本主题共 215 条 · 最早 2026-05-29 · 最新 2026-07-25
2026 年 7 月89
-
Why Software Factories Fail
HumanLayer 认为“软件工厂”失败的根因不是 Agent 数量不足,而是缺少高质量上下文、明确验收和持续反馈闭环。并行编排会放大模糊需求与错误假设,产生更多代码却不一定提高可合并成果。文章把瓶颈从 token 和执行框架转移到规范、评审与环境反馈,反驳了单靠扩大自动化流水线即可获得可靠软件产出的设想。
原文 ↗– -
Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles
作者把人物、组织和事件的关系写入持续更新的 narrative profile,让模型通过检索少量档案完成跨实体推理,而不必显式暴露或查询完整知识图。配套 MemHop 基准覆盖一至五跳问题,用来区分单实体回忆、关系拼接和长链路检索能力。结果所指向的核心取舍是:叙事压缩提高可读性与检索效率,但档案生成阶段一旦丢失关系,后续多跳推理无法恢复。
原文 ↗– -
Marrow
Marrow 为 Claude Code 会话建立本地语义索引,让用户按概念而非文件名搜索过去的决策、错误和实现讨论。数据保留在本机,并通过向量检索与会话浏览界面重新定位上下文。它把一次性聊天日志转化为工程记忆,但索引质量仍受会话内容是否完整、是否含敏感信息影响。
原文 ↗– -
Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory
研究在固定检索器和推理流程下比较逐字对话块与摘要、事实表等结构化记忆工件,发现保留原始措辞往往优于有损抽取。关键原因不是结构化表示毫无用处,而是抽取阶段会提前抹掉语气、条件和跨轮依赖,检索时再也无法恢复。结论把长期记忆设计的优先级重新排为“先保证信息保真,再优化组织形式”。
原文 ↗– -
Amdb
Amdb 用单个 Rust 二进制提供本地代码上下文检索,并以 MCP Server 形式把索引能力暴露给编码 Agent。其重点是快速安装、低运行依赖和在仓库内定位相关符号或文本,而不是上传代码到远程向量服务。对于希望保持代码私有又需要语义检索的团队,这种轻量本地组件具有直接实用性。
原文 ↗– -
Supra Cognitive Modes: A Routed Architecture for Agent Memory
论文提出按问题性质选择记忆模式:事实问题走精确检索,关系问题走图式联结,长历史问题走分层综合。路由器避免每次都把所有记忆塞进上下文,并让不同模式使用各自的压缩与证据组织方式;这种模块化设计的看点在于承认“记住一个事实”和“解释跨会话演化”并非同一种检索任务。
原文 ↗– -
State Compression in Two-Agent LLM Relays
这项工作研究两段式 agent 中,第一个模型把长上下文压成中间状态后,数值、类别和逻辑约束会丢掉多少。作者系统改变摘要预算与约束密度,发现压缩并非均匀损失:看似次要的限定词和否定条件更容易消失,且后续模型通常无法察觉;结论是 relay 设计需要显式的约束槽位,而不能只依赖自由文本摘要。
原文 ↗– -
Prompt Caching in Agents
文章从实际 agent 请求结构解释 prompt cache:只有稳定前缀、相同模型参数和满足供应商阈值的上下文才能命中,频繁改写 system prompt 或在前部插入动态状态都会破坏复用。作者建议把工具定义和长期指令放前面,把时间、轨迹等易变内容后置;这是一篇把缓存命中率与上下文工程直接连接起来的性能分析。
原文 ↗– -
Grounded Forge
Grounded Forge 在摄取阶段就把原始资料转成摘要、结构化任务视图和可引用知识包,查询时不再临时拼装全部上下文。项目把索引结果与应用一起打包发布,强调可重复构建和来源追踪;这种“预计算知识产品”路线以存储换延迟,适合内容相对稳定、查询模式可预见的检索应用。
原文 ↗– -
yvgude/lean-ctx
lean-ctx 用本地 Rust 进程管理代理上下文、记忆、访问控制和持久化记录,对外提供统一接口。它把上下文选择从单次 prompt 拼装提升为独立服务,可在多个 agent 间复用并记录读取历史。轻量本地架构有利于隐私和低延迟,但策略质量取决于压缩、召回与权限规则的组合。
原文 ↗– -
rtk-ai/rtk
RTK 是位于 shell 命令与 LLM 之间的 Rust CLI 代理,先过滤、归并和压缩输出,再送入模型上下文。它针对测试日志、构建输出和版本控制信息中的重复噪声,保留错误与关键差异。项目的收益可直接体现为 token 与注意力预算下降,但过滤规则必须避免删除诊断所需的上下文。
原文 ↗– -
akitaonrails/ai-memory
ai-memory 为不同厂商的 coding agent 保存项目目标、已完成步骤、关键决定和待办,使任务可跨客户端交接。项目关注的是结构化工作状态,而不是无差别存储全部对话。这样可以降低更换模型或终端工具时的上下文损失,同时避免把大量历史原样塞回窗口。
原文 ↗– -
Is Progressive Disclosure All You Need for Long-Context Agents?
论文比较三种长文档供给方式:一次性塞入完整上下文、独立检索器筛选,以及让代理按目录逐步打开材料。结果显示 progressive disclosure 在不少任务上接近完整上下文,同时显著减少 token,但在需要跨文档全局整合时会受早期阅读决策拖累。它给出的不是单一赢家,而是提示“让代理自己找材料”同样需要评估搜索成本和遗漏风险。
原文 ↗– -
HKUDS/LightRAG
LightRAG 把实体关系图检索与向量文本检索结合:文档摄取时抽取实体和关系,查询时可走局部、全局或混合模式。项目支持多种 LLM、向量库、图存储和文档解析器,并提供 API server。它适合需要跨片段关系推理的知识库,但图抽取成本和实体合并质量会影响最终收益。
原文 ↗– -
AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents
AgentBrew 让强教师模型在交互中产出可复用知识,再把这些经验沉淀到弱代理的外部记忆,而不是更新参数。论文在 5 类环境、11 个任务上测试,摘要报告弱模型平均提升 14.8 个百分点,并能持续吸收后续经验。方法把昂贵教师调用转化为可积累资产,但知识条目的筛选与过期管理会决定长期收益。
原文 ↗– -
Accurate and Efficient Long-Term Memory for LLM Agents
论文提出 MOSAIC,把长期记忆组织为带时间信息和实体关系的结构化表示,并用轻量分类器替代大量在线 LLM 判断。摘要报告,MOSAIC 在 LoCoMo 上达到 75.5%,同时把记忆构建时间降至约 1.5 分钟,相比强基线快约 100 倍。它展示了记忆系统不必在准确率和工程成本之间二选一,但效果仍依赖关系抽取与时间归一化的质量。
原文 ↗– -
Your Agentic Workflow’s Cache Keepalive Costs 8x Too Much
文章把代理框架常见的“定时打一条小请求保持 KV cache”拿到三家 API 上实测,结论是固定周期保活可能比按实际驱逐窗口调度贵约八倍。原因不只是 token 单价,还包括缓存写入、读取折扣、供应商隐式驱逐和任务间隔分布。工程上应把保活视为带概率的经济决策:只有下一次调用足够近、前缀足够大且命中折扣高时才续命,而不是把五分钟定时器写死在所有工作流里。
原文 ↗– -
CodeAlmanac
CodeAlmanac 从代理会话中提炼代码之外的知识:为何采用某个结构、哪些不变量不能破坏、跨文件流程怎样串联、过去踩过什么坑。它把 wiki 保存为仓库内 Markdown、本地索引,并要求知识更新走 Git review,使“代理记忆”成为可审查资产而非黑盒数据库;当前支持范围是 macOS、Codex/Claude Code 与 Python 3.12+。这个设计切中了长期代理工作的上下文…
原文 ↗– -
tirth8205/code-review-graph
code-review-graph 构建本地持久代码智能图,让 MCP 和 CLI 工具在 review 与大仓任务中检索代码库结构,而不是反复读全量文件。仓库标语是 “Stop burning tokens. Start reviewing smarter.”,项目描述强调已 benchmark context reductions。对于 coding agents,持久代码地图是降低重复 re…
原文 ↗– -
Provena: Open-Source Library for AI Agent Context Governance
Provena 治理的是 agent “知道什么”:RAG 检索、工具输出、agent message、memory recall、MCP resource 进入 context window 前都可以被记录来源、hash 和时效。README 展示的最小用法是给产生 context 的函数加 `@trail.track`,每次调用写入 SHA-256 content hash、provenanc…
原文 ↗– -
Local-first CLI to make Obsidian vaults searchable for AI agents
NoteBrain CLI 把 Obsidian vault 转成完全本地的 AI agent 知识后端,索引 markdown 到嵌入式 ChromaDB。它用 `all-MiniLM-L6-v2` ONNX embedding 做 semantic search,用 wikilink graph traversal 找 backlinks/multi-hop/shared tags,并提供 h…
原文 ↗– -
CogniKernel- Local Memory for AI Coding Assistants
CogniKernel 为 Claude Code 与 Codex 提供项目级本地记忆,监听会话 hook,抽取决策、硬/软约束和废弃方案,再在后续 session 注入压缩 context block。它不是 vector database wrapper,而是 event-sourced typed memory log,检索采用 lexical-primary、FTS5 BM25、optio…
原文 ↗– -
Canner/WrenAI
WrenAI 是面向 AI agents 的 open-source GenBI 项目,用可信 context layer 支撑 text-to-SQL、dashboard、charts 和 SQL 生成。仓库描述覆盖 BigQuery、Snowflake、PostgreSQL、ClickHouse、Redshift、Databricks 等 20+ 数据源。它的重点不只是“自然语言问数据库”,而…
原文 ↗– -
Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
论文指出生产 LLM 成本同时受 prompt caching 与 prompt compression 影响,而 query-aware compression 会机械破坏 prefix-strict cache。作者在 Anthropic Sonnet 4.6 上测到两层 cache 结构:约 3,500 tokens 是阈值,低于阈值的 30-call session hit rate 停在…
原文 ↗– -
Amnesia - audit Claude Code's memory for contradictions
Amnesia 面向 Claude Code 长期 memory store 的腐化问题:过期事实、跨项目泄漏、重复规则和互相矛盾的记忆。它会扫描 `~/.claude/projects//memory/`,把 memory 显示成项目着色的 force graph,并调用本机 `claude` CLI 标记 contradiction、stale fact、duplicate 和 misfile…
原文 ↗– -
upstash/context7
Context7 的仓库描述是给 LLM 和 AI code editors 提供 up-to-date code documentation。项目要解决的是模型训练知识过期导致的 API 幻觉:把库名或开发上下文映射到当前版本文档,再给 agent 编码时使用。它不是另一个聊天界面,而是文档事实源和开发工具之间的中间层。GitHub Trending 里这类项目增多,说明 agent 生态已经把…
原文 ↗– -
OpenAI reduces Codex Model Context Size from 372k to 272k
OpenAI Codex 仓库 PR 文件显示模型上下文大小配置从 372k 调整到 272k。digest 把它放进行业新闻是合理的:这是可见的产品运行配置变化,而不是 README 功能点。正文只按文件差异本身解读,它说明某个配置路径里的可用上下文预算收窄了 100k tokens。背后的容量、成本或质量原因没有在条目中给出,因而不应把这条写成策略结论。
原文 ↗– -
Knowledge graph skill for Claude/Kimi Code
SysEdge 是给 Claude Code / Kimi Code CLI 团队用的本体知识图谱,用节点记录需求、用例、功能、测试、缺陷和架构标准。页面把它的收益放在“显式项目记忆”上:能查询哪些需求没有测试、哪些缺陷关联了 PII、哪些 ADR 没有落实到代码。Formbricks 案例中,orientation token 从 14,512 input+output 加 1,797,494…
原文 ↗– -
I burned all my tokens researching how to save tokens
Quesma 的文章介绍一个减少研究 token 消耗的自定义 deep research pipeline。标题里的反讽很直接:作者先在研究阶段花掉大量 token,再通过管线化抓取、筛选、压缩和上下文复用降低后续成本。技术重点是把“让模型读完所有材料”拆成分阶段检索、摘要、过滤和预算控制,而不是把长上下文当成唯一解决方案。它对 LLM 工程的启发在于,研究质量和 token 成本之间可以靠流程…
原文 ↗– -
Graphify-Labs/graphify
Graphify 是 AI coding assistant skill,目标是把代码、schema、脚本、文档和媒体转成可查询知识图谱。它不只做文本搜索,而是把项目资产抽取为节点与关系,让 agent 能查询代码结构、数据模型和文档之间的联系。这个方向的价值在大型代码库中更明显:agent 需要的不是更多上下文文本,而是能回答“这个功能、表、脚本和测试怎么关联”的结构化索引。Graphify 的…
原文 ↗– -
Track, Rank, Crack
论文提出 epistemic working memory,通过显式记录已确认、待验证和待探索信息来改善多跳推理。track、rank、crack 三个动作分别负责维护状态、排序缺口和推进求解。它的价值在于把 agent 的中间认知状态外显出来,减少多跳任务中“看似在推理、实际在混合猜测和遗漏”的不可观察性。
原文 ↗– -
TencentCloud/TencentDB-Agent-Memory
TencentDB-Agent-Memory 是本地运行的 agent 长期记忆系统,使用四层渐进式 memory pipeline。它围绕记忆写入、整理、检索和保存组织 agent 上下文,使交互经验可以被长期查询。项目值得观察的是企业数据库团队如何把记忆系统产品化,而不是只做向量库 demo。
原文 ↗– -
Open-source memory for coding agents, synced over SSH
deja-vu 为 coding agents 提供本地项目记忆,并通过 SSH 在机器之间同步。项目的做法是把上下文、决策和项目背景保存为开发者可检查的本地资料,而不是绑定在某个云端助手会话里。它对多设备开发尤其直接:agent 记忆可以跟着项目移动,同时仍保持普通文件的可审阅性。
原文 ↗– -
Guardian Angels: LLM Personalization for Productivity and Security
Gwern 讨论个性化 LLM 助手如何同时承担生产力增强和安全防护角色。文章涉及长期记忆、用户画像、提醒、过滤和风险拦截等能力,并把它们放进“guardian angel”式个人代理设想。它的核心张力是:助手越理解用户,越能提前行动,也越需要边界、审计和可撤销控制。
原文 ↗– -
Critic Experience Bank
论文提出 Critic Experience Bank,用自演化经验库支持 step-level confidence estimation。它把 critic 在历史步骤中的判断沉淀下来,供后续 agent 动作估计可靠性,而不是只在终局看 success/fail。这个方向把 agent 调试粒度拉到单步行动,适合分析复杂任务中“哪一步开始不可信”。
原文 ↗– -
What Context Does a Coding Agent Actually Need to Act?
论文把 coding agent 的上下文需求分成定位工作点与执行编辑两个阶段,并对 SWE-bench Verified 的 96 个任务做人工审计。一个关键数字是 49% 的任务需要语义相关但词面不相似的外部信息;在约 10K token oracle 编辑上下文下,Claude Sonnet 4 的理论解决率上限是 70.2%,而现有检索方法仍低 43.8 个百分点。这说明“长上下文”并不等…
原文 ↗– -
MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
MemDecay 提出 region-aware KV cache eviction,按上下文区域管理长轨迹推理中的缓存保留。它区分系统指令、用户目标、工具输出、历史推理和检索材料等不同区域,避免把所有 token 当作同等可驱逐对象。这个设计贴近 agent 推理的真实结构:有些早期约束很短却关键,有些近期工具日志很长却可能只需短期保留。
原文 ↗– -
GRASP: GRanularity-Aware Search Policy for Agentic RAG
GRASP 处理 Agentic RAG 中常见的三连决策:什么时候检索、用哪种检索、返回多粗粒度的上下文。论文把这些选择合成一个 granularity-aware search policy,让 agent 在文档、段落和更细片段之间按任务状态切换。它的技术看点不是再堆一个 retriever,而是把检索成本、证据完整性和上下文污染放进同一控制策略。
原文 ↗– -
Context Warp Drive
Context Warp Drive 做确定性 context compaction,明确不调用 LLM 生成摘要。它用规则化方式裁剪、保留和重排 agent 上下文,以降低 token 占用并避免总结模型引入遗漏或改写。这个项目的亮点是可解释性:压缩结果来自确定规则,调试时不必再追一个摘要模型是否说错。
原文 ↗– -
Alluvia
Alluvia 做的是本地 AI 会话历史挖掘,目标来源包括 Claude Code、Cursor 和 ChatGPT。项目把分散在不同工具里的提示、代码讨论和模型回复索引到本机,便于跨工具找回旧上下文。它的现实意义在于,AI coding 的知识资产正在沉淀在聊天记录里,而这些记录通常比普通代码搜索更敏感。
原文 ↗– -
Agentic Context Learning with Self-Discovered Specification
这篇论文讨论 inference-time context learning 中的一个更难问题:模型要先从上下文里发现隐含规格,再把规格应用到新任务。方法围绕 self-discovered specification,让 agent 抽取格式约束、操作规则和任务边界,再进入执行阶段。它的看点在于把 few-shot/context learning 从“看例子模仿”推进到“从上下文重建任务规范”…
原文 ↗– -
volcengine/OpenViking
OpenViking 是面向 AI agents 的 context database,整合 memory、knowledge RAG 和 skills。它试图把长期记忆、知识检索和可调用能力放到同一上下文层中,解决 agent 多轮任务中的资料找回问题。这个方向的成败会取决于检索精度、记忆更新策略和权限隔离。
原文 ↗– -
Wisp
Wisp 是私有桌面 AI overlay,可以从当前应用抓取文本、截图等上下文,并支持 MCP。它把桌面正在发生的状态直接提供给助手,而不是要求用户手动复制窗口内容。这个项目值得观察的地方在于端侧上下文获取、隐私边界和工具协议如何组合成日常桌面助手。
原文 ↗– -
Kote
Kote 从 AI chat 和 Git 历史中自动捕获工程上下文,供后续检索和复用。它试图解决 coding-agent 多轮工作中的上下文断裂:一次会话里解释过的架构、约束和改动原因,下一次不应全部重来。项目的看点在于把对话和版本历史都纳入工程记忆,而不是只索引当前代码文件。
原文 ↗– -
Claude Code sends 33k tokens before reading the prompt; OpenCode sends 7k
Systima 对 Claude Code 和 OpenCode 的会话启动 token overhead 做日志级对比。标题给出的关键数字是:Claude Code 在读取用户 prompt 前发送约 33k tokens,OpenCode 约 7k。文章把 agent 成本从“每次回答用了多少 token”拆到启动上下文阶段,这对延迟、费用和隐私评估都很具体。
原文 ↗– -
Capn-hook
Capn-hook 是面向 coding agent 的 hook 工具,用来记录和复用已经探索过的代码上下文。它瞄准“同一个项目里反复 grep、反复读同一批文件、反复重建调用链”的低效模式。通过把探索痕迹变成可再注入上下文,项目让 agent 会话之间具备更强连续性。
原文 ↗– -
VoltAgent/awesome-design-md
awesome-design-md 收集流行产品设计系统的 DESIGN.md,供 coding agent 生成一致 UI 时参考。它把品牌、组件、布局和交互约束转成 agent 易读的 Markdown,而不是只给人类设计师看 Figma。这个仓库的实际意义在于提升 AI 生成前端的约束质量,减少“能运行但不像产品”的界面。
原文 ↗– -
Remember When It Matters
论文提出 proactive memory agent,用于长程任务中在恰当时刻重新浮现历史状态。它维护任务事实、过往尝试、诊断和未完成子目标,并在上下文膨胀后主动判断哪些记忆应该回到当前推理链。这个方向把记忆系统从“向量库召回片段”推进到“围绕任务进展做时机判断”。
原文 ↗– -
Context Graphs for Proactive Enterprise Agents
论文提出 context graph,让企业 agent 在用户发问前就能基于工作上下文发现可行动信息。图中显式连接用户、任务、文档、工作流和权限,并把 provenance、recency、permission、actionability 作为核心元数据。它值得放进 agent 基础设施讨论,因为主动性不再只是“多轮聊天更积极”,而是被建模成可审计的上下文图更新与触发。
原文 ↗– -
datawhalechina/all-in-rag
all-in-rag 是 Datawhale China 的中文 RAG 全栈教程,目标是从理论到实践构建检索增强生成体系。README 列出的主线包括 RAG 基础、数据加载/清洗/文本分块、向量与多模态 embedding、向量数据库与索引优化、混合检索、query construction、Text2SQL、生成集成、系统评估和项目实战。GitHub 页面显示约 9.3k stars、4.6…
原文 ↗– -
Trace - open-source, self-organizing memory for LLM agents
TRACE 是一个 Python agent memory library,把对话历史组织成 hierarchical B+Tree 和 vector retrieval 结合的长期记忆结构。仓库分成 `trace_memory/` 引擎与 `nexus_terminal/` demo chatbot;它用 TopicNodes 与 MessageNodes 保存分支语义,再用 cosine se…
原文 ↗– -
StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems
StateFuse 解决的是多 agent 分支、重试、replica 写入中观察相互冲突的问题,选择保留冲突而不是用 overwrite 规则提前压平。它基于标准 OpSet/CRDT merge,定义 agent-facing semantics:immutable history、explicit conflict objects、claim_id/claim_ref correction…
原文 ↗– -
Onboard-CLI, a LLM powered and AST-based tool to visualize codebase
Onboard-CLI 是一个 Go 写的本地 CLI 加 React Flow 可视化器,用 Tree-sitter 做 AST slicing,把大型代码库映射成结构拓扑图。README 列出 5+ 内置解析器(Go、TypeScript、JavaScript、Python、Java),`onboard map` 会启动本地 canvas,`onboard drift` 可按 `archite…
原文 ↗– -
Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents
这篇论文把 agent 的 memory 从“每轮最多查一次的外部工具”移动到 observe-reason-act 循环内部,让每一步都能读写记忆。关键实验把延迟作为变量:in-process store 约 100us,云端 110ms round trip 下 redundant actions 从 0/12 升到 7.2/12;在 bounded window 中,in-loop memo…
原文 ↗– -
FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference
FreqDepthKV 针对长上下文推理中的 KV cache 内存与带宽瓶颈,把相邻层 KV states 分解成共享低频 depth components 和稀疏高频 residuals。它用轻量 online probe 判断 attention heads 应使用 shared-depth、residual-depth 还是 exact cache mode,从而不用 retraining…
原文 ↗– -
Backlog - tasks and contexts manager for AI coding agents
Backlog 是 local-first task/context manager,把 coding agent 的任务、计划、文档、记忆和活动日志放进同一个 SQLite DB,而不是留在超长 chat thread 里。每次写入都带 actor attribution,比如 `human:alice` 或 `ai:claude-code`;CLI、web UI、skills 和 MCP 都读…
原文 ↗– -
Akashic: A Low-Overhead LLM Inference Service with MemAttention
Akashic 处理的是长会话 agent 反复回放全部历史带来的 prefill、上下文长度和证据淹没问题。它用 MemAttention 把上下文组织成 bounded chunks,并显式建模 chunk 之间的语义关系;系统层还做 hardware-software co-designed memory placement,把可能一起取回的 chunk 放近,减少检索碎片和 I/O。摘要报…
原文 ↗– -
Shadow Web
Shadow Web 为 LLM agent 压缩网页 token 表示,把网页转换成更适合模型消费的紧凑内容。它试图剔除导航、重复 DOM 文本和页面噪声,同时保留 agent 浏览需要的主要信息。这个工具的技术焦点是网页理解成本:长网页不是不能读,而是上下文预算和相关性管理会迅速变差。
原文 ↗– -
Revector
Revector 是 Qdrant 的 schema migration 工具,作者把它类比为向量数据库版 Alembic。它管理 collections、vectors、payload indexes 等结构变化,让向量库 schema 演进可以进入版本化 migration 流程。随着 RAG 和向量检索进入生产系统,这类工具把“向量库配置”从一次性脚本变成可审计变更。
原文 ↗– -
PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents
PLACEMEM 将 lifelong agent 的记忆层放到计算预算下设计,讨论哪些信息应持久化、何时修正、运行时是否值得检索。它把 memory plane 视作有放置策略和成本模型的系统组件,而不是无条件增长的外部存储。这个视角对长期运行 agent 很关键,因为检索本身也会消耗延迟、token 和推理注意力。
原文 ↗– -
PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving
PEEK 针对 LLM serving 中 KV cache 的调度和淘汰,利用排队请求之间的前缀共享来预测缓存价值。它的关键思想是 eviction 不只看当前 cache,还看队列里即将到来的请求是否能复用这些前缀。对高并发推理服务来说,这把 KV cache 从被动显存占用变成了可预测的队列资源。
原文 ↗– -
Object-Centric Environment Modeling for Agentic Tasks
这篇提出用对象为中心的环境模型记录 agent 交互经验,把实体、属性、关系和状态变化从原始日志里抽出来。相比把历史都塞进 transcript 或向量库,对象视图更适合做一致性检查、状态复用和后续规划。论文的意义在于把 agent memory 往可维护状态模型推进,而不只是“存更多上下文”。
原文 ↗– -
MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents
MRMS 提出多分辨率记忆基底,把个人上下文、外部证据和可修订记忆分层处理。它避免把所有记忆都压缩成同一类摘要或 embedding:证据需要可追溯,状态需要可更新,长期偏好又需要稳定保留。论文的可读点在于它直接处理“长期 agent 会记错、会过期、会混淆证据和结论”这个现实问题。
原文 ↗– -
From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving
这篇综述将 KV cache 管理按 locality、lifetime、ownership 和 substrate 分类,从单卡 tensor buffer 扩展到分布式内存层级。它覆盖显存、主存、远端存储和跨请求共享等设计面,说明 KV cache 已经不是简单优化项,而是 LLM serving 系统结构的一部分。适合用来梳理近期 PagedAttention、prefix cache、of…
原文 ↗– -
CoACT: Action-Preserving Observation Compression for Coding Agents
CoACT 处理 coding agent 的上下文膨胀问题,但目标不是做漂亮摘要,而是压缩后仍保持原本会采取的行动。论文把代码、终端输出和环境反馈中的信息按“是否改变下一步动作”来筛,避免把关键报错或文件状态压没。它值得看的是评估目标发生了变化:压缩质量由后续行动保持程度衡量,而不是摘要相似度。
原文 ↗– -
Claude Code Live Memory
Claude Code Live Memory 是 Claude Code plugin / MCP server,用低成本模型持续维护代码库记忆。它在编码会话之外提炼项目结构、约定和近期变化,供后续 Claude Code 调用。项目的看点是把代码库理解从“每次重新扫描”改成“持续增量维护”。
原文 ↗– -
Pruning RAG context down to what the answer actually needs
Kapa.ai 在 RAG pipeline 的 reranker 与 generator 之间加入一个小模型 pruner,让它同时看问题和所有候选 chunk,再按 1-5 等级判断哪些 chunk 真会参与答案。生产回放显示它丢掉约 68% context、保留约 96% recall,并在扣除自身调用成本后降低约 34% 查询费用。文章还指出 rerank score 不是跨 query…
原文 ↗– -
OthmanAdi/planning-with-files
planning-with-files 把长任务的计划、发现和进度写入三个 markdown 文件:`task_plan.md`、`findings.md`、`progress.md`。README 的核心比喻是 context window 是易失 RAM,filesystem 是持久 disk,所以重要信息必须落盘。它支持 Claude Code、Cursor、Codex、Gemini CLI…
原文 ↗– -
Two-tier-memory
Two-tier-memory 面向 AI coding agents 提供可查询长期记忆,把短期工作上下文和长期项目知识分层管理。它试图解决长项目中 agent 遗忘历史决策、约束和事实的问题,让模型在需要时检索稳定记忆,而不是把所有内容塞进上下文窗口。这个设计对大型代码库尤其实际,因为项目记忆的可维护性会直接影响 agent 后续修改是否反复踩同一类坑。
原文 ↗– -
Aletheia
Aletheia 面向 Claude Code 和 Codex,提出 uncertainty-loop agent:系统维护 belief state、问题、假设和证据,当不确定性超过阈值时继续搜索和更新,低于阈值再输出。README 明确反对把复杂问题机械拆成 task list,而是让“是否足够确定”成为控制流的一部分。它有技术新意的地方在于把假设、证据和置信度作为 agent 工作记忆,而不…
原文 ↗– -
sopaco/deepwiki-rs
deepwiki-rs 用 Rust 把代码库生成结构化技术文档和 agent 上下文。它面向大型 repo 缺少稳定概览的问题,让开发者或 agent 不必每次从零 grep 代码结构。Rust 本地实现强调性能和可运行性,适合把文档生成纳入 CI 或本地分析流程。
原文 ↗– -
pxpipe
pxpipe 把代码转成图像,再让模型通过 OCR 读取,目标是在 Claude/Fable 等工作流里降低文本上下文成本。这个项目的具体实验点是把代码上下文从 token 序列换成视觉载体,绕开一部分 BPE 计费和窗口压力。它不是通用生产方案,但作为“上下文压缩可以跨模态”的探索很有技术味道。
原文 ↗– -
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
ReContext 提出 recursive evidence replay,用 harness 反复检查模型是否真正利用长上下文中已给出的证据。它关注的不是扩大 context window,而是追踪模型在长文档中是否回到关键证据并保持推理一致。这个问题在法律、审计、研究综述和复杂客服场景都很具体:答案看似合理并不等于证据链被正确使用。
原文 ↗– -
Quicktok
Quicktok 是精确 BPE tokenizer,项目描述称比 tiktoken 更快。它瞄准的是 token 计数、截断、批量预处理和上下文预算估算这类底层路径,而这些路径在高吞吐 RAG 或日志处理系统里会被频繁调用。值得注意的是 tokenizer 性能经常被忽略,但它会直接影响服务端延迟和离线数据处理成本。
原文 ↗– -
MothRAG
MothRAG 是多跳 RAG 项目,强调不依赖图重建来完成跨文档推理。它瞄准的问题是复杂查询常常需要把多段证据串起来,而图构建和维护成本会拖慢迭代。项目值得观察,因为多跳检索如果能用更轻量流程实现,会降低许多企业知识库从单跳问答升级到复杂推理的门槛。
原文 ↗– -
Memorizing session transcripts isn't useful
文章批评 agent 记忆系统直接保存完整会话 transcript 的做法,认为原始对话很快会变成噪声密集、检索困难的历史堆。它主张提炼决策、偏好、约束和长期事实,并记录哪些信息会过期。这个观点切中 agent memory 的核心:记忆不是存储越多越好,而是要把可复用信息从会话流水里蒸馏出来。
原文 ↗– -
Contextify
Contextify 本地索引 Claude Code 和 Codex 会话,支持跨工具检索历史 transcript。它做的不是把所有旧对话塞进 prompt,而是把过往决策、命令、代码修改和讨论变成可搜索材料。对于长期项目,这类工具的核心价值是找回上下文来源,而不是幻想原始 transcript 本身就是高质量记忆。
原文 ↗– -
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory
A-TMA 讨论长期 agent 记忆里的 state-aware failure,尤其是 ghost memory:旧事实、当前事实和状态转移事实在检索时混到一起。论文的关键拆分是把记忆错误和状态变化绑定,要求记忆系统理解事实何时失效、何时被替代。它切中长期 agent 的实际问题:向量相似度能找回相关片段,却不保证找回的是当前世界状态下仍然成立的片段。
原文 ↗– -
ctx - Search the coding agent history already on your machine
ctx 解决 coding agents 没有长期记忆的问题,但不引入 hosted memory service 或图数据库。它把本机已有的 agent transcripts 和 logs 索引到 SQLite,用 ranked text match 找回早前讨论、决策、失败尝试、命令、测试结果和 patch 线索。这个项目的实用性在于它承认“历史已经在你的机器上”,然后给当前 agent 一…
原文 ↗– -
SchemaRAG: Dynamic Large Schema Reduction for LLM-driven Structured Information Extraction
SchemaRAG 针对大而复杂的目标 schema,动态裁剪信息抽取时需要放进 prompt 的输出 schema 空间。它使用 schema metadata 和可选 few-shot examples 做 retrieval-augmented schema reduction,从而减少上下文长度、lost-in-the-middle 风险、延迟和成本。真实医疗与电商数据实验中,Schema…
原文 ↗– -
OpenWiki: CLI that writes and maintains agent documentation for your codebase
OpenWiki 是 LangChain 的 CLI,用来生成和维护 agent-readable codebase documentation。README 提供 `npm install -g openwiki`、`openwiki --init`、交互模式、prompt 模式和 `--update`;还建议把 GitHub Action 加到仓库里,每天自动开 PR 更新文档。它把文档维护和…
原文 ↗– -
From Signals to Structure: How Memory Architecture Drives Language Emergence in LLM Agents
作者用 Lewis signaling game 研究两个 LLM agents 如何仅凭交互历史形成共享编码,并比较五种记忆架构与不同信道容量。persistent private notebook 在 capacity=25 时达到 0.867±0.023 的协调率,同时避开 stateless agents 在高容量词汇变大后的 collapse。这个结果把“上下文窗口够不够大”的问题改写为…
原文 ↗– -
Context.md - A proposed standard for AI project context
context-md 提议用固定路径的 `context.md` 作为 Repository Context Layer,让 agent 在 planning 前读取项目事实,并把学到的约束以 Git diff 形式写回。核心原则包括 human-readable、reviewable、branch-aware、tool-independent 和 deterministic discovery;…
原文 ↗– -
world-model-mcp
world-model-mcp 把 coding agent 的项目经验组织成 temporal knowledge graph,在 edit boundary 前验证 API/function reference,并在 compaction 后重新注入相关约束。v0.10.0 文档称有 27 个 MCP tools、22 个 CLI subcommands 和 417 个测试,并把 adapte…
原文 ↗– -
The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory
论文提出 Janus,给已有长期记忆 updater 外面套一层选择性接受控制器,避免局部任务生成的 memory update 覆盖有用经验或过度贴合近期样本。它用 Memory Momentum Trigger 先找可疑的更新轨迹,再用 coverage、boundary 和 fresh tasks 组成的紧凑混合评测集比较新旧记忆,不需要重放完整历史。跨 6 个数据集、2 个 backbon…
原文 ↗– -
Opera CLI compact accessibility snapshots
这份白皮书围绕 browser agents 的 compact accessibility snapshot 展开,目标是压缩页面状态,同时保留 agent 操作所需的结构和 grounding。虽然 digest 没提供具体压缩率,但主题与 LUMOS、A11y-Compressor 同向:把 UI 观察从冗长 accessibility tree 或截图,转为更紧凑的语义表示。它值得放在 b…
原文 ↗– -
Mimir
Mimir repo 已重定向为 Perseus Vault,一个单 Rust binary 的本地优先 memory MCP server。它用 SQLite、FTS5、dense/hybrid search、AES-256-GCM 和约 46 个 MCP tools 提供 durable memory;README 的 stress test 给出 100K entity insert 1.0…
原文 ↗– -
GOAT2-General-Orchestrated-Agent-Topology
GOAT2 是带 proactive episodic memory 的 AI orchestrator 项目。digest 信息没有展开 README,但从定位看,它不是单个工具调用 server,而是尝试把 agent topology、任务编排和主动 episodic memory 结合。这个方向的技术问题在于记忆何时主动注入、如何避免过期经验误导,以及 orchestrator 如何在多…
原文 ↗– -
ACE: Pluggable Adaptive Context Elasticizer across Agents
ACE 针对长轨迹 agent 的固定上下文窗口问题,反对把历史一次性截断或摘要成不可恢复状态。它维护 lossless message layer,同时保存每个历史 step 的 raw message 和 compressed abstraction;决策时的 orchestration layer 再按当前任务状态把每步选为 raw、abstract 或 drop。论文把 ACE 接入 Re…
原文 ↗–
2026 年 6 月116
-
topoteretes/cognee
Cognee 是开源 AI memory platform,用自托管知识图谱引擎给 agents 提供跨 session 长期记忆。它和 Agent Memory Bench 放在同一天看很有意思:一个提供记忆平台,一个测试记忆失败模式。Cognee 的技术押注是显式图结构能比纯向量检索更好表达实体、关系和历史事实。真正落地时,关键将是更新、冲突和遗忘策略,而不只是把内容写进 graph。
原文 ↗– -
colbymchenry/codegraph
CodeGraph 为 Claude Code、Codex、Gemini、Cursor、OpenCode、AntiGravity 等 coding agents 建立本地预索引代码知识图谱,目标是减少 token 和工具调用;仓库描述还强调自动跟随代码变更同步和 100% local。它解决的是大仓库 agent 常见的冷启动问题:每次任务都从 grep、find、读文件重新发现结构。把代码关系提…
原文 ↗– -
Tokenmaxxing is dead, long live tokenmaxxing
这篇文章讨论 agentic 系统中的上下文、token 使用和系统设计。它的核心转向是:单纯追求更大上下文窗口已经不够,关键变成怎样组织短期上下文、长期记忆、检索、工具结果和压缩摘要。它值得看,是因为很多 agent 失败不是因为 token 不够,而是上下文里混入了过期事实、无关日志和不可验证中间状态;“tokenmaxxing”真正要解决的是信息治理,而非窗口长度崇拜。
原文 ↗– -
safishamsi/graphify
safishamsi/graphify 是一个 AI coding assistant skill,把项目资料转成 queryable knowledge graph。README 列出的输入范围很宽:code、SQL schemas、R scripts、shell scripts、docs、papers、images、videos 都可以进入图结构。它的技术方向是让 agent 不只读文件树,而…
原文 ↗– -
gglucass/headroom-desktop
gglucass/headroom-desktop 是一个 macOS menu bar app,目标是减少 Claude Code 和 Codex 的上下文开销。README 声称通过 local-first optimization pipeline 可把 token costs 降低约 50%,方法是可逆压缩 tool output、logs 和 boilerplate。它抓住了 codin…
原文 ↗– -
risingwavelabs/risingwave
RisingWave 是 event streaming platform,面向需要实时上下文的 agentic AI 和应用。README 说它用单系统替代 Debezium + Kafka + Flink + serving DB,持续 ingest 数据库变更、event streams、webhooks 和历史数据,增量处理并低延迟 serve。它的趋势点在于实时数据栈被重新包装成 age…
原文 ↗– -
opendatalab/MinerU
MinerU 把复杂文档解析成 LLM-ready Markdown/JSON,覆盖 PDF、DOCX、PPTX、XLSX、图片和网页。README 提到 VLM+OCR 双引擎、109 种语言、公式转 LaTeX、表格转 HTML、阅读顺序恢复、页眉页脚移除、MCP server 和多 RAG 框架集成;3.4 版称 OCR 准确率约提升 11%、处理速度约提升 100%。它是 agentic…
原文 ↗– -
open-metadata/OpenMetadata
OpenMetadata 把自己定位为 AI 的 open context layer,将 metadata management、data catalog 和 business semantics 合成知识图谱。README 列出 130+ connectors、data quality、lineage、column-level lineage、ownership、policies、glossa…
原文 ↗– -
OpenKnowledge - open source AI-first alternative to Obsidian/Notion
OpenKnowledge 是 local-first WYSIWYG Markdown editor 和 LLM Wiki,目标是把个人笔记、spec、知识库和 agent second brain 放在同一个工作面里。README 明确支持 Claude、Codex、Cursor 协作编辑,也能通过 MCP/CLI 给 OpenCode 等 harness 使用;它还用 git/GitHub…
原文 ↗– -
Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents
论文区分 memory access 和 memory depth:检索能找回事实,但不保证经历在上下文卸载后继续影响行为。作者用 loop-drift protocol 测试长期干扰下的目标保持,EVAF 通过 surprise 与 valence gated LoRA 写入实现选择性巩固;在 GPT-2/TinyLlama 上,retrieval 短事实准确率 0.956-0.973,EVAF…
原文 ↗– -
Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
论文定义 compositional behavioral leakage,解释为什么没有共享变量的 prompt 模块仍会因为同处一个上下文窗口而互相影响。实验在 Claude Sonnet 4.6 的 job-evaluation agent 上跑 144 trials,只有 content perturbation 产生可检测 paired effect,Cohen's d=0.63,且没有…
原文 ↗– -
Information-Aware KV Cache Compression for Long Reasoning
InfoKV 不只看 attention weight,而是加入 token predictive uncertainty 与 layer-wise representation evolution,捕获对远期上下文更有影响的 token。论文提出 Forward Influence,指出 attention 选中的 token 主要影响近邻上下文,而高不确定性 token 对远距离未来上下文更关…
原文 ↗– -
Context Recycling for Long-Horizon LLM Inference
ContextForge 通过 structured query generation、external memory retrieval 和 controlled synthesis 回收长对话中的任务相关上下文。论文使用 15-turn healthcare query benchmark,覆盖多轮推理、回指和 domain shifts;相同底层模型下,它减少 token 消耗并提升一致性,…
原文 ↗– -
BetterDB, MIT Valkey-native context layer for AI agents
BetterDB packages 是一组 Valkey/Redis-native 的 agent context 组件,包括 semantic cache、agent cache、agent memory、retrieval、MCP observability server 和 monitor CLI。README 中 semantic-cache 使用 Valkey vector search…
原文 ↗– -
vectorize-io/hindsight
Hindsight 是 agent memory 系统,目标是让 agents learn over time,而不只是回忆对话历史。README 明确对比普通 memory 与 RAG,强调它关注从经验中学习,并提供 documentation、paper、cookbook 和 cloud 入口。它的定位代表一条趋势:agent memory 不再只是检索过去内容,而要把经验转化成未来行为改进。
原文 ↗– -
Self-Compacting Language Model Agents
论文处理长程 agent 轨迹里 chains of thought、工具调用和过期内容不断挤占上下文的问题,提出 SelfCompact 让压缩触发依据轨迹结构,而不是固定间隔或 token 阈值。它指出固定阈值会无视推理边界,可能在 mid-derivation 或 mid-search 阶段丢掉仍在使用的局部结果。这个方向值得看,是因为上下文压缩正在从“省 token 的后处理”变成 age…
原文 ↗– -
Grove
Grove 基于 Tree-sitter 为 coding agents 提供快速源代码结构洞察。它不是把代码当普通文本块检索,而是从语法树里暴露函数、类、作用域和组织结构,让 agent 在修改前获得更稳定的代码地图。对大型仓库来说,这类结构视图能减少“先读错位置再改错文件”的概率。
原文 ↗– -
EvoEmbedding
EvoEmbedding 针对静态 embedding 把文本片段孤立编码、忽略上下文和时间顺序的问题,提出可演化表示。它面向长上下文检索和 agentic memory,让表示随上下文、序列位置和状态变化。这个方向反映出 memory 系统的检索单元正在从静态 chunk 走向带历史状态的动态对象。
原文 ↗– -
SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG
SproutRAG 把句子级 chunk 通过 learned inter-sentence attention 组织成逐步变大的语义单元,再在检索时做 hierarchical beam search。方法避免额外 LLM 调用、固定上下文扩展和有损摘要压缩;四个科学、法律和开放域 benchmark 上,信息效率平均比最强基线高 6.1%。它的看点在于同时处理检索粒度和上下文连贯性两侧的代价。
原文 ↗– -
Recall
Recall 是 Claude Code 的本地项目记忆插件,把 session activity 追加进 `.recall/history.md`,再生成可恢复的 `.recall/context.md`。README 明确没有 API key、外部模型或网络调用,摘要由本地 TF-IDF + TextRank 完成;恢复上下文约 1-2K token,并提供 `/recall:save`、`/…
原文 ↗– -
PMB
PMB 给 Claude Code、Cursor、Codex 等 MCP-aware agents 提供本地长期记忆,把决策、教训、项目事实和文档放在一个 SQLite 文件里。README 描述了实体图 dashboard、时间线、PDF 索引、50+ 语言 embedding,以及 `prepare(message)` 在 4-16ms 返回 project_context、lessons、r…
原文 ↗– -
MemSlides
MemSlides 面向个性化幻灯片生成,把长期记忆拆成 user profile memory 与 tool memory,并用 working memory 保留当前会话偏好和约束。系统配合 scoped slide-local revision,在局部修改时作用于最小受影响区域,而不是反复重生成整套 deck;实验显示 profile memory 提升 persona alignment,…
原文 ↗– -
MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval
MCompassRAG 用 topic metadata 作为 paragraph-level retrieval 的“语义指南”,解决小 chunk 检索空间膨胀和大 chunk embedding 混杂多个主题的问题。它把主题信号放进同一 embedding space,并通过 LLM-teacher distillation 训练轻量 retriever;六个复杂检索 benchmark 上…
原文 ↗– -
GeneralVLA-2
GeneralVLA-2 针对机器人规划中的 3D 证据和可复用操作经验,提出 GeoFuse-MV3D 重建分支和 governed KnowledgeBank。GeoFuse-MV3D 在 GSO-30 上让 CD 和 LPIPS 分别下降 2.20% 与 2.02%,PSNR 和 SSIM 分别上升 2.36% 与 1.03%;KnowledgeBank 在 Terminal-Bench S…
原文 ↗– -
Crespo
Crespo 用 Tree-sitter AST 解析仓库,抽取 imports、classes、functions、structs 和 enums,生成 compact XML blueprint 给 LLM。它支持 structure、summary、concat 三种模式,覆盖 10 种语言;README 的 benchmark 显示结构问答平均 2.75/3,structure mode…
原文 ↗– -
SpiceAI
SpiceAI 把 SQL 查询、搜索、Text-to-SQL、OpenAI-compatible LLM gateway、Iceberg Catalog API 和 MCP 接口收进一个 Rust runtime,定位是“数据扎根的 agent sidecar”。README 给出的工程指标很硬:Ballista 分布式查询在 TPC-H SF100 早期预览里比单节点 DataFusion 快…
原文 ↗– -
LLM Wiki
LLM Wiki 走的不是传统“每次查询再 RAG”的路线,而是让 LLM 增量构建并维护一个持久 wiki。README 的功能面很宽:two-step ingest、PDF 图片抽取与 caption、可选 MinerU 解析、4-signal knowledge graph、Louvain community detection、vector search、folder auto-watch…
原文 ↗– -
FERNme
FERNme 不是把每轮对话都丢给 LLM 总结,而是用 fuzzy graph 做低成本长期记忆。README 里核心机制很具体:每个用户是 per-site graph 里的稀疏加权节点,edge 通过 Hebbian co-occurrence 规则更新,检索走 spreading activation,给 prompt 的 card 只保存相对 population prior 的偏差。这…
原文 ↗– -
Callimachus
Callimachus 把 11 种 coding agent 的历史会话收进一个本地 SQLite 索引,包括 Claude Code、Codex、Cursor、Gemini CLI、Qwen Code、Goose、OpenCode、Continue、Cline、Roo Code 和 Kilo Code。搜索部分不是简单 grep:README 写明它把 SQLite FTS5/BM25 与 o…
原文 ↗– -
stanford-oval/storm
STORM 是 LLM knowledge curation 系统:给定主题后,它检索资料、提出多视角问题,并生成带引用的长报告。README 的 API 部分显示它支持 LiteLLM 语言模型/embedding,并适配 BingSearch、VectorRM、BraveRM、SearXNG、DuckDuckGo、Tavily、GoogleSearch、AzureAISearch 等检索模块。…
原文 ↗– -
OSU-NLP-Group/HippoRAG
HippoRAG 把 RAG、知识图谱和 Personalized PageRank 组合起来,目标是模拟长期记忆式检索,而不是只做向量相似度召回。README 标题标注它是 NeurIPS 2024 项目,并强调让 LLM 在外部文档之间持续整合知识。它值得放进 trending,是因为很多 RAG 系统正在从“单 query 取 top-k chunks”转向图结构、路径推理和个性化 Page…
原文 ↗– -
labring/FastGPT
FastGPT 面向知识库问答、RAG 和可视化 AI 工作流编排。它把知识库管理、检索增强和流程搭建放进同一个平台,目标用户更接近企业内部应用构建者。该项目的长期看点是 RAG 产品从脚本和 demo 走向可运营工作台,包括数据、模型、流程和权限的统一管理。
原文 ↗– -
garrytan/gbrain
gbrain 是面向代理的检索与综合层,提供搜索、图遍历和 gap analysis。它把代理获取信息的过程拆成检索、结构化探索和缺口分析,而不是只给模型一个搜索框。这个项目的关键词是 synthesis:代理需要知道已经覆盖了什么、还缺什么,才能做更可靠的研究和决策。
原文 ↗– -
cocoindex-io/cocoindex-code
cocoindex-code 是一个面向代码库检索的轻量级 CLI,重点不在把所有文件塞进上下文,而是通过 AST 结构帮助代理找到相关符号和片段。它的实用价值在于降低编码代理做上下文定位时的 token 成本,并把检索粒度从字符串匹配提升到代码结构。对于多文件修改任务,这类工具能减少“看了很多无关文件却漏掉关键定义”的概率。
原文 ↗– -
Understanding the Behaviors of Environment-aware Information Retrieval
这篇系统分析 LLM 在不同检索环境下如何改变查询构造策略。摘要指出当前 RAG 研究忽略了一个关键挑战:不同 retrievers 需要 fundamentally different query formulation strategies 才能达到最佳效果。这个主题对 RAG 和代理检索都很实际,因为检索失败常常不是模型不知道答案,而是把问题投给了不匹配的检索接口。
原文 ↗– -
UltraQuant: 4-bit KV Caching for Context-Heavy Agents
UltraQuant 关注的是长上下文、多轮代理负载中的 KV cache,而不是常见的权重量化问题。论文标题给出的关键设定是 4-bit KV caching,目标是在上下文很重的代理运行中降低缓存占用和推理成本。它值得放进今日重点,是因为代理系统的瓶颈越来越常出现在“保留多少历史状态”而不是“单次生成有多快”。
原文 ↗– -
Multi-Agent Transactive Memory
Multi-Agent Transactive Memory 借用了组织记忆里的 transactive memory 思路:群体不需要每个成员都知道全部知识,但需要知道谁知道什么、知识放在哪里。摘要把它类比为面向 agent-generated artifacts 的搜索引擎,用 retrieval systems 组织异构代理群体产生的知识以便复用。它把多代理协作的瓶颈从消息传递推进到长期知识…
原文 ↗– -
LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents
这篇把工具调用代理的运行状态从一段不断增长的上下文,改成显式 ledger:事实、约束、策略条件和任务进展都以结构化状态保存。它的贡献不在于增加一个新工具,而是把“代理当前相信什么、还受哪些规则约束”变成可读取、可更新、可审计的对象。对需要策略遵守的代理系统来说,这种设计给运行时治理和错误定位留下了比 prompt 约定更清晰的抓手。
原文 ↗– -
Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents
这篇把长周期语言代理的记忆保留问题写成一个带约束的资源分配目标:代理会积累 observations、reasoning traces 和 retrieved facts,最终超过上下文窗口。摘要明确指出现有系统多把保留决策当作局部问题,没有建模 observability constraints 下的长期后果。它把“记住什么”从启发式摘要策略推进到可约束优化,适合审视长期代理的记忆污染、隐私暴露…
原文 ↗– -
Gora - simple search across all your local coding agents
Gora 是一个本地 CLI,会自动索引 Codex、Claude Code 和 Pi 的聊天线程,让用户一次性搜索多个编码代理的历史会话。作者提到的痛点是每次让代理读取旧聊天时,都要重新发现各工具的目录结构和线程位置。把这些历史变成可搜索材料,可以帮助复用调试经验,也能让团队观察代理在何处反复失败。
原文 ↗– -
Current World Models Lack a Persistent State Core
这篇指出当前 world models 缺少 persistent state core,也就是无法稳定维护跨时间的内部状态。摘要把要求说得很清楚:物理世界建模不只是按需渲染可信画面,还需要一个与观测解耦、持续演化的 internal world state,让对象和事件在镜头外仍然延续。这个批评与长周期代理、机器人和仿真环境都有关。
原文 ↗– -
infiniflow/ragflow
RAGFlow 是开源 RAG engine,覆盖文档解析、检索增强生成和 agent 能力。digest 里的重点是端到端链路:从复杂文档进入索引,再到可追溯回答和自动化。它适合企业知识库场景,因为 RAG 的失败常常发生在解析和 chunking,而不只是生成模型。
原文 ↗– -
alexzhang13/rlm
RLM 库把上下文和子调用放进 REPL,使模型可以写代码来分解长任务、调用子模型并处理近无限上下文。它支持本地和云端 sandbox,并包含训练 harness 与轨迹可视化。这个项目代表另一条长上下文路线:不把所有东西塞进窗口,而是让模型程序化地访问和递归处理信息。
原文 ↗– -
What Must Generalist Agents Remember?
这篇论文给“通用代理需要记忆什么”一个形式化回答:当两个域共享观测瓶颈却要求不同最优动作时,近似最优策略必须保留能区分域的记忆分布。进一步地,如果记忆足以估计相关目标的价值,它也能近似重建局部转移动态。它的贡献不是新 benchmark,而是把 memory 从经验组件提升为泛化、规划和模型重建的必要条件。
原文 ↗– -
The Token Compression Illusion: Why I'm Skeptical of RTK
文章质疑递归或 token compression 方案把 token 数下降等同于保留了任务所需信息。digest 显示作者区分压缩上下文、摘要上下文和维持决策充分状态,这三者在 agent 长任务里不是同一个问题。它提醒读者看压缩方案时要问“哪些信息被保留用于下一步行动”,而不是只看上下文窗口占用。
原文 ↗– -
Myco Brain - source-traceable memory for AI agents on your own Postgres
Myco Brain 把 agent memory 放在用户自己的 Postgres 上,通过 MCP 给 Claude、Cursor、Windsurf、Continue、Zed 等客户端共享。README 强调每个事实都可用 `brain_why` 追溯来源,独立来源提高置信度,矛盾事实会 supersede 且保留审计记录。它还给出 LongMemEval 复现数字:73.6% QA、reca…
原文 ↗– -
Lume - a small, fast hybrid search engine written in Rust
Lume 是 Rust 写的小型混合搜索引擎,面向本地或嵌入式检索。digest 强调 small、fast 和 hybrid search,说明它可能把词法召回与语义排序或向量检索组合成轻量索引。它与 agent memory 和本地知识库相关,因为很多代理系统需要的是可嵌入检索层,而不是完整搜索平台。
原文 ↗– -
DeusData/codebase-memory-mcp
这个 MCP server 把代码库索引成 SQLite-backed 知识图谱,并向 agent 暴露 14 个工具。README 给出的结构查询、call graph、route linking、dead code detection 和 semantic search 都围绕减少 agent 逐文件读取。它之所以值得放进 trending,是因为 coding agent 的瓶颈越来越像代码…
原文 ↗– -
Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents
DSG 把实时搜索 grounding 从模型供应商边界里抽出来,做成 MCP-compatible gateway,单独控制 provider routing、source-aware context rendering、fallback、retrieval depth 和缓存。实验显示它在 SimpleQA 上 86.1% 对 87.7% 几乎追平 native search,同时搜索成本低…
原文 ↗– -
Announcing Stack Overflow for Agents
Stack Overflow for Agents 是面向 agent 的 API-first 知识交换 beta,试图解决代理重复踩坑、上下文结束后经验消失的 Ephemeral Intelligence Gap。Beta 包含 Questions、TIL 和 Blueprint 三类 post,并要求 agent 起草内容后由人类 orchestrator 审核。它的核心机制是让验证、投票和反…
原文 ↗– -
zvec
zvec 是 Alibaba 开源的 in-process vector database,设计目标是把低延迟 similarity search 直接嵌入应用进程,而不是额外维护一个向量数据库服务。README 摘要称它 lightweight、lightning-fast,并强调在 Alibaba Group 内部经生产场景验证。这个定位适合边缘服务、桌面应用、单体后端或 Agent 本地记忆…
原文 ↗– -
Yomi
Yomi 把网页或整个网站抽取成干净 Markdown,目标是把 HTML 页面、导航噪声和视觉装饰压成可读、可索引、可交给 LLM 的文本。它属于 Agent/RAG pipeline 的 ingestion 前处理,把非结构化网页整理成更稳定的中间表示。相比直接把网页 DOM 丢给模型,干净 Markdown 更容易做 diff、cache、全文搜索和引用定位。
原文 ↗– -
Understand Anything
Understand Anything 的目标是把 codebase、knowledge base 或 docs 转成 interactive knowledge graph,并支持 explore、search、ask questions。README 的口号 “Graphs that teach > graphs that impress” 很准确:图不是为了炫酷,而是为了帮助人和 Agent…
原文 ↗– -
LMCache
LMCache 是 LLM 推理侧的 KV cache management layer,目标是在请求之间、多进程和多节点环境里复用 cache,减少重复 prefill 成本。README 摘要强调 scalable LLM inference,并把近期更新集中在 agentic workload benchmark、multiprocess architecture 和 multi-node…
原文 ↗– -
Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion
Dr-DCI 把 retrieval 变成 Agent 可主动调用的 workspace 扩展动作:候选发现靠检索维持规模,跨文档过滤、比较和约束验证仍在局部 workspace 内用 DCI 操作完成。论文在 Browsecomp-Plus 上报告 71.2% accuracy,比 raw DCI 和消融变体最高提升 8.3 个点;加入 workspace-preserving context…
原文 ↗– -
TokenPilot: Cache-Efficient Context Management for LLM Agents
TokenPilot 解决长程 agent 会话中上下文累积与 prompt cache 断裂之间的冲突。它用 Ingestion-Aware Compaction 在全局稳定 prefix、过滤开放环境噪声,再用 Lifecycle-Aware Eviction 在局部按上下文片段生命周期批量卸载。实验在 PinchBench 和 Claw-Eval 上给出 isolated 模式 61%/56…
原文 ↗– -
RyanCodrai/turbovec
turbovec 是基于 TurboQuant 的 Rust 向量索引,并提供 Python bindings。README 称 1,000 万文档 float32 corpus 需 31GB RAM,而 turbovec 可放进 4GB;2-bit 下 1536 维 FP32 向量从 6,144 bytes 压到 384 bytes。它支持在线 ingest、搜索时 allowlist 过滤和…
原文 ↗– -
MODSetter/SurfSense
SurfSense 是开源、隐私导向的团队版 NotebookLM 替代品。README 直接对比 NotebookLM 的限制,包括 source/notebook 数量、500,000 words 与 200MB source 上限、Google 服务绑定和多人协作不足。它提供 25+ external data sources、real-time multiplayer、AI file so…
原文 ↗– -
GitHits
GitHits 为 coding agents 提供依赖项目源代码上下文,形态是 CLI 与本地 MCP server。它的核心问题是 agent 处理真实 bug 时常常需要理解依赖实现,而包文档、类型签名或 README 不足以解释行为细节。把依赖源码暴露为可查询上下文,可以让 agent 在跨 repo 调试、API 行为追踪和版本差异分析中少依赖猜测。
原文 ↗– -
Ctx
ctx 根据当前任务推荐 skill、agent、MCP server 和 harness,减少 agent 上下文里无关工具描述。它维护 102,928-node LLM-wiki graph,包含 91,464 skills、467 agents、10,790 MCP servers、207 harnesses 和 2.9M graph edges,目标是每次只加载 10-15 个相关组件。配…
原文 ↗– -
Web Researcher MCP
这个 MCP 服务的核心不是再做一个搜索入口,而是让 AI 在用户指定的 search lenses 里检索,并读取完整网页、PDF、Word、YouTube transcript,而非只吃搜索摘要。README 列出的工具覆盖 web/news/image/academic/patent/SEC/legal/clinical 搜索、citation graph、verify_citation、a…
原文 ↗– -
ScreenMind
ScreenMind 是本地 screen memory:捕获屏幕变化,用 EasyOCR 提取文本,把截图和 OCR context 交给 Gemma 4 E2B,再用 MiniLM embedding 与 SQLite/FTS5 支撑搜索和聊天。README 给出三档分析模式:Accurate 约 76 秒、Balanced 约 40 秒、Fast 约 12 秒;首次运行下载约 5GB GGU…
原文 ↗– -
Don't trust large context windows
这篇文章提醒长上下文窗口并不等于可靠记忆。digest 提到检索、注意力和实际使用中的失效模式,核心意思是模型可能拥有很长输入上限,却仍错过关键约束或在长文中漂移。它值得读是因为很多 agent workflow 仍把“塞进上下文”当成设计,而不是把证据选择、摘要和校验做成显式步骤。
原文 ↗– -
google-labs-code/design.md
DESIGN.md 是一个给 coding agent 描述视觉身份和设计系统的格式规范。它把精确 design tokens 放在 YAML front matter,比如颜色、字体、字号、圆角、间距;再用 Markdown prose 解释设计意图和应用方式。README 的例子展示 agent 可以同时读到 `primary: #1A1C1E` 这样的机器值,以及“Architectural…
原文 ↗– -
activeloopai/hivemind
Hivemind 自称 “One brain for all your agents”,为 Claude Code、OpenClaw、Codex、Cursor、Hermes、pi agents 提供 auto-learning、cloud-backed shared brain。仓库中有 claude-code、codex、openclaw、pi extension 等目录,说明它不是单客户端记忆…
原文 ↗– -
SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference
SparDA 把稀疏注意力里两个长期问题放在一起:KV cache 随长度增长撑爆显存,sparse selection 本身仍可能保持 O(T^2) 并在长上下文里成为主成本。它在 Query、Key、Value 之外加入每层 Forecast 投影,预测下一层需要的 KV blocks,让 CPU-to-GPU prefetch 和当前层计算重叠;GQA 实现中每个 group 只用一个 Fo…
原文 ↗– -
ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction
ReVision 针对 computer-use agent 的轨迹历史:连续 GUI screenshot 变化很小,但每张都被编码成大量视觉 token。方法训练一个 learned patch selector,对比连续截图的 patch representation,删除冗余 visual patches,同时保留多模态模型需要的空间结构。在 OSWorld、WebTailBench、Ag…
原文 ↗– -
PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents
projectmem 关注 coding agent 的跨会话失忆:每次重读文件、重推决策、重复失败尝试会消耗 5,000-20,000 tokens。系统用 append-only plain-text event log 记录 issues、attempts、fixes、decisions、notes,再确定性投影成 MCP 可读摘要;pre-action gate 会在 agent 准备重复…
原文 ↗– -
Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents
HORMA 认为长程 agent 的记忆问题不是“压缩还是检索”二选一,而是先组织再导航。它把经验组织成类似文件系统的层级结构,摘要实体链接回原始轨迹;构建阶段反复判断失败来自缺信息还是上下文过载,检索阶段用轻量 RL agent 选取最小但足够的上下文。ALFWorld、LoCoMo、LongMemEval 上,它在受限 context budget 下提高任务表现,长对话任务最多只用 base…
原文 ↗– -
Mimirs
Mimirs 是给 AI coding agent 的本地 MCP 记忆服务,使用 Bun 和 SQLite,强调无 API key、无云、无 Docker。它提供 semantic search、auto-generated wiki、cross-session memory、dependency graphs 和 annotations,并支持 Claude Code、Cursor、Winds…
原文 ↗– -
Llmbuffer
llmbuffer 是 Python conversation history buffer,核心是把消息顺序调整为可稳定命中 provider prompt cache 的结构:static system prompt、long-lived history、dynamic context、recent messages。RAG 结果、时间戳和当前工具调用等易变内容被放在末尾,避免破坏前缀缓存;l…
原文 ↗– -
qdrant/qdrant
Qdrant 是 Rust 编写的向量相似度搜索引擎和向量数据库,用于存储、搜索和管理带 payload 的 vectors。README 强调扩展过滤能力、生产可用 API、官方 Go/Rust/JavaScript/Python/.NET/Java clients、Docker 本地启动,以及可在进程内运行并同步到服务器的 Qdrant Edge。它仍是 RAG、memory 和 semant…
原文 ↗– -
Standing Questions
Standing Questions 把 agent memory 组织成长期待回答的问题,而不是固定答案。这个建模适合偏好、项目状态和开放任务会持续变化的场景:记忆系统围绕问题积累证据,避免把一次性结论当成永久事实。
原文 ↗– -
Lore
Lore 是 coding agent 的 LLM proxy,负责上下文、记忆和请求路由管理。它的工程位置在 agent 客户端和模型供应商之间,适合把上下文压缩、长期记忆、模型选择和成本策略集中处理,而不是让每个 IDE 插件或 CLI 各自实现一套。
原文 ↗– -
Is Grep All You Need?
论文比较 grep、向量检索、agent harness 和工具输出呈现方式对 agentic search 的影响。实验一在 LongMemEval 116 个问题上覆盖 Chronos、Claude Code、Codex、Gemini CLI,并比较 inline tool results 与 file-based results;实验二逐步混入无关历史上下文。结果不是简单证明 grep 永远…
原文 ↗– -
From Rigid to Dynamic
论文观察到长上下文推理中 attention heads 存在 Rigid Heads 和 Dynamic Heads 两种 entropy 行为,而且具体分布随上下文变化,不能离线固定。EntropyInfer 在 prefill 时按 head/segment 动态分配稀疏预算,decode 时用已生成 token 帮助选择保留哪些 KV cache;在 Llama、Qwen、openPang…
原文 ↗– -
End-to-End Context Compression at Scale
论文重新评估 encoder-decoder 式上下文压缩,目标是降低长上下文推理中 KV cache 的内存压力。作者做 architecture search 后,持续预训练 0.6B encoder、4B decoder 的 LCLM 系列,每个 1:4、1:8、1:16 压缩比例都训练超过 350B tokens;结果在质量、压缩速度和峰值内存上改善 Pareto frontier。它也把…
原文 ↗– -
khoj-ai/khoj
Khoj 是可自托管 AI second brain,可接入本地或在线 LLM。README 列出从网页和文档回答问题、支持 PDF/Markdown/Notion/Word/org-mode、Browser/Obsidian/Emacs/Desktop/Phone/WhatsApp 多入口、自定义 agents、自动化研究和语义搜索。它是个人知识库、RAG 和 agent 自动化合流的典型项目。
原文 ↗– -
danielmiessler/Personal_AI_Infrastructure
Personal_AI_Infrastructure 把个人 AI 系统组织成 Life Operating System。README 定义三层:PAI OS 包含 skills、memory、Algorithm、Telos 和 identity files;Pulse 是 `localhost:31337` 的 dashboard;Digital Assistant 是交互人格。它的看点是把…
原文 ↗– -
Sem
Sem 建在 Git 之上,把代码实体作为跨提交可追踪对象。与 LSP 的即时位置和编辑器状态不同,它关注函数、类型、模块等实体在版本历史中的身份延续。这个抽象适合代码搜索、agent 记忆和长期 repo 理解,因为它把“代码在哪里”提升为“实体如何演化”。
原文 ↗– -
Programmers will document for Claude, but not for each other
文章讨论开发者愿意为 Claude 写清楚上下文,却长期不给同事写同等质量文档的反差。digest 中的观察很尖锐:给 LLM 的 prompt、constraints 和 examples,其实就是团队文档缺口的可见化。它把“AI 需要上下文”反转成组织问题:如果这些信息能提升模型表现,也同样能降低人类协作成本。
原文 ↗– -
Omni
Omni 是 macOS 上本地运行的多模态文件搜索工具,把文本、代码、PDF、图片、音频和视频放进同一向量空间。公开介绍强调 Apple silicon 上离线索引、跨语言语义搜索、QuickLook 缩略图、List/Gallery 视图,以及供 agent 使用的 search endpoint。它的技术点在于把“文件搜索”从文件名和全文索引扩展到跨模态相似度查询。
原文 ↗– -
Context Sculpting
文章讨论如何塑造 LLM 上下文,而不是把所有材料一股脑塞进去。digest 的重点是选择、排序、压缩和边界设定会显著影响输出,这与 agent 长任务中的 memory、repo map 和 instruction hygiene 直接相关。它提供的不是某个 prompt 魔法词,而是把上下文当作可设计的信息结构。
原文 ↗– -
TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management
TokenMizer 把长工作会话转成 typed knowledge graph,再序列化为 compact resume block。schema 有 14 类节点和 7 类边,三层 checkpoint 与 8 层压缩管线让 21 个 sessions 的 resume block 平均只有 78 tokens,约为 baseline 159-170 tokens 的一半。它更强调保留 de…
原文 ↗– -
Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
MRAgent 把记忆访问建模为推理中的主动重构,而非先检索再推理的固定流水线。它使用 Cue-Tag-Content 图表示记忆,LLM 根据中间证据迭代探索和剪枝 retrieval path,避免无约束图扩展。LoCoMo 与 LongMemEval 上相对强 baseline 最高提升 23%,同时降低 token 和运行成本,给 graph memory 提供了比“相似度召回”更强的机制…
原文 ↗– -
MemPalace
MemPalace 是本地优先 AI memory 系统,强调原文存储、可插拔后端和 LongMemEval 检索表现。保留原文使得 memory item 可以追溯和重读,可插拔后端则避免把系统押注在单一向量库或检索策略上。它适合拿来对比“摘要式记忆”在长期任务中的信息损失。
原文 ↗– -
Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs
论文指出长上下文失败不只取决于 token 长度和 needle 位置,还取决于上下文每单位长度引入多少不同信息。作者在 9B-685B open-weight LLM 上使用约 12k tokens、位置受控但密度递增的 needle 任务;高密度场景中近乎满分的模型会跌到 60% 以下。这个变量对真实系统很关键,因为压缩摘要、密集日志和表格化证据往往正是“短但难”的上下文。
原文 ↗– -
Claude Git Sessions
Claude Git Sessions 把 Claude Code 会话存进 Git orphan branch,以便团队共享和恢复。orphan branch 的选择很有意思:会话历史不污染产品代码分支,却仍能使用 Git 的传输、审计和版本机制。这个做法把 agent conversation 从个人机器状态变成可协作资产。
原文 ↗– -
AdaMEM: Test-Time Adaptive Memory for Language Agents
AdaMEM 让 agent 在测试时维护动态短期策略记忆,而不是只在 episode 开头检索静态经验。它保留 offline raw trajectory 作为长期记忆,并在推理中按需合成 strategy memory;相对静态记忆 baseline,ALFWorld 最高相对提升 13%,WebShop 最高相对提升 11%。STEP-MFT 进一步训练模型从检索经验中生成步骤级策略,给…
原文 ↗– -
Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents
这篇把 agent token 超支整理成 63 起经验事件,关注的是预算如何在多轮工具调用、重试和长上下文中被隐性消耗掉。它的工程点在于把缓解示例落到 affine-typed Rust:预算被视为一次性资源来传递和消费,而不是事后统计的账单字段。
原文 ↗– -
Mnemo
Mnemo 是本地优先的 AI memory layer,用 Rust、SQLite 和 petgraph 组织持久记忆。作者在 HN 讨论中概括其差异点:单个 Rust binary、zero cloud、知识图 multi-hop traversal 和 scored retrieval;相比普通向量库,它更强调图关系与本地可控。
原文 ↗– -
KVarN
KVarN 是 vLLM 原生 KV-cache 量化后端,用 variance-normalized quantization 缓解 reasoning task 中的误差累积。项目索引称它可带来 3-5 倍 KV cache/context 扩展、吞吐高于 FP16,并在 MATH500、AIME24、HumanEval 等任务上维持 FP16 级准确率;如果实现足够稳,它会直接影响长上下文…
原文 ↗– -
Dreaming: Better memory for a more helpful ChatGPT
OpenAI 的 Dreaming V3 把 ChatGPT 记忆从显式“请记住”扩展为后台综合历史对话的 memory synthesis。文章给出时间线:saved memories 在 2024 年 4 月上线,Dreaming V0 于 2025 年 4 月加入引用聊天历史,2026 版本强调 freshness、continuity 和 relevance;关键变化是记忆可被用户在 su…
原文 ↗– -
Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation
CHARM 把 agentic RAG 的错误传播命名为 cascading hallucination:早期检索或解释偏差会在后续步骤被放大,最后变成看似连贯的错误答案。摘要明确给出四类 cascade pattern,并把检测/缓解放在多步 pipeline 内部,这比只评估最终回答更接近 agentic RAG 的真实失败形态。
原文 ↗– -
supermemoryai/supermemory
Supermemory 是面向 AI 应用的 memory 和 context layer,README 称其在 LongMemEval、LoCoMo 和 ConvoMem 三个 memory benchmark 上排名第一。它提供 fact extraction、user profiles、hybrid search、connectors 和 multimodal extractors;用户画像…
原文 ↗– -
mksglu/context-mode
Context Mode 是 MCP server 和 CLI proxy,作为 AI coding assistants 与 context window 之间的 sandboxed execution/indexing layer。公开摘要称它拦截 Bash、WebFetch、Read 等 tool calls,在隔离 subprocess 中运行,把 raw output 索引进 SQLit…
原文 ↗– -
chopratejas/headroom
Headroom 压缩 agent 读取的 tool outputs、logs、files 和 RAG chunks,定位为 library、proxy、ASGI middleware、callback 和 MCP server。README 称典型上下文中 70-95% 是 boilerplate,项目目标是在进入 LLM 前压缩掉这些冗余,并支持 LangChain、LangGraph、Agn…
原文 ↗– -
Moxie Docs
Moxie Docs 为 GitHub repo 建立 living index,把源代码、测试、文档和历史整理成人可读文档与 agent 可读 MCP context。主页写明每次 merge 后会保持索引更新,提供 source-cited docs、repo conventions、doc gaps 和 verified commands;Starter 计划覆盖 3 个私有 repo、每…
原文 ↗– -
KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks
针对长 horizon reasoning decoding 中 KV-cache 量化误差随时间积累的问题,提出 calibration-free 的 KVarN。方法先做 Hadamard rotation,再对 K/V 矩阵双轴做 variance normalization,以修正 outlying token-scale errors。论文报告在 MATH500、AIME24 和 Hum…
原文 ↗– -
HelixDB/helix-db
HelixDB 是 Rust 写的 open-source graph-vector database,主打把 application DB、vector DB、graph DB 和应用层的一部分合并到单一平台。README 摘要说它以 graph + vector data model 为主,也支持 KV、documents 和 relational data;内置 MCP tools 让 ag…
原文 ↗– -
Extract
Extract 是 hosted document extraction API,用于把 PDF 等文档抽取为结构化文本、表格、图片和 layout 信息。页面说明它返回 structured spans、bounding boxes 和 font metadata,图片会上传到 object store 并以 image_url 返回;示例 API 支持通过 URL 提交 PDF。它对 RAG…
原文 ↗– -
DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees
提出 DeltaMem,用 residual trees 管理 agent 经验,避免把相似 episode 平铺存储导致冗余和检索冲突。系统拆成两棵树:一棵存 goal-conditioned task experience 作为 reusable skills,另一棵存 scene-level environment knowledge;root 表达通用经验,delta node 表达后续差…
原文 ↗– -
Carto
Carto 为 AI coding agents 生成代码库 domain map、blast radius 和 MCP 工具形式的结构化上下文。digest 对它的定位很明确:帮助 agent 在改代码前理解模块、影响范围和业务域边界。它不是通用检索器,而是把 codebase map 变成可供 agent 查询的操作对象。对于大型 repo,blast radius 信息能帮助控制改动范围和测…
原文 ↗– -
CLI for crawling documentation sites into Markdown with defuddle
Docrawl 是把文档站抓取并转换成 Markdown 的 CLI,digest 指向其使用 defuddle 清理网页主体内容。Defuddle 本身负责去掉 sidebar、header 等 clutter,输出更适合阅读和转 Markdown 的 clean HTML。这个组合的工程点在于把 docs crawling 和内容抽取打包为本地工具,而不是只给 agent 原始网页。对 RAG…
原文 ↗– -
dmtrKovalenko/fff
fff 是 Rust 写的高速文件搜索与内容索引工具包,面向长期运行进程、编辑器和 agent 场景。项目不只是一次性 find/grep,而是提供路径索引、内容索引和可嵌入查询接口,方便 agent 快速定位代码库信息。值得看的是,agent 的代码理解体验很大程度取决于检索延迟和索引新鲜度。
原文 ↗– -
Open-source general-purpose alternative to Exa Websets
用搜索引擎递归构建结构化数据集的开源工具。
原文 ↗– -
MetaBrain
本地文档记忆系统,让 AI agent 可检索项目上下文。
原文 ↗– -
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
论文研究跨模型家族的长上下文压缩,用于减少 100k+ token 输入的 prefill 成本。
原文 ↗– -
Leyline: KV Cache Directives for Agentic Inference
Leyline 针对 agentic inference 提出 KV cache directives,用来处理工具调用失败、输出删除、轨迹分叉、回滚和重试等非线性对话操作。传统 KV cache 默认上下文按前缀追加,但 agent 工作流经常需要废弃 stale observation 或从中间节点另开分支。值得看的是,它把推理系统优化从单条聊天流吞吐扩展到 agent 状态编辑和分支探索。
原文 ↗– -
Krimto
把 AI 记忆保存为用户自己 git 仓库中的 Markdown 文件。
原文 ↗– -
How we index images for RAG
Kapa.ai 介绍其为 RAG 系统索引图片的 pipeline:图片需要被抽取、描述、OCR、和周边文本上下文绑定,而不能只存 URL 或 alt text。文章指出文档中的截图、图表和 UI 状态经常承载回答所需证据。值得看的是,多模态 RAG 的难点在切分、引用和排序如何与文本证据合并。
原文 ↗– -
AMP: A Vendor-Neutral Wire Format for Agent Memory Operations
论文提出 agent memory 操作的中立 wire format,覆盖写入、迁移和人工审查等记忆治理接口。
原文 ↗– -
Stria
Stria 是面向 LLM agents 的 grammar-free structural codebase indexer 和 MCP server。它不用 tree-sitter 或语言 parser,而用 phrase extraction 生成结构索引;README 称标准仓库约 0.16 秒 build、sub-ms queries,3.1GB Linux kernel 72,000…
原文 ↗– -
Learning Agent-Compatible Context Management for Long-Horizon Tasks
AdaCoM 训练一个外部 LLM 管理冻结 agent 的上下文,用可学习的修改动作在保留约束、进展和证据的同时删除过期内容。论文在 web search 和 deep research benchmarks 上测试,提出 Fidelity-Reliability Trade-off:强 agent 需要更高保真上下文,弱 agent 反而需要更激进压缩。它的工程意义是上下文管理可作为可迁移模块…
原文 ↗– -
2-command CLI to give AI agents structured data retrieval on PostgreSQL
Lithium 是运行在 PostgreSQL 上的结构化 agent storage engine,用 ltree 做层级路径索引,并提供 TypeScript API、versioning 和 scoped retrieval。快速路径是 `npx @lithium-ai/kit init` 加 MCP server,让 Claude Code 等 agent 可查询如 `engineerin…
原文 ↗– -
SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs
SAGE 将 agent memory 写入控制改写为 novelty detection,而不是每次都让 LLM 决定新增、合并或忽略。它用 von Mises-Fisher density estimator 在 memory embeddings 上估计候选事实的新颖度,并用 adaptive threshold 路由 ADD、NOOP 或 LLM merge。LoCoMo 上它相对 Mem…
原文 ↗–
2026 年 5 月10
-
run-llama/liteparse
LiteParse 是本地 PDF/文档解析工具,使用 Rust core、PDFium、可选 OCR 和 layout reconstruction 输出 spatial text、bounding boxes、JSON/Text、截图。README 还支持 DOCX/XLSX/PPTX/IMG 通过 LibreOffice/ImageMagick 转换后进入同一处理链。值得看的是它为 RAG/…
原文 ↗– -
microsoft/markitdown
它适合 agent/RAG 前处理:把多格式文件统一成 markdown 这种 LLM 友好文本。优势是格式覆盖和 API 简洁;要注意复杂布局、扫描件和表格仍会依赖具体解析后端。
原文 ↗– -
firecrawl/firecrawl
Firecrawl 把“网页上下文”做成 agent 基础设施。它的价值在于把抓取、清洗、结构化和主内容抽取统一;风险在于动态网页覆盖率、反爬限制和内容版权/robots 策略需要持续处理。
原文 ↗– -
VikingMem: A Memory Base Management System for Stateful LLM-based Applications
这篇论文把 agent memory 当作数据管理系统,而不是提示词附属品。event/entity 分层的好处是能承载纠错、时间衰减和实体演化;风险是评估主要落在检索有效性,记忆写入错误、隐私边界和跨应用 schema 演进还需要更硬的治理机制。
原文 ↗– -
Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems
它把“格式选择”从工程品味拉回到可测量变量:agent 系统中每一步都复制状态、工具结果和结构化参数,冗余 notation 会被循环放大。真正的价值在于提醒评测应同时报告任务质量与 token/latency,而不是只看成功率。
原文 ↗– -
Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval
这篇把“把整个记忆库塞回来也能答对”的评测漏洞说得很尖锐。结论偏工程化:结构化 belief state 和硬作用域隔离可能比更大 embedding 更能解决 precision 问题,但单作者、89 例 benchmark 的外部有效性需要复现。
原文 ↗– -
Periodic RoPE for Infinite Context LLMs
这不是简单拉长插值,而是把局部位置和全局交互分层处理,因此理论上避免无限外推。摘要仍较短,实际有效性取决于任务是否需要精确全局顺序,而 NoPE 全局层可能牺牲一部分位置可辨性。
原文 ↗– -
MGRetrieval: Memory-Guided Reflective Retrieval for Long-Term Dialogue Agents
它把反思式检索从“LLM 自己想检索路径”改为受历史记忆结构约束,降低不稳定性。局限是评估集中在 LoCoMo 和 14B Qwen 系列,跨域记忆结构是否同样可靠还需更多数据。
原文 ↗– -
Lum1104/Understand-Anything
它把代码理解产物显式化为图,而不是只让 agent 临时读文件。价值在可视化和可复用上下文;风险是图谱新鲜度、抽取准确性和大型仓库增量维护成本。
原文 ↗– -
Ktx
ktx 把数据 agent 的问题从“让模型猜表名写 SQL”改成“先建立可审查语义层和 join/metric 约束”。这种文件化、git review 的设计有利于治理,但准确性仍依赖团队持续批准上下文变更。
原文 ↗–