每日 Harness 开源 · Source
主题 · All topics

记忆与上下文Memory & Context

本主题共 271 条 · 最早 2026-05-29 · 最新 2026-09-18

视图 · View

2026 年 9 月2

  • EchoPath: Execution-Level Replayable Memory for GUI Agents

    EchoPath 不把记忆做成自然语言摘要,而是把已通过执行工件校验的 GUI 轨迹转成可调用的参数化记忆;重放时用图像目标重新定位控件,并在失败节点局部修复。作者报告中位 token 消耗降低超过 90%,执行时间约降 60%。这种粒度让“做过一次”变成可复用程序片段,代价是必须维护界面锚点和验证工件,跨应用泛化仍取决于视觉匹配稳定性。

    Paper2026-09-18arxiv.org原文 ↗
    –
  • Portal by Spotify cut my Claude Code token usage by 90%

    Spotify 的 Portal 把编码 agent 的 token 消耗拆成推理和可预测 I/O,用 shunt hooks 阻止 Claude 直接读取大文件,再把摘要或样板生成转给廉价模型。四个 Java monorepo 场景中 bulk-read 平均节省约 90%,但文章没有把数字包装成万能优化:worker 摘要缺少可靠行号,真正编辑仍需 Claude 定点读取。工程含义是把“模型路…

    News2026-09-06engineering.atspotify.com原文 ↗
    –

2026 年 8 月55

  • ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

    ST-Lite 先刻画 GUI 轨迹的帧间视觉冗余、极小 UI 元素和近似均匀的跨层稀疏,再用空间/轨迹信号做无需训练的 KV 保留。现有方案在 20% 预算下只命中 39% oracle 重要对,论文因此把压缩粒度从通用语言 token 调整到屏幕位置与操作历史。

    Paper2026-08-28arxiv.org原文 ↗
    –
  • OpenWand

    OpenWand 是桌面 local-first 协作界面,快捷键触发意图选择后读取当前上下文并流式回答,减少在聊天窗口间来回粘贴。项目支持语音输入/输出和自带模型提供商,把上下文获取放在应用内工作流而非独立网页会话。

    Project2026-08-28github.com原文 ↗
    –
  • sillage

    sillage 给冻结语言模型挂接固定容量记忆,用超向量 n-gram 键、惊讶度写入与 rank-16 快速权重完成索引和补全,不改底模。对 3.6 万技术 token,GPT-2 124M 的困惑度从 31.2 降至 16.8,附加存储 7.4MB;作为对照,55MB 的 kNN 记忆只能做到 23.6。这个结果有力支持紧凑局部模式记忆,但 README 也明确它不是通用推理模块,固定容量会限…

    Project2026-08-26github.com原文 ↗
    –
  • claude-obsidian

    项目把来源先保存为内容寻址副本,再由 15 个技能生成带证据台账、双向链接、索引和 Canvas 的普通 Markdown Obsidian 知识库。并行 worker 只交草稿,单一编排者按 SHA-256 审批计划执行可恢复原子事务;高风险主张要求两条独立来源,远程检索不可用时退回确定性 BM25。PDF/EPUB 目前只取元数据,URL 与 OCR 依赖外部 runner,功能边界比“自动第…

    Trending2026-08-26github.com原文 ↗
    –
  • Read Less, Answer Better: A Training-Free Framework for Efficient Source-Grounded Agents

    SparseRead 在代理读取全文之前加入 Read Gate,再配可替换 Reader、来源锚定的验证、停止与回退规则,整个流程不训练参数。六个模型、五类场景平均少用 92.9% 输入 token、墙钟时间降低 89%,答案质量保持或提升,并能接入三种代理框架。收益来自拒绝低价值读取和有界复核,而不是用摘要压缩掉证据,因而其决策轨迹也容易检查。

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Oynix

    Oynix 在本地把代码、文档和协作数据解析成知识图,经 MCP 直接给代理返回事实,同时保留来源、写回路径以及 BYOK/BYODB 选择。项目方测试称,在 2300 token 上下文下准确率为 54%,对照方案用 9300 token 得 41%;24358 个节点的结构索引约 8.08 秒,但描述索引可耗时约 18 分钟。18 种连接器让它具备实用覆盖面,不过精度数字来自产品内部基准,部署…

    Project2026-08-26oynix.dev原文 ↗
    –
  • From Inertia to Insight: Context Isolation for Robust Web Agents

    作者用 IBIS 分离页面观察和先前行动归属,发现代理在评价自己已经选过的网页时会系统性偏向维持旧决定。NIS-Agent 在网页分诊与最终验证阶段隔离归属上下文,四个基准上减少 33% token,训练后的 8B 模型平均表现可比 GPT-4o。结果说明部分“长上下文推理失败”其实是控制流把身份承诺带入了证据判断,修正边界比继续扩窗更直接。

    Paper2026-08-26arxiv.org原文 ↗
    –
  • FERAL-AI

    FERAL-AI 在个人设备上构建四层可执行记忆:工作、情景、语义图谱和执行记录,并用滚动基线检测异常。动作由策略门控制,能设审批、时间窗和每日上限;实现采用 Python 3.11+ 与 SQLite FTS5,默认监听 9090。它把记忆与行动约束放在同一数据面,但当前只是 macOS/Linux 单用户测试版,不具备高可用或多租户隔离。

    Project2026-08-26github.com原文 ↗
    –
  • ECHO: Auditable Memory for Long-Horizon Agents

    ECHO 把记忆拆成情景编码、巩固、重现、再巩固和执行控制,并保留每次召回的来源,以便审计长期代理为何想起某条信息。LoCoMo 上 Hit@10 为 96.29%,LongMemEval 检索命中为 97.60%;但在匹配的 91 道问答里,Mem0 得 64.84,ECHO 只有 41.76,差异具有统计显著性。它证明可追溯检索能做得很强,也提醒读者不要把检索召回率直接当成记忆问答质量。

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Context as an Environment: Programmatic Context Management for Long-Horizon Agents

    Scroll 不预先把旧对话压成固定记忆,而将会话实现为追加式 Event Log 与持久沙箱 Python 内核;工具输出和派生状态绑定为类型化变量,只有模型显式打印的投影进入工作窗口。以 Qwen3.8-Max 为底模时,LongMemEval_S 得 94.8%,BEAM_10M 得 73.1%,比已发表最佳记忆系统高 5.1 点,LOCA_256K 则领先既有长程代理 37.4 点。可精确…

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Ambient Context

    Ambient Context 周期读取 macOS 当前焦点窗口的 Accessibility 树,去重后按天写入 Markdown,为本地代理留下一条可搜索的工作轨迹。它不截图、不联网、不含模型或遥测,落盘前还过滤密码、私密浏览、密钥和卡号。要求 macOS 14 与 Apple Silicon,且 GPU 终端等缺乏标准可访问树的应用记录有限,隐私设计扎实但采集完整性取决于应用生态。

    Project2026-08-26github.com原文 ↗
    –
  • akitaonrails/ai-memory

    ai-memory 用 MCP 与生命周期钩子为 Claude Code、Codex、Gemini CLI 等编码 Agent 捕获项目上下文、生成交接,并在不同厂商 CLI 间续接同一工作流。

    Trending2026-08-22始 2026-07-23github.com原文 ↗
    –
  • Can Agent Memory Systems Track Evolving State?

    这项工作指出,召回历史并不等于维护当前状态:系统还必须知道哪些事实、约束和决策已被后来对话替代。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • What Does Context Compression Cost an Agent?

    论文用确定性的 24 轮工具任务,测量摘要压缩后代理为恢复丢失状态而增加的调用,而非只看最终答对率。GPT-5.5 的完成率从 80% 升到 85% 且无显著差异,但检索量从 21 增至 63.9,差异达到显著;六组比较都出现检索增加。它揭示了常见成功率指标遗漏的运行成本,不过 ALFWorld 上没有复现同样的检索激增,外推仍受任务类型约束。

    Paper2026-08-19arxiv.org原文 ↗
    –
  • SlimeBoyOwO/LingChat

    LingChat 用 Tauri 组合独立长期记忆、情绪、语音、桌面感知、日程与互动剧情,定位是持续存在的本地角色而非普通聊天窗口。当前 Windows 版本为 v0.5,用户需自备 API key;README 称 VITS 在独显上约 1 秒、集显上约 1 分钟。如此大的硬件差距意味着语音回合延迟会直接决定角色体验是否连贯。

    Trending2026-08-19github.com原文 ↗
    –
  • Navigation-Informed Embeddings

    方法用代理真实搜索轨迹监督稠密检索器,不新增相关性标签、合成查询或 LLM 判定。支持文档 Recall@20 从 72.2 升至 78.0,长路径检索从 46.7 升至 55.4;打乱轨迹顺序会使总体表现下降 3.2 个点。轨迹中的访问顺序因此不只是日志,而是可转化为检索表示的弱监督信号。

    Paper2026-08-19arxiv.org原文 ↗
    –
  • HyMem

    HyMem 将长期任务状态拆成规划、执行和推理三层,并通过信息隔离阻止低层轨迹持续污染高层决策。它在 GAIA 和 BrowseComp 上分别达到 66.7 与 61.3,相对所用基线提高 6.1 和 4.7 个百分点。增益来自记忆组织而非单纯扩大上下文,为长程代理提供了比“把历史全部塞回提示”更可控的设计点。

    Paper2026-08-19arxiv.org原文 ↗
    –
  • GraniKV

    GraniKV 将连续共享前缀放入 HOT 区、请求级 token 后缀放入 COLD 区,并允许两部分采用不同分页和后端策略。在 16K 上下文下,它相对三种基线取得 2.16、1.98 和 1.57 倍提升;异构配置仍保持 1.95 倍,而全局级联方案降到接近持平。其关键不是新的压缩算法,而是利用多代理负载里前缀复用和后缀离散这两种不同局部性。

    Paper2026-08-19arxiv.org原文 ↗
    –
  • Engrava

    Engrava 在单个 SQLite 数据库中组合图关系、FTS/BM25、向量索引和追加式 journal,为代理提供可追溯的本地记忆。基础模式不要求服务器或 LLM,语义能力按需启用,因此离线与可迁移性优于强绑定云端的记忆服务。多种检索信号共库也意味着排序融合与数据压缩策略会成为长期维护重点。

    Project2026-08-19github.com原文 ↗
    –
  • OpenWebSearch

    OpenWebSearch 将 Brave、Exa、Parallel 等搜索服务放到统一路由后面,供代理或检索应用用同一接口查询。

    Project2026-08-18openwebsearch.ai原文 ↗
    –
  • whiteguo233/OpenBiliClaw

    OpenBiliClaw 在本机聚合 B 站、小红书、抖音、YouTube、X、知乎、Reddit、V2EX 等内容,并用反馈持续调整发现结果。状态保存在 SQLite,DeepSeek Harness 插件暴露 22 个工具;带 bge-m3 的完整嵌入包约 1.1GB,服务默认监听 8420 端口。它把跨站检索与个性化控制放回用户设备,但抓取稳定性和平台条款会比推荐算法更早成为运营约束。

    Trending2026-08-17github.com原文 ↗
    –
  • macro-inc/macro

    Macro 将邮件、消息、文档、任务、agent、通话、文件和 CRM 置于共享后端,跨对象引用原生存成双向图,团队与 agent 共用可搜索记忆。文档采用 CRDT 协作,邮件支持多账户统一检索,通话转写也进入记忆;约 15 人团队已自用两年,技术栈以 SolidJS 和 Rust 为主。统一数据模型能减少上下文搬运,不过集中更多工作数据也同步扩大权限设计、迁移和故障影响面。

    Trending2026-08-17github.com原文 ↗
    –
  • Wildstatic

    Wildstatic 让所有访问者与同一个 AI 实例交互,并共同写入一份持续存在的长期记忆。陌生人的输入会直接改变后来访客获得的上下文,刻意取消了常见的按用户状态隔离。这个小实验把共享记忆的涌现、污染和操纵风险暴露得很直接,其观察对象是跨用户状态演化而非单轮模型智力。

    Project2026-08-17wildstatic.com原文 ↗
    –
  • AI-Assisted GPU Porting of a 250k Line Legacy Weather Simulation Code

    论文以 25 万余行 Fortran 天气模拟器 CReSS 为案例,让 AI 提取 OpenMP 区域、生成具有物理意义的 kernel 基准、施加 OpenACC 变换,并逐元素对照 CPU 结果。团队验证了 162 个 kernel,在真实台风模拟上得到 5.1 倍应用级加速,同时找出 5 个由浮点运算和内建函数差异引起的偏差。它最有价值的结论不是“模型会写 GPU 代码”,而是大型科学软件…

    Paper2026-08-17arxiv.org原文 ↗
    –
  • pacifio/atlas

    Atlas 为并行编码 agent 提供本地源码控制与共享记忆,从 `.atlas/knowledge`、`CLAUDE.md`、`AGENTS.md`、Git 历史和会话记录建立可查询上下文。它能按文件、符号、提交和会话检索,输出 Markdown、JSON 或 JSONL,并用被 Git 忽略的 SQLite 保存 checkpoint。与单纯记录 diff 相比,它试图保留“为什么改”和各…

    Trending2026-08-16github.com原文 ↗
    –
  • ThoughtDAG

    ThoughtDAG 把每轮问答作为节点,把连线本身变成下一次请求的上下文边界;某节点只接收其上游祖先,删边会真实移除后续提示中的那段历史。它支持分支、合并、逐节点选择模型,以及带页码引用的本地 PDF,并把图和内容存进 IndexedDB。与传统聊天界面的区别不只是可视化:用户能直接编辑模型看到的因果路径;当前仍属早期原型,源码可用,但 Docker 交付尚未成熟。

    Project2026-08-16chenxiachan.github.io原文 ↗
    –
  • NexusMem

    NexusMem 在本地 SQLite 中记录 shell 命令、退出码、Git 提交与 diff、文档,以及可选的助手会话,再按 token 预算返回与当前任务相关的记忆片段。README 的两天样例积累了 527 个节点,其中 321 条 shell 命令、130 条对话、60 份文档和 16 次提交。默认关闭会话转录以减少密钥泄露风险,这种“先记录可验证行动,再选择性纳入对话”的优先级比全量…

    Project2026-08-16github.com原文 ↗
    –
  • Maximizing the value of your Claude Code sessions

    Anthropic 把 Claude Code 的效果问题落到会话管理:观察上下文和用量,在任务边界压缩历史,必要时 rewind,并用子任务隔离无关信息。官方工作流还强调先给验证目标和环境约束,再让 agent 执行,避免长会话积累的旧假设继续支配新步骤。文章把上下文窗口视为需要主动预算的工程资源,而非越长越可靠的历史仓库。

    News2026-08-16始 2026-08-15claude.com原文 ↗
    –
  • kenforthewin/atomic

    Atomic 把 Markdown 笔记自动分块、嵌入、打标签并按语义相似度关联,随后提供 sqlite-vec 搜索、力导向画布、带行内引用的 wiki 合成、定时研究报告和 agentic RAG。它可运行成 Tauri 桌面应用或 Docker 三服务,模型端支持 OpenRouter、Ollama 与 OpenAI 兼容接口,输入还有 RSS 和浏览器扩展。所有知识仍以 atoms 为基础…

    Trending2026-08-15github.com原文 ↗
    –
  • MindMemOS: A Portable and Self-Evolving Memory Operating Layer for AI Agents

    MindMemOS 以实体—属性—时间统一承载事实记忆,通过 schema 搜索、去重、冲突消解和轨迹技能化,让记忆结构与程序知识随运行演化。它在 LOCOMO 和 PersonaMem 上分别达到 94.03% 与 70.63%,在 SpreadsheetBench 上再提高 9.2 个百分点。相比只增加向量库容量,这套设计把“记住什么、如何整理、何时形成技能”放进同一个生命周期,实验也覆盖了记…

    Paper2026-08-15arxiv.org原文 ↗
    –
  • Graft

    Graft 先用 tree-sitter 建确定性结构图,再生成彼此链接的 Markdown 摘要,让 coding agent 按需拉取而不反复 grep 整库。162 次受控运行把平均 token 从 8,070 降至 4,650、调用从 4.2 降至 2.3、延迟从 39.8 秒降至 15.8 秒,正确率仍是 93%;50 个 SWE-bench 实例则从 27 个通过升到 33 个。支持…

    Project2026-08-15始 2026-08-07github.com原文 ↗
    –
  • Governed Persistent Memory

    这项工作把长期记忆定义成可审计的双时态状态机,写入前校验来源,冲突时隔离,撤回或删除后禁止复活,释放声明则默认 fail-closed。治理实现匹配全部 3,600 个测试;最强的简单策略只对 1,800 个,且在违规情形中有一半会释放不该出现的内容。模型检查遍历 331,776 个语义状态与 1,990,656 个查询状态而未见反例,不过作者明确把结论限定在给定契约和状态边界内,而非宣称系统记忆…

    Paper2026-08-15arxiv.org原文 ↗
    –
  • semantica-agi/semantica

    Semantica 在现有 LLM、向量库与 agent framework 之下增加 graph-native 的 context 和决策层,每项事实与决策都带 W3C PROV-O 来源,可按先例、因果和时间点查询。推理侧提供 forward chaining、Rete、Datalog 与 SPARQL,治理侧有 SHACL/OWL、冲突检测和保留 provenance 的实体合并;存储可换…

    Trending2026-08-12github.com原文 ↗
    –
  • neuml/txtai

    txtai 的核心 embeddings database 同时联合稀疏/稠密向量索引、graph network 与关系数据库,在一套 Python API 上提供语义搜索、多模态索引、RAG、模型 pipeline、workflow 和 agent。服务层可用 FastAPI 与 MCP,另有 JavaScript、Java、Rust、Go binding;agent 建在 smolagent…

    Trending2026-08-12github.com原文 ↗
    –
  • mufeedvh/code2prompt

    Code2Prompt 用 Rust 安全遍历代码库,遵循 `.gitignore` 和 include/exclude glob,把目录树、文件、Git diff/log/分支比较按 Handlebars 模板打成一个 prompt,并显示 token 预算。项目同时提供 TUI、Python binding 与 MCP server,还能规整 CSV、Notebook、JSONL 等格式,适合…

    Trending2026-08-12github.com原文 ↗
    –
  • SodaMem

    SodaMem 将长期对话记忆变成有证据约束的时间图:抽取带原文 span 的 FactEvent,同时保存提及、发生、有效时间,以及 `SUPERSEDES`、`CONTRADICTS`、`UPDATES` 关系。回答端通过 planner-reader 循环先收集可引用证据,再组合结论;在 LongMemEval-S 上作者报告 464/500、即 92.8% 准确率,平均每题 0.00161…

    Paper2026-08-12arxiv.org原文 ↗
    –
  • Not Worth Another Token

    这项工作把 deep-research agent 的上下文裁剪放在检索前、检索后和最终合成前三个位置,对照简单启发式与学习型边际价值模型。最稳定的结论不是某个 scorer 胜出,而是阶段更重要:早裁剪影响端到端检索支出,晚裁剪主要改善交给写作者的证据集。轻量规则最多省下 73% token 且质量仅小幅下降,但没有方法同时支配质量、效率和忠实度,适合把“何时停”设计成多目标策略而非单阈值。

    Paper2026-08-12arxiv.org原文 ↗
    –
  • TEPA: Revoking Stale Memories for Conflict-Robust Language Agents

    TEPA 为记忆增加可撤销有效性:同 key 的新证据冲突时撤销旧 precedent,检索只读取当前事实,历史仍可审计或重新提升。50-seed 完全 reversal 中 TEPA 得分 0.950,append-only 和 last-write-wins 仅 0.210,甚至低于无记忆 0.309;真实文件执行重现同一排序。它证明长期记忆除了写入和覆盖,还必须有显式的“失效”操作。

    Paper2026-08-11arxiv.org原文 ↗
    –
  • MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

    MemPrism 把互动保存为事件流,由轻量策略按任务选择关系结构、证据范围、结果条件和粒度,再用确定性 composer/render 生成临时工作记忆。长程具身与 web-agent 评测中,轨迹越长收益越明显且 memory token 更少;view policy 还能跨不同 VLM 直接迁移。存储与消费解耦,为冻结任务策略增加了一个可替换的记忆接口。

    Paper2026-08-11arxiv.org原文 ↗
    –
  • DocSift

    DocSift 先用 Docling/MarkItDown 把文档标准化并缓存,再以 SQLite FTS5/BM25 返回带页码、标题的相关 chunks,提供 CLI、HTTP API 和 MCP。34 页报告的实测从约 21k token 整文降至约 4k token 的五段答案,代价是首次下载布局模型约三分钟且检索只匹配词面。它刻意不引入 embedding/GPU,把可预测的本地隐私与低…

    Project2026-08-11github.com原文 ↗
    –
  • vitali87/code-graph-rag

    Code-Graph-RAG 用 Tree-sitter 解析混合语言 monorepo,把符号、调用与结构关系写入 Memgraph;自然语言问题先被翻成 Cypher,再以真实图查询结果回答。编辑侧不是自由文本替换,而是 AST patch/diff、死代码分析和 ast-grep 结构搜索,并可通过 MCP 暴露给 agent;完整语言支持覆盖 Python、TS/JS、Rust、Go、Ja…

    Trending2026-08-10github.com原文 ↗
    –
  • Compactdiff

    Compactdiff 读取 Claude Code 与 Codex 的 JSONL 会话,在每次状态变化时写入内容寻址仓库,因此上下文压缩不会抹掉此前文本。它同时比较追加式历史和被重写的历史,用出现次数感知的行匹配生成防篡改轨迹,并能导出自包含 HTML 回放。分支功能保存 JSONL 前缀,但项目没有承诺代理可直接从该点恢复;默认脱敏也不是机密清除保证,这两个限制决定了它更适合审计而非备份凭据…

    Project2026-08-09github.com原文 ↗
    –
  • SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

    SkillZip 将技能章节表示成执行图,抽取反复出现且契约有效的结构为可逆宏,同时保留边界签名、依赖闭包、验证器可达性和源码展开能力;ReZip 则处理增量演化。

    Paper2026-08-08arxiv.org原文 ↗
    –
  • Remembrane

    Remembrane 同样坚持单 SQLite,但走混合检索:默认哈希词法嵌入、精确向量扫描与 BM25,再按每周半衰的时近性、重要度和历史结果效用重排,并用 knapsack 打包上下文。

    Project2026-08-08github.com原文 ↗
    –
  • Llmem

    Llmem 以约一万行 Go 和单个 SQLite 文件实现 coding-agent 记忆,不依赖向量数据库、嵌入 API 或云服务;检索采用 BM25,可选 WordNet 扩词。

    Project2026-08-08github.com原文 ↗
    –
  • Comparative Approaches to Agent Retrieval over Large Skill Libraries

    研究用 690 个技能和 117 个现实查询比较词法+稠密混合检索与包含前置条件、数据流、顺序边的技能图,并刻意避免让查询复述技能标题。

    Paper2026-08-08arxiv.org原文 ↗
    –
  • Alyph

    Alyph 把 LLM 对话历史呈现为可编辑、可分叉的上下文图,用户能从任意节点产生并行分支,再比较不同提示或模型响应,而不必复制整段会话。

    Project2026-08-08alyph.ai原文 ↗
    –
  • ReflectWorld

    ReflectWorld 从摄像头或视频持续抽取人物、物体、事件和证据,建立可查询的实体档案与时间线,并让后续感知依据既有记忆调整观察重点。

    Project2026-08-07github.com原文 ↗
    –
  • Hierarchical Graph Memory for LLM Agents

    HiGram 以概念层节点和细粒度 MemoryUnit 组成粗到细记忆,再用 MicroGraph 路径定位回答实际依赖的支持证据。

    Paper2026-08-07arxiv.org原文 ↗
    –
  • esengine/DeepSeek-Reasonix

    Reasonix 是单个静态 Go 二进制的终端编码代理,专门围绕 DeepSeek 前缀缓存设计:启动只注入小型稳定环境摘要,压缩前删除陈旧工具输出,也可让 planner 与 executor 保持各自稳定会话。模型、工具和插件由 TOML 声明,兼容 OpenAI endpoint、MCP 和 sidecar 扩展,CLI/TUI、桌面与 VS Code 共用本地引擎。这个设计把缓存命中率当…

    Trending2026-08-06github.com原文 ↗
    –
  • Your Agentic Workflow's Cache Keepalive Costs 8x Too Much

    作者用 100k token 前缀、4 家提供商和最长 40 分钟空闲做缓存保活测量,发现常见 30 秒 ping 比 4 分钟方案贵 7.8 倍。Anthropic 的较优间隔约 4 分钟、OpenAI 约 8 分钟;在前者上用 8 分钟会越过 5 分钟 TTL,成本甚至达到完全不保活的 4 倍。结论不是“总要延长 ping”,而是只在缓存即将淘汰且仍未越过盈亏线的狭窄区间续命。

    Blog2026-08-06blog.mempko.com原文 ↗
    –
  • Search, Inspect, Fetch

    SIEVE 把网页检索拆成按标题、章节和元数据搜索,检查候选结构,再只抓取选中章节的三阶段流程。它在 3 个问答集合上都高于最佳 Search-Visit 基线,同时少用 20.7%–50.6% token。方法的技术含义很直接:深度研究代理不必先吞整页再决定相关性,字段级可寻址性本身就是检索能力的一部分。

    Paper2026-08-06arxiv.org原文 ↗
    –
  • Hubmesh

    Hubmesh 先以多组件 Personalized PageRank 从种子扩散相关性,再把结构、覆盖和冗余纳入预算选择,查询阶段不调用 LLM。后端支持 Qdrant、Chroma,并可通过 MCP 暴露检索能力。其意义在于把多跳 RAG 的“为什么选这些节点”落到确定性图算法,降低生成模型参与检索带来的成本与漂移。

    Project2026-08-06github.com原文 ↗
    –
  • Beating GPT-5.6 Sol on Retrieval with 100x Cheaper Open Models

    Neon 与 Castform 报告开放模型检索方案的价格、延迟和准确率实验,并以“成本低 100 倍”为标题结论。

    Blog2026-08-06neon.com原文 ↗
    –
  • BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

    BAP-SQL 在查询前估计风险,据此改写 SQL 并设置运行时观察护栏,把“看多少数据库信息”变成可分配的预算。BIRD 衍生任务上,它相对匹配的 SFT 基线提升 3.4 和 3.6 个百分点,并少用 4.5% 和 5.0% token;不过模型更强或预算更宽时收益缩小,最宽松设置下甚至反转。论文因此更像一项资源控制结果,而不是普遍优于扩上下文的结论。

    Paper2026-08-06arxiv.org原文 ↗
    –

2026 年 7 月88

  • Why Software Factories Fail

    HumanLayer 认为“软件工厂”失败的根因不是 Agent 数量不足,而是缺少高质量上下文、明确验收和持续反馈闭环。并行编排会放大模糊需求与错误假设,产生更多代码却不一定提高可合并成果。文章把瓶颈从 token 和执行框架转移到规范、评审与环境反馈,反驳了单靠扩大自动化流水线即可获得可靠软件产出的设想。

    Blog2026-07-25github.com原文 ↗
    –
  • Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles

    作者把人物、组织和事件的关系写入持续更新的 narrative profile,让模型通过检索少量档案完成跨实体推理,而不必显式暴露或查询完整知识图。配套 MemHop 基准覆盖一至五跳问题,用来区分单实体回忆、关系拼接和长链路检索能力。结果所指向的核心取舍是:叙事压缩提高可读性与检索效率,但档案生成阶段一旦丢失关系,后续多跳推理无法恢复。

    Paper2026-07-25arxiv.org原文 ↗
    –
  • Marrow

    Marrow 为 Claude Code 会话建立本地语义索引,让用户按概念而非文件名搜索过去的决策、错误和实现讨论。数据保留在本机,并通过向量检索与会话浏览界面重新定位上下文。它把一次性聊天日志转化为工程记忆,但索引质量仍受会话内容是否完整、是否含敏感信息影响。

    Project2026-07-25github.com原文 ↗
    –
  • Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory

    研究在固定检索器和推理流程下比较逐字对话块与摘要、事实表等结构化记忆工件,发现保留原始措辞往往优于有损抽取。关键原因不是结构化表示毫无用处,而是抽取阶段会提前抹掉语气、条件和跨轮依赖,检索时再也无法恢复。结论把长期记忆设计的优先级重新排为“先保证信息保真,再优化组织形式”。

    Paper2026-07-25arxiv.org原文 ↗
    –
  • Amdb

    Amdb 用单个 Rust 二进制提供本地代码上下文检索,并以 MCP Server 形式把索引能力暴露给编码 Agent。其重点是快速安装、低运行依赖和在仓库内定位相关符号或文本,而不是上传代码到远程向量服务。对于希望保持代码私有又需要语义检索的团队,这种轻量本地组件具有直接实用性。

    Project2026-07-25github.com原文 ↗
    –
  • Supra Cognitive Modes: A Routed Architecture for Agent Memory

    论文提出按问题性质选择记忆模式:事实问题走精确检索,关系问题走图式联结,长历史问题走分层综合。路由器避免每次都把所有记忆塞进上下文,并让不同模式使用各自的压缩与证据组织方式;这种模块化设计的看点在于承认“记住一个事实”和“解释跨会话演化”并非同一种检索任务。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • State Compression in Two-Agent LLM Relays

    这项工作研究两段式 agent 中,第一个模型把长上下文压成中间状态后,数值、类别和逻辑约束会丢掉多少。作者系统改变摘要预算与约束密度,发现压缩并非均匀损失:看似次要的限定词和否定条件更容易消失,且后续模型通常无法察觉;结论是 relay 设计需要显式的约束槽位,而不能只依赖自由文本摘要。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • Prompt Caching in Agents

    文章从实际 agent 请求结构解释 prompt cache:只有稳定前缀、相同模型参数和满足供应商阈值的上下文才能命中,频繁改写 system prompt 或在前部插入动态状态都会破坏复用。作者建议把工具定义和长期指令放前面,把时间、轨迹等易变内容后置;这是一篇把缓存命中率与上下文工程直接连接起来的性能分析。

    Blog2026-07-24earendil.com原文 ↗
    –
  • Grounded Forge

    Grounded Forge 在摄取阶段就把原始资料转成摘要、结构化任务视图和可引用知识包,查询时不再临时拼装全部上下文。项目把索引结果与应用一起打包发布,强调可重复构建和来源追踪;这种“预计算知识产品”路线以存储换延迟,适合内容相对稳定、查询模式可预见的检索应用。

    Project2026-07-24github.com原文 ↗
    –
  • yvgude/lean-ctx

    lean-ctx 用本地 Rust 进程管理代理上下文、记忆、访问控制和持久化记录,对外提供统一接口。它把上下文选择从单次 prompt 拼装提升为独立服务,可在多个 agent 间复用并记录读取历史。轻量本地架构有利于隐私和低延迟,但策略质量取决于压缩、召回与权限规则的组合。

    Trending2026-07-23github.com原文 ↗
    –
  • rtk-ai/rtk

    RTK 是位于 shell 命令与 LLM 之间的 Rust CLI 代理,先过滤、归并和压缩输出,再送入模型上下文。它针对测试日志、构建输出和版本控制信息中的重复噪声,保留错误与关键差异。项目的收益可直接体现为 token 与注意力预算下降,但过滤规则必须避免删除诊断所需的上下文。

    Trending2026-07-23github.com原文 ↗
    –
  • Is Progressive Disclosure All You Need for Long-Context Agents?

    论文比较三种长文档供给方式:一次性塞入完整上下文、独立检索器筛选,以及让代理按目录逐步打开材料。结果显示 progressive disclosure 在不少任务上接近完整上下文,同时显著减少 token,但在需要跨文档全局整合时会受早期阅读决策拖累。它给出的不是单一赢家,而是提示“让代理自己找材料”同样需要评估搜索成本和遗漏风险。

    Paper2026-07-23arxiv.org原文 ↗
    –
  • HKUDS/LightRAG

    LightRAG 把实体关系图检索与向量文本检索结合:文档摄取时抽取实体和关系,查询时可走局部、全局或混合模式。项目支持多种 LLM、向量库、图存储和文档解析器,并提供 API server。它适合需要跨片段关系推理的知识库,但图抽取成本和实体合并质量会影响最终收益。

    Trending2026-07-23github.com原文 ↗
    –
  • AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents

    AgentBrew 让强教师模型在交互中产出可复用知识,再把这些经验沉淀到弱代理的外部记忆,而不是更新参数。论文在 5 类环境、11 个任务上测试,摘要报告弱模型平均提升 14.8 个百分点,并能持续吸收后续经验。方法把昂贵教师调用转化为可积累资产,但知识条目的筛选与过期管理会决定长期收益。

    Paper2026-07-23arxiv.org原文 ↗
    –
  • Accurate and Efficient Long-Term Memory for LLM Agents

    论文提出 MOSAIC,把长期记忆组织为带时间信息和实体关系的结构化表示,并用轻量分类器替代大量在线 LLM 判断。摘要报告,MOSAIC 在 LoCoMo 上达到 75.5%,同时把记忆构建时间降至约 1.5 分钟,相比强基线快约 100 倍。它展示了记忆系统不必在准确率和工程成本之间二选一,但效果仍依赖关系抽取与时间归一化的质量。

    Paper2026-07-23arxiv.org原文 ↗
    –
  • Your Agentic Workflow’s Cache Keepalive Costs 8x Too Much

    文章把代理框架常见的“定时打一条小请求保持 KV cache”拿到三家 API 上实测,结论是固定周期保活可能比按实际驱逐窗口调度贵约八倍。原因不只是 token 单价,还包括缓存写入、读取折扣、供应商隐式驱逐和任务间隔分布。工程上应把保活视为带概率的经济决策:只有下一次调用足够近、前缀足够大且命中折扣高时才续命,而不是把五分钟定时器写死在所有工作流里。

    Blog2026-07-22blog.mempko.com原文 ↗
    –
  • CodeAlmanac

    CodeAlmanac 从代理会话中提炼代码之外的知识:为何采用某个结构、哪些不变量不能破坏、跨文件流程怎样串联、过去踩过什么坑。它把 wiki 保存为仓库内 Markdown、本地索引,并要求知识更新走 Git review,使“代理记忆”成为可审查资产而非黑盒数据库;当前支持范围是 macOS、Codex/Claude Code 与 Python 3.12+。这个设计切中了长期代理工作的上下文…

    Project2026-07-22github.com原文 ↗
    –
  • tirth8205/code-review-graph

    code-review-graph 构建本地持久代码智能图,让 MCP 和 CLI 工具在 review 与大仓任务中检索代码库结构,而不是反复读全量文件。仓库标语是 “Stop burning tokens. Start reviewing smarter.”,项目描述强调已 benchmark context reductions。对于 coding agents,持久代码地图是降低重复 re…

    Trending2026-07-21始 2026-06-15github.com原文 ↗
    –
  • Provena: Open-Source Library for AI Agent Context Governance

    Provena 治理的是 agent “知道什么”:RAG 检索、工具输出、agent message、memory recall、MCP resource 进入 context window 前都可以被记录来源、hash 和时效。README 展示的最小用法是给产生 context 的函数加 `@trail.track`,每次调用写入 SHA-256 content hash、provenanc…

    Project2026-07-21github.com原文 ↗
    –
  • Local-first CLI to make Obsidian vaults searchable for AI agents

    NoteBrain CLI 把 Obsidian vault 转成完全本地的 AI agent 知识后端,索引 markdown 到嵌入式 ChromaDB。它用 `all-MiniLM-L6-v2` ONNX embedding 做 semantic search,用 wikilink graph traversal 找 backlinks/multi-hop/shared tags,并提供 h…

    Project2026-07-21github.com原文 ↗
    –
  • CogniKernel- Local Memory for AI Coding Assistants

    CogniKernel 为 Claude Code 与 Codex 提供项目级本地记忆,监听会话 hook,抽取决策、硬/软约束和废弃方案,再在后续 session 注入压缩 context block。它不是 vector database wrapper,而是 event-sourced typed memory log,检索采用 lexical-primary、FTS5 BM25、optio…

    Project2026-07-21github.com原文 ↗
    –
  • Canner/WrenAI

    WrenAI 是面向 AI agents 的 open-source GenBI 项目,用可信 context layer 支撑 text-to-SQL、dashboard、charts 和 SQL 生成。仓库描述覆盖 BigQuery、Snowflake、PostgreSQL、ClickHouse、Redshift、Databricks 等 20+ 数据源。它的重点不只是“自然语言问数据库”,而…

    Trending2026-07-21github.com原文 ↗
    –
  • Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

    论文指出生产 LLM 成本同时受 prompt caching 与 prompt compression 影响,而 query-aware compression 会机械破坏 prefix-strict cache。作者在 Anthropic Sonnet 4.6 上测到两层 cache 结构:约 3,500 tokens 是阈值,低于阈值的 30-call session hit rate 停在…

    Paper2026-07-21arxiv.org原文 ↗
    –
  • Amnesia - audit Claude Code's memory for contradictions

    Amnesia 面向 Claude Code 长期 memory store 的腐化问题:过期事实、跨项目泄漏、重复规则和互相矛盾的记忆。它会扫描 `~/.claude/projects//memory/`,把 memory 显示成项目着色的 force graph,并调用本机 `claude` CLI 标记 contradiction、stale fact、duplicate 和 misfile…

    Project2026-07-21github.com原文 ↗
    –
  • upstash/context7

    Context7 的仓库描述是给 LLM 和 AI code editors 提供 up-to-date code documentation。项目要解决的是模型训练知识过期导致的 API 幻觉:把库名或开发上下文映射到当前版本文档,再给 agent 编码时使用。它不是另一个聊天界面,而是文档事实源和开发工具之间的中间层。GitHub Trending 里这类项目增多,说明 agent 生态已经把…

    Trending2026-07-20github.com原文 ↗
    –
  • OpenAI reduces Codex Model Context Size from 372k to 272k

    OpenAI Codex 仓库 PR 文件显示模型上下文大小配置从 372k 调整到 272k。digest 把它放进行业新闻是合理的:这是可见的产品运行配置变化,而不是 README 功能点。正文只按文件差异本身解读,它说明某个配置路径里的可用上下文预算收窄了 100k tokens。背后的容量、成本或质量原因没有在条目中给出,因而不应把这条写成策略结论。

    News2026-07-20github.com原文 ↗
    –
  • Knowledge graph skill for Claude/Kimi Code

    SysEdge 是给 Claude Code / Kimi Code CLI 团队用的本体知识图谱,用节点记录需求、用例、功能、测试、缺陷和架构标准。页面把它的收益放在“显式项目记忆”上:能查询哪些需求没有测试、哪些缺陷关联了 PII、哪些 ADR 没有落实到代码。Formbricks 案例中,orientation token 从 14,512 input+output 加 1,797,494…

    Project2026-07-20org-edge.com原文 ↗
    –
  • I burned all my tokens researching how to save tokens

    Quesma 的文章介绍一个减少研究 token 消耗的自定义 deep research pipeline。标题里的反讽很直接:作者先在研究阶段花掉大量 token,再通过管线化抓取、筛选、压缩和上下文复用降低后续成本。技术重点是把“让模型读完所有材料”拆成分阶段检索、摘要、过滤和预算控制,而不是把长上下文当成唯一解决方案。它对 LLM 工程的启发在于,研究质量和 token 成本之间可以靠流程…

    Blog2026-07-20quesma.com原文 ↗
    –
  • Graphify-Labs/graphify

    Graphify 是 AI coding assistant skill,目标是把代码、schema、脚本、文档和媒体转成可查询知识图谱。它不只做文本搜索,而是把项目资产抽取为节点与关系,让 agent 能查询代码结构、数据模型和文档之间的联系。这个方向的价值在大型代码库中更明显:agent 需要的不是更多上下文文本,而是能回答“这个功能、表、脚本和测试怎么关联”的结构化索引。Graphify 的…

    Trending2026-07-20始 2026-07-15github.com原文 ↗
    –
  • Track, Rank, Crack

    论文提出 epistemic working memory,通过显式记录已确认、待验证和待探索信息来改善多跳推理。track、rank、crack 三个动作分别负责维护状态、排序缺口和推进求解。它的价值在于把 agent 的中间认知状态外显出来,减少多跳任务中“看似在推理、实际在混合猜测和遗漏”的不可观察性。

    Paper2026-07-16arxiv.org原文 ↗
    –
  • TencentCloud/TencentDB-Agent-Memory

    TencentDB-Agent-Memory 是本地运行的 agent 长期记忆系统,使用四层渐进式 memory pipeline。它围绕记忆写入、整理、检索和保存组织 agent 上下文,使交互经验可以被长期查询。项目值得观察的是企业数据库团队如何把记忆系统产品化,而不是只做向量库 demo。

    Trending2026-07-16始 2026-06-17github.com原文 ↗
    –
  • Open-source memory for coding agents, synced over SSH

    deja-vu 为 coding agents 提供本地项目记忆,并通过 SSH 在机器之间同步。项目的做法是把上下文、决策和项目背景保存为开发者可检查的本地资料,而不是绑定在某个云端助手会话里。它对多设备开发尤其直接:agent 记忆可以跟着项目移动,同时仍保持普通文件的可审阅性。

    Project2026-07-16github.com原文 ↗
    –
  • Guardian Angels: LLM Personalization for Productivity and Security

    Gwern 讨论个性化 LLM 助手如何同时承担生产力增强和安全防护角色。文章涉及长期记忆、用户画像、提醒、过滤和风险拦截等能力,并把它们放进“guardian angel”式个人代理设想。它的核心张力是:助手越理解用户,越能提前行动,也越需要边界、审计和可撤销控制。

    Blog2026-07-16gwern.net原文 ↗
    –
  • Critic Experience Bank

    论文提出 Critic Experience Bank,用自演化经验库支持 step-level confidence estimation。它把 critic 在历史步骤中的判断沉淀下来,供后续 agent 动作估计可靠性,而不是只在终局看 success/fail。这个方向把 agent 调试粒度拉到单步行动,适合分析复杂任务中“哪一步开始不可信”。

    Paper2026-07-16arxiv.org原文 ↗
    –
  • What Context Does a Coding Agent Actually Need to Act?

    论文把 coding agent 的上下文需求分成定位工作点与执行编辑两个阶段,并对 SWE-bench Verified 的 96 个任务做人工审计。一个关键数字是 49% 的任务需要语义相关但词面不相似的外部信息;在约 10K token oracle 编辑上下文下,Claude Sonnet 4 的理论解决率上限是 70.2%,而现有检索方法仍低 43.8 个百分点。这说明“长上下文”并不等…

    Paper2026-07-15arxiv.org原文 ↗
    –
  • MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

    MemDecay 提出 region-aware KV cache eviction,按上下文区域管理长轨迹推理中的缓存保留。它区分系统指令、用户目标、工具输出、历史推理和检索材料等不同区域,避免把所有 token 当作同等可驱逐对象。这个设计贴近 agent 推理的真实结构:有些早期约束很短却关键,有些近期工具日志很长却可能只需短期保留。

    Paper2026-07-15arxiv.org原文 ↗
    –
  • GRASP: GRanularity-Aware Search Policy for Agentic RAG

    GRASP 处理 Agentic RAG 中常见的三连决策:什么时候检索、用哪种检索、返回多粗粒度的上下文。论文把这些选择合成一个 granularity-aware search policy,让 agent 在文档、段落和更细片段之间按任务状态切换。它的技术看点不是再堆一个 retriever,而是把检索成本、证据完整性和上下文污染放进同一控制策略。

    Paper2026-07-15arxiv.org原文 ↗
    –
  • Context Warp Drive

    Context Warp Drive 做确定性 context compaction,明确不调用 LLM 生成摘要。它用规则化方式裁剪、保留和重排 agent 上下文,以降低 token 占用并避免总结模型引入遗漏或改写。这个项目的亮点是可解释性:压缩结果来自确定规则,调试时不必再追一个摘要模型是否说错。

    Project2026-07-15github.com原文 ↗
    –
  • Alluvia

    Alluvia 做的是本地 AI 会话历史挖掘,目标来源包括 Claude Code、Cursor 和 ChatGPT。项目把分散在不同工具里的提示、代码讨论和模型回复索引到本机,便于跨工具找回旧上下文。它的现实意义在于,AI coding 的知识资产正在沉淀在聊天记录里,而这些记录通常比普通代码搜索更敏感。

    Project2026-07-15github.com原文 ↗
    –
  • Agentic Context Learning with Self-Discovered Specification

    这篇论文讨论 inference-time context learning 中的一个更难问题:模型要先从上下文里发现隐含规格,再把规格应用到新任务。方法围绕 self-discovered specification,让 agent 抽取格式约束、操作规则和任务边界,再进入执行阶段。它的看点在于把 few-shot/context learning 从“看例子模仿”推进到“从上下文重建任务规范”…

    Paper2026-07-15arxiv.org原文 ↗
    –
  • volcengine/OpenViking

    OpenViking 是面向 AI agents 的 context database,整合 memory、knowledge RAG 和 skills。它试图把长期记忆、知识检索和可调用能力放到同一上下文层中,解决 agent 多轮任务中的资料找回问题。这个方向的成败会取决于检索精度、记忆更新策略和权限隔离。

    Trending2026-07-13github.com原文 ↗
    –
  • Wisp

    Wisp 是私有桌面 AI overlay,可以从当前应用抓取文本、截图等上下文,并支持 MCP。它把桌面正在发生的状态直接提供给助手,而不是要求用户手动复制窗口内容。这个项目值得观察的地方在于端侧上下文获取、隐私边界和工具协议如何组合成日常桌面助手。

    Project2026-07-13github.com原文 ↗
    –
  • Kote

    Kote 从 AI chat 和 Git 历史中自动捕获工程上下文,供后续检索和复用。它试图解决 coding-agent 多轮工作中的上下文断裂:一次会话里解释过的架构、约束和改动原因,下一次不应全部重来。项目的看点在于把对话和版本历史都纳入工程记忆,而不是只索引当前代码文件。

    Project2026-07-13github.com原文 ↗
    –
  • Claude Code sends 33k tokens before reading the prompt; OpenCode sends 7k

    Systima 对 Claude Code 和 OpenCode 的会话启动 token overhead 做日志级对比。标题给出的关键数字是:Claude Code 在读取用户 prompt 前发送约 33k tokens,OpenCode 约 7k。文章把 agent 成本从“每次回答用了多少 token”拆到启动上下文阶段,这对延迟、费用和隐私评估都很具体。

    Blog2026-07-13systima.ai原文 ↗
    –
  • Capn-hook

    Capn-hook 是面向 coding agent 的 hook 工具,用来记录和复用已经探索过的代码上下文。它瞄准“同一个项目里反复 grep、反复读同一批文件、反复重建调用链”的低效模式。通过把探索痕迹变成可再注入上下文,项目让 agent 会话之间具备更强连续性。

    Project2026-07-13github.com原文 ↗
    –
  • VoltAgent/awesome-design-md

    awesome-design-md 收集流行产品设计系统的 DESIGN.md,供 coding agent 生成一致 UI 时参考。它把品牌、组件、布局和交互约束转成 agent 易读的 Markdown,而不是只给人类设计师看 Figma。这个仓库的实际意义在于提升 AI 生成前端的约束质量,减少“能运行但不像产品”的界面。

    Trending2026-07-11github.com原文 ↗
    –
  • Remember When It Matters

    论文提出 proactive memory agent,用于长程任务中在恰当时刻重新浮现历史状态。它维护任务事实、过往尝试、诊断和未完成子目标,并在上下文膨胀后主动判断哪些记忆应该回到当前推理链。这个方向把记忆系统从“向量库召回片段”推进到“围绕任务进展做时机判断”。

    Paper2026-07-11arxiv.org原文 ↗
    –
  • Context Graphs for Proactive Enterprise Agents

    论文提出 context graph,让企业 agent 在用户发问前就能基于工作上下文发现可行动信息。图中显式连接用户、任务、文档、工作流和权限,并把 provenance、recency、permission、actionability 作为核心元数据。它值得放进 agent 基础设施讨论,因为主动性不再只是“多轮聊天更积极”,而是被建模成可审计的上下文图更新与触发。

    Paper2026-07-11arxiv.org原文 ↗
    –
  • datawhalechina/all-in-rag

    all-in-rag 是 Datawhale China 的中文 RAG 全栈教程,目标是从理论到实践构建检索增强生成体系。README 列出的主线包括 RAG 基础、数据加载/清洗/文本分块、向量与多模态 embedding、向量数据库与索引优化、混合检索、query construction、Text2SQL、生成集成、系统评估和项目实战。GitHub 页面显示约 9.3k stars、4.6…

    Trending2026-07-09github.com原文 ↗
    –
  • Trace - open-source, self-organizing memory for LLM agents

    TRACE 是一个 Python agent memory library,把对话历史组织成 hierarchical B+Tree 和 vector retrieval 结合的长期记忆结构。仓库分成 `trace_memory/` 引擎与 `nexus_terminal/` demo chatbot;它用 TopicNodes 与 MessageNodes 保存分支语义,再用 cosine se…

    Project2026-07-09github.com原文 ↗
    –
  • StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems

    StateFuse 解决的是多 agent 分支、重试、replica 写入中观察相互冲突的问题,选择保留冲突而不是用 overwrite 规则提前压平。它基于标准 OpSet/CRDT merge,定义 agent-facing semantics:immutable history、explicit conflict objects、claim_id/claim_ref correction…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Onboard-CLI, a LLM powered and AST-based tool to visualize codebase

    Onboard-CLI 是一个 Go 写的本地 CLI 加 React Flow 可视化器,用 Tree-sitter 做 AST slicing,把大型代码库映射成结构拓扑图。README 列出 5+ 内置解析器(Go、TypeScript、JavaScript、Python、Java),`onboard map` 会启动本地 canvas,`onboard drift` 可按 `archite…

    Project2026-07-09github.com原文 ↗
    –
  • Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents

    这篇论文把 agent 的 memory 从“每轮最多查一次的外部工具”移动到 observe-reason-act 循环内部,让每一步都能读写记忆。关键实验把延迟作为变量:in-process store 约 100us,云端 110ms round trip 下 redundant actions 从 0/12 升到 7.2/12;在 bounded window 中,in-loop memo…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    FreqDepthKV 针对长上下文推理中的 KV cache 内存与带宽瓶颈,把相邻层 KV states 分解成共享低频 depth components 和稀疏高频 residuals。它用轻量 online probe 判断 attention heads 应使用 shared-depth、residual-depth 还是 exact cache mode,从而不用 retraining…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Backlog - tasks and contexts manager for AI coding agents

    Backlog 是 local-first task/context manager,把 coding agent 的任务、计划、文档、记忆和活动日志放进同一个 SQLite DB,而不是留在超长 chat thread 里。每次写入都带 actor attribution,比如 `human:alice` 或 `ai:claude-code`;CLI、web UI、skills 和 MCP 都读…

    Project2026-07-09github.com原文 ↗
    –
  • Akashic: A Low-Overhead LLM Inference Service with MemAttention

    Akashic 处理的是长会话 agent 反复回放全部历史带来的 prefill、上下文长度和证据淹没问题。它用 MemAttention 把上下文组织成 bounded chunks,并显式建模 chunk 之间的语义关系;系统层还做 hardware-software co-designed memory placement,把可能一起取回的 chunk 放近,减少检索碎片和 I/O。摘要报…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Shadow Web

    Shadow Web 为 LLM agent 压缩网页 token 表示,把网页转换成更适合模型消费的紧凑内容。它试图剔除导航、重复 DOM 文本和页面噪声,同时保留 agent 浏览需要的主要信息。这个工具的技术焦点是网页理解成本:长网页不是不能读,而是上下文预算和相关性管理会迅速变差。

    Project2026-07-08github.com原文 ↗
    –
  • Revector

    Revector 是 Qdrant 的 schema migration 工具,作者把它类比为向量数据库版 Alembic。它管理 collections、vectors、payload indexes 等结构变化,让向量库 schema 演进可以进入版本化 migration 流程。随着 RAG 和向量检索进入生产系统,这类工具把“向量库配置”从一次性脚本变成可审计变更。

    Project2026-07-08github.com原文 ↗
    –
  • PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents

    PLACEMEM 将 lifelong agent 的记忆层放到计算预算下设计,讨论哪些信息应持久化、何时修正、运行时是否值得检索。它把 memory plane 视作有放置策略和成本模型的系统组件,而不是无条件增长的外部存储。这个视角对长期运行 agent 很关键,因为检索本身也会消耗延迟、token 和推理注意力。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

    PEEK 针对 LLM serving 中 KV cache 的调度和淘汰,利用排队请求之间的前缀共享来预测缓存价值。它的关键思想是 eviction 不只看当前 cache,还看队列里即将到来的请求是否能复用这些前缀。对高并发推理服务来说,这把 KV cache 从被动显存占用变成了可预测的队列资源。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • Object-Centric Environment Modeling for Agentic Tasks

    这篇提出用对象为中心的环境模型记录 agent 交互经验,把实体、属性、关系和状态变化从原始日志里抽出来。相比把历史都塞进 transcript 或向量库,对象视图更适合做一致性检查、状态复用和后续规划。论文的意义在于把 agent memory 往可维护状态模型推进,而不只是“存更多上下文”。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents

    MRMS 提出多分辨率记忆基底,把个人上下文、外部证据和可修订记忆分层处理。它避免把所有记忆都压缩成同一类摘要或 embedding:证据需要可追溯,状态需要可更新,长期偏好又需要稳定保留。论文的可读点在于它直接处理“长期 agent 会记错、会过期、会混淆证据和结论”这个现实问题。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    这篇综述将 KV cache 管理按 locality、lifetime、ownership 和 substrate 分类,从单卡 tensor buffer 扩展到分布式内存层级。它覆盖显存、主存、远端存储和跨请求共享等设计面,说明 KV cache 已经不是简单优化项,而是 LLM serving 系统结构的一部分。适合用来梳理近期 PagedAttention、prefix cache、of…

    Paper2026-07-08arxiv.org原文 ↗
    –
  • CoACT: Action-Preserving Observation Compression for Coding Agents

    CoACT 处理 coding agent 的上下文膨胀问题,但目标不是做漂亮摘要,而是压缩后仍保持原本会采取的行动。论文把代码、终端输出和环境反馈中的信息按“是否改变下一步动作”来筛,避免把关键报错或文件状态压没。它值得看的是评估目标发生了变化:压缩质量由后续行动保持程度衡量,而不是摘要相似度。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • Claude Code Live Memory

    Claude Code Live Memory 是 Claude Code plugin / MCP server,用低成本模型持续维护代码库记忆。它在编码会话之外提炼项目结构、约定和近期变化,供后续 Claude Code 调用。项目的看点是把代码库理解从“每次重新扫描”改成“持续增量维护”。

    Project2026-07-08始 2026-07-07github.com原文 ↗
    –
  • Pruning RAG context down to what the answer actually needs

    Kapa.ai 在 RAG pipeline 的 reranker 与 generator 之间加入一个小模型 pruner,让它同时看问题和所有候选 chunk,再按 1-5 等级判断哪些 chunk 真会参与答案。生产回放显示它丢掉约 68% context、保留约 96% recall,并在扣除自身调用成本后降低约 34% 查询费用。文章还指出 rerank score 不是跨 query…

    Blog2026-07-07kapa.ai原文 ↗
    –
  • OthmanAdi/planning-with-files

    planning-with-files 把长任务的计划、发现和进度写入三个 markdown 文件:`task_plan.md`、`findings.md`、`progress.md`。README 的核心比喻是 context window 是易失 RAM,filesystem 是持久 disk,所以重要信息必须落盘。它支持 Claude Code、Cursor、Codex、Gemini CLI…

    Trending2026-07-07github.com原文 ↗
    –
  • Two-tier-memory

    Two-tier-memory 面向 AI coding agents 提供可查询长期记忆,把短期工作上下文和长期项目知识分层管理。它试图解决长项目中 agent 遗忘历史决策、约束和事实的问题,让模型在需要时检索稳定记忆,而不是把所有内容塞进上下文窗口。这个设计对大型代码库尤其实际,因为项目记忆的可维护性会直接影响 agent 后续修改是否反复踩同一类坑。

    Project2026-07-06github.com原文 ↗
    –
  • Aletheia

    Aletheia 面向 Claude Code 和 Codex,提出 uncertainty-loop agent:系统维护 belief state、问题、假设和证据,当不确定性超过阈值时继续搜索和更新,低于阈值再输出。README 明确反对把复杂问题机械拆成 task list,而是让“是否足够确定”成为控制流的一部分。它有技术新意的地方在于把假设、证据和置信度作为 agent 工作记忆,而不…

    Project2026-07-06github.com原文 ↗
    –
  • sopaco/deepwiki-rs

    deepwiki-rs 用 Rust 把代码库生成结构化技术文档和 agent 上下文。它面向大型 repo 缺少稳定概览的问题,让开发者或 agent 不必每次从零 grep 代码结构。Rust 本地实现强调性能和可运行性,适合把文档生成纳入 CI 或本地分析流程。

    Trending2026-07-04github.com原文 ↗
    –
  • pxpipe

    pxpipe 把代码转成图像,再让模型通过 OCR 读取,目标是在 Claude/Fable 等工作流里降低文本上下文成本。这个项目的具体实验点是把代码上下文从 token 序列换成视觉载体,绕开一部分 BPE 计费和窗口压力。它不是通用生产方案,但作为“上下文压缩可以跨模态”的探索很有技术味道。

    Project2026-07-04github.com原文 ↗
    –
  • ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

    ReContext 提出 recursive evidence replay,用 harness 反复检查模型是否真正利用长上下文中已给出的证据。它关注的不是扩大 context window,而是追踪模型在长文档中是否回到关键证据并保持推理一致。这个问题在法律、审计、研究综述和复杂客服场景都很具体:答案看似合理并不等于证据链被正确使用。

    Paper2026-07-04arxiv.org原文 ↗
    –
  • Quicktok

    Quicktok 是精确 BPE tokenizer,项目描述称比 tiktoken 更快。它瞄准的是 token 计数、截断、批量预处理和上下文预算估算这类底层路径,而这些路径在高吞吐 RAG 或日志处理系统里会被频繁调用。值得注意的是 tokenizer 性能经常被忽略,但它会直接影响服务端延迟和离线数据处理成本。

    Project2026-07-04github.com原文 ↗
    –
  • MothRAG

    MothRAG 是多跳 RAG 项目,强调不依赖图重建来完成跨文档推理。它瞄准的问题是复杂查询常常需要把多段证据串起来,而图构建和维护成本会拖慢迭代。项目值得观察,因为多跳检索如果能用更轻量流程实现,会降低许多企业知识库从单跳问答升级到复杂推理的门槛。

    Project2026-07-04github.com原文 ↗
    –
  • Memorizing session transcripts isn't useful

    文章批评 agent 记忆系统直接保存完整会话 transcript 的做法,认为原始对话很快会变成噪声密集、检索困难的历史堆。它主张提炼决策、偏好、约束和长期事实,并记录哪些信息会过期。这个观点切中 agent memory 的核心:记忆不是存储越多越好,而是要把可复用信息从会话流水里蒸馏出来。

    Blog2026-07-0412gramsofcarbon.com原文 ↗
    –
  • Contextify

    Contextify 本地索引 Claude Code 和 Codex 会话,支持跨工具检索历史 transcript。它做的不是把所有旧对话塞进 prompt,而是把过往决策、命令、代码修改和讨论变成可搜索材料。对于长期项目,这类工具的核心价值是找回上下文来源,而不是幻想原始 transcript 本身就是高质量记忆。

    Project2026-07-04contextify.sh原文 ↗
    –
  • A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory

    A-TMA 讨论长期 agent 记忆里的 state-aware failure,尤其是 ghost memory:旧事实、当前事实和状态转移事实在检索时混到一起。论文的关键拆分是把记忆错误和状态变化绑定,要求记忆系统理解事实何时失效、何时被替代。它切中长期 agent 的实际问题:向量相似度能找回相关片段,却不保证找回的是当前世界状态下仍然成立的片段。

    Paper2026-07-04arxiv.org原文 ↗
    –
  • ctx - Search the coding agent history already on your machine

    ctx 解决 coding agents 没有长期记忆的问题,但不引入 hosted memory service 或图数据库。它把本机已有的 agent transcripts 和 logs 索引到 SQLite,用 ranked text match 找回早前讨论、决策、失败尝试、命令、测试结果和 patch 线索。这个项目的实用性在于它承认“历史已经在你的机器上”,然后给当前 agent 一…

    Project2026-07-03github.com原文 ↗
    –
  • SchemaRAG: Dynamic Large Schema Reduction for LLM-driven Structured Information Extraction

    SchemaRAG 针对大而复杂的目标 schema,动态裁剪信息抽取时需要放进 prompt 的输出 schema 空间。它使用 schema metadata 和可选 few-shot examples 做 retrieval-augmented schema reduction,从而减少上下文长度、lost-in-the-middle 风险、延迟和成本。真实医疗与电商数据实验中,Schema…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • OpenWiki: CLI that writes and maintains agent documentation for your codebase

    OpenWiki 是 LangChain 的 CLI,用来生成和维护 agent-readable codebase documentation。README 提供 `npm install -g openwiki`、`openwiki --init`、交互模式、prompt 模式和 `--update`;还建议把 GitHub Action 加到仓库里,每天自动开 PR 更新文档。它把文档维护和…

    Project2026-07-03github.com原文 ↗
    –
  • From Signals to Structure: How Memory Architecture Drives Language Emergence in LLM Agents

    作者用 Lewis signaling game 研究两个 LLM agents 如何仅凭交互历史形成共享编码,并比较五种记忆架构与不同信道容量。persistent private notebook 在 capacity=25 时达到 0.867±0.023 的协调率,同时避开 stateless agents 在高容量词汇变大后的 collapse。这个结果把“上下文窗口够不够大”的问题改写为…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • Context.md - A proposed standard for AI project context

    context-md 提议用固定路径的 `context.md` 作为 Repository Context Layer,让 agent 在 planning 前读取项目事实,并把学到的约束以 Git diff 形式写回。核心原则包括 human-readable、reviewable、branch-aware、tool-independent 和 deterministic discovery;…

    Project2026-07-03github.com原文 ↗
    –
  • world-model-mcp

    world-model-mcp 把 coding agent 的项目经验组织成 temporal knowledge graph,在 edit boundary 前验证 API/function reference,并在 compaction 后重新注入相关约束。v0.10.0 文档称有 27 个 MCP tools、22 个 CLI subcommands 和 417 个测试,并把 adapte…

    Project2026-07-02github.com原文 ↗
    –
  • The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory

    论文提出 Janus,给已有长期记忆 updater 外面套一层选择性接受控制器,避免局部任务生成的 memory update 覆盖有用经验或过度贴合近期样本。它用 Memory Momentum Trigger 先找可疑的更新轨迹,再用 coverage、boundary 和 fresh tasks 组成的紧凑混合评测集比较新旧记忆,不需要重放完整历史。跨 6 个数据集、2 个 backbon…

    Paper2026-07-02arxiv.org原文 ↗
    –
  • Opera CLI compact accessibility snapshots

    这份白皮书围绕 browser agents 的 compact accessibility snapshot 展开,目标是压缩页面状态,同时保留 agent 操作所需的结构和 grounding。虽然 digest 没提供具体压缩率,但主题与 LUMOS、A11y-Compressor 同向:把 UI 观察从冗长 accessibility tree 或截图,转为更紧凑的语义表示。它值得放在 b…

    Project2026-07-02github.com原文 ↗
    –
  • Mimir

    Mimir repo 已重定向为 Perseus Vault,一个单 Rust binary 的本地优先 memory MCP server。它用 SQLite、FTS5、dense/hybrid search、AES-256-GCM 和约 46 个 MCP tools 提供 durable memory;README 的 stress test 给出 100K entity insert 1.0…

    Project2026-07-02github.com原文 ↗
    –
  • GOAT2-General-Orchestrated-Agent-Topology

    GOAT2 是带 proactive episodic memory 的 AI orchestrator 项目。digest 信息没有展开 README,但从定位看,它不是单个工具调用 server,而是尝试把 agent topology、任务编排和主动 episodic memory 结合。这个方向的技术问题在于记忆何时主动注入、如何避免过期经验误导,以及 orchestrator 如何在多…

    Project2026-07-02github.com原文 ↗
    –
  • ACE: Pluggable Adaptive Context Elasticizer across Agents

    ACE 针对长轨迹 agent 的固定上下文窗口问题,反对把历史一次性截断或摘要成不可恢复状态。它维护 lossless message layer,同时保存每个历史 step 的 raw message 和 compressed abstraction;决策时的 orchestration layer 再按当前任务状态把每步选为 raw、abstract 或 drop。论文把 ACE 接入 Re…

    Paper2026-07-02arxiv.org原文 ↗
    –

2026 年 6 月116

  • topoteretes/cognee

    Cognee 是开源 AI memory platform,用自托管知识图谱引擎给 agents 提供跨 session 长期记忆。它和 Agent Memory Bench 放在同一天看很有意思:一个提供记忆平台,一个测试记忆失败模式。Cognee 的技术押注是显式图结构能比纯向量检索更好表达实体、关系和历史事实。真正落地时,关键将是更新、冲突和遗忘策略,而不只是把内容写进 graph。

    Trending2026-06-29始 2026-06-23github.com原文 ↗
    –
  • colbymchenry/codegraph

    CodeGraph 为 Claude Code、Codex、Gemini、Cursor、OpenCode、AntiGravity 等 coding agents 建立本地预索引代码知识图谱,目标是减少 token 和工具调用;仓库描述还强调自动跟随代码变更同步和 100% local。它解决的是大仓库 agent 常见的冷启动问题:每次任务都从 grep、find、读文件重新发现结构。把代码关系提…

    Trending2026-06-29github.com原文 ↗
    –
  • Tokenmaxxing is dead, long live tokenmaxxing

    这篇文章讨论 agentic 系统中的上下文、token 使用和系统设计。它的核心转向是:单纯追求更大上下文窗口已经不够,关键变成怎样组织短期上下文、长期记忆、检索、工具结果和压缩摘要。它值得看,是因为很多 agent 失败不是因为 token 不够,而是上下文里混入了过期事实、无关日志和不可验证中间状态;“tokenmaxxing”真正要解决的是信息治理,而非窗口长度崇拜。

    Blog2026-06-2912gramsofcarbon.com原文 ↗
    –
  • safishamsi/graphify

    safishamsi/graphify 是一个 AI coding assistant skill,把项目资料转成 queryable knowledge graph。README 列出的输入范围很宽:code、SQL schemas、R scripts、shell scripts、docs、papers、images、videos 都可以进入图结构。它的技术方向是让 agent 不只读文件树,而…

    Trending2026-06-28github.com原文 ↗
    –
  • gglucass/headroom-desktop

    gglucass/headroom-desktop 是一个 macOS menu bar app,目标是减少 Claude Code 和 Codex 的上下文开销。README 声称通过 local-first optimization pipeline 可把 token costs 降低约 50%,方法是可逆压缩 tool output、logs 和 boilerplate。它抓住了 codin…

    Trending2026-06-28github.com原文 ↗
    –
  • risingwavelabs/risingwave

    RisingWave 是 event streaming platform,面向需要实时上下文的 agentic AI 和应用。README 说它用单系统替代 Debezium + Kafka + Flink + serving DB,持续 ingest 数据库变更、event streams、webhooks 和历史数据,增量处理并低延迟 serve。它的趋势点在于实时数据栈被重新包装成 age…

    Trending2026-06-27github.com原文 ↗
    –
  • opendatalab/MinerU

    MinerU 把复杂文档解析成 LLM-ready Markdown/JSON,覆盖 PDF、DOCX、PPTX、XLSX、图片和网页。README 提到 VLM+OCR 双引擎、109 种语言、公式转 LaTeX、表格转 HTML、阅读顺序恢复、页眉页脚移除、MCP server 和多 RAG 框架集成;3.4 版称 OCR 准确率约提升 11%、处理速度约提升 100%。它是 agentic…

    Trending2026-06-27始 2026-05-31github.com原文 ↗
    –
  • open-metadata/OpenMetadata

    OpenMetadata 把自己定位为 AI 的 open context layer,将 metadata management、data catalog 和 business semantics 合成知识图谱。README 列出 130+ connectors、data quality、lineage、column-level lineage、ownership、policies、glossa…

    Trending2026-06-27github.com原文 ↗
    –
  • OpenKnowledge - open source AI-first alternative to Obsidian/Notion

    OpenKnowledge 是 local-first WYSIWYG Markdown editor 和 LLM Wiki,目标是把个人笔记、spec、知识库和 agent second brain 放在同一个工作面里。README 明确支持 Claude、Codex、Cursor 协作编辑,也能通过 MCP/CLI 给 OpenCode 等 harness 使用;它还用 git/GitHub…

    Project2026-06-27github.com原文 ↗
    –
  • Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents

    论文区分 memory access 和 memory depth:检索能找回事实,但不保证经历在上下文卸载后继续影响行为。作者用 loop-drift protocol 测试长期干扰下的目标保持,EVAF 通过 surprise 与 valence gated LoRA 写入实现选择性巩固;在 GPT-2/TinyLlama 上,retrieval 短事实准确率 0.956-0.973,EVAF…

    Paper2026-06-27arxiv.org原文 ↗
    –
  • Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

    论文定义 compositional behavioral leakage,解释为什么没有共享变量的 prompt 模块仍会因为同处一个上下文窗口而互相影响。实验在 Claude Sonnet 4.6 的 job-evaluation agent 上跑 144 trials,只有 content perturbation 产生可检测 paired effect,Cohen's d=0.63,且没有…

    Paper2026-06-27arxiv.org原文 ↗
    –
  • Information-Aware KV Cache Compression for Long Reasoning

    InfoKV 不只看 attention weight,而是加入 token predictive uncertainty 与 layer-wise representation evolution,捕获对远期上下文更有影响的 token。论文提出 Forward Influence,指出 attention 选中的 token 主要影响近邻上下文,而高不确定性 token 对远距离未来上下文更关…

    Paper2026-06-27arxiv.org原文 ↗
    –
  • Context Recycling for Long-Horizon LLM Inference

    ContextForge 通过 structured query generation、external memory retrieval 和 controlled synthesis 回收长对话中的任务相关上下文。论文使用 15-turn healthcare query benchmark,覆盖多轮推理、回指和 domain shifts;相同底层模型下,它减少 token 消耗并提升一致性,…

    Paper2026-06-27arxiv.org原文 ↗
    –
  • BetterDB, MIT Valkey-native context layer for AI agents

    BetterDB packages 是一组 Valkey/Redis-native 的 agent context 组件,包括 semantic cache、agent cache、agent memory、retrieval、MCP observability server 和 monitor CLI。README 中 semantic-cache 使用 Valkey vector search…

    Project2026-06-27github.com原文 ↗
    –
  • vectorize-io/hindsight

    Hindsight 是 agent memory 系统,目标是让 agents learn over time,而不只是回忆对话历史。README 明确对比普通 memory 与 RAG,强调它关注从经验中学习,并提供 documentation、paper、cookbook 和 cloud 入口。它的定位代表一条趋势:agent memory 不再只是检索过去内容,而要把经验转化成未来行为改进。

    Trending2026-06-24github.com原文 ↗
    –
  • Self-Compacting Language Model Agents

    论文处理长程 agent 轨迹里 chains of thought、工具调用和过期内容不断挤占上下文的问题,提出 SelfCompact 让压缩触发依据轨迹结构,而不是固定间隔或 token 阈值。它指出固定阈值会无视推理边界,可能在 mid-derivation 或 mid-search 阶段丢掉仍在使用的局部结果。这个方向值得看,是因为上下文压缩正在从“省 token 的后处理”变成 age…

    Paper2026-06-24arxiv.org原文 ↗
    –
  • Grove

    Grove 基于 Tree-sitter 为 coding agents 提供快速源代码结构洞察。它不是把代码当普通文本块检索,而是从语法树里暴露函数、类、作用域和组织结构,让 agent 在修改前获得更稳定的代码地图。对大型仓库来说,这类结构视图能减少“先读错位置再改错文件”的概率。

    Project2026-06-24github.com原文 ↗
    –
  • EvoEmbedding

    EvoEmbedding 针对静态 embedding 把文本片段孤立编码、忽略上下文和时间顺序的问题,提出可演化表示。它面向长上下文检索和 agentic memory,让表示随上下文、序列位置和状态变化。这个方向反映出 memory 系统的检索单元正在从静态 chunk 走向带历史状态的动态对象。

    Paper2026-06-24arxiv.org原文 ↗
    –
  • SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG

    SproutRAG 把句子级 chunk 通过 learned inter-sentence attention 组织成逐步变大的语义单元,再在检索时做 hierarchical beam search。方法避免额外 LLM 调用、固定上下文扩展和有损摘要压缩;四个科学、法律和开放域 benchmark 上,信息效率平均比最强基线高 6.1%。它的看点在于同时处理检索粒度和上下文连贯性两侧的代价。

    Paper2026-06-23arxiv.org原文 ↗
    –
  • Recall

    Recall 是 Claude Code 的本地项目记忆插件,把 session activity 追加进 `.recall/history.md`,再生成可恢复的 `.recall/context.md`。README 明确没有 API key、外部模型或网络调用,摘要由本地 TF-IDF + TextRank 完成;恢复上下文约 1-2K token,并提供 `/recall:save`、`/…

    Project2026-06-23github.com原文 ↗
    –
  • PMB

    PMB 给 Claude Code、Cursor、Codex 等 MCP-aware agents 提供本地长期记忆,把决策、教训、项目事实和文档放在一个 SQLite 文件里。README 描述了实体图 dashboard、时间线、PDF 索引、50+ 语言 embedding,以及 `prepare(message)` 在 4-16ms 返回 project_context、lessons、r…

    Project2026-06-23github.com原文 ↗
    –
  • MemSlides

    MemSlides 面向个性化幻灯片生成,把长期记忆拆成 user profile memory 与 tool memory,并用 working memory 保留当前会话偏好和约束。系统配合 scoped slide-local revision,在局部修改时作用于最小受影响区域,而不是反复重生成整套 deck;实验显示 profile memory 提升 persona alignment,…

    Paper2026-06-23arxiv.org原文 ↗
    –
  • MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

    MCompassRAG 用 topic metadata 作为 paragraph-level retrieval 的“语义指南”,解决小 chunk 检索空间膨胀和大 chunk embedding 混杂多个主题的问题。它把主题信号放进同一 embedding space,并通过 LLM-teacher distillation 训练轻量 retriever;六个复杂检索 benchmark 上…

    Paper2026-06-23arxiv.org原文 ↗
    –
  • GeneralVLA-2

    GeneralVLA-2 针对机器人规划中的 3D 证据和可复用操作经验,提出 GeoFuse-MV3D 重建分支和 governed KnowledgeBank。GeoFuse-MV3D 在 GSO-30 上让 CD 和 LPIPS 分别下降 2.20% 与 2.02%,PSNR 和 SSIM 分别上升 2.36% 与 1.03%;KnowledgeBank 在 Terminal-Bench S…

    Paper2026-06-23arxiv.org原文 ↗
    –
  • Crespo

    Crespo 用 Tree-sitter AST 解析仓库,抽取 imports、classes、functions、structs 和 enums,生成 compact XML blueprint 给 LLM。它支持 structure、summary、concat 三种模式,覆盖 10 种语言;README 的 benchmark 显示结构问答平均 2.75/3,structure mode…

    Project2026-06-23github.com原文 ↗
    –
  • SpiceAI

    SpiceAI 把 SQL 查询、搜索、Text-to-SQL、OpenAI-compatible LLM gateway、Iceberg Catalog API 和 MCP 接口收进一个 Rust runtime,定位是“数据扎根的 agent sidecar”。README 给出的工程指标很硬:Ballista 分布式查询在 TPC-H SF100 早期预览里比单节点 DataFusion 快…

    Project2026-06-22github.com原文 ↗
    –
  • LLM Wiki

    LLM Wiki 走的不是传统“每次查询再 RAG”的路线,而是让 LLM 增量构建并维护一个持久 wiki。README 的功能面很宽:two-step ingest、PDF 图片抽取与 caption、可选 MinerU 解析、4-signal knowledge graph、Louvain community detection、vector search、folder auto-watch…

    Trending2026-06-22github.com原文 ↗
    –
  • FERNme

    FERNme 不是把每轮对话都丢给 LLM 总结,而是用 fuzzy graph 做低成本长期记忆。README 里核心机制很具体:每个用户是 per-site graph 里的稀疏加权节点,edge 通过 Hebbian co-occurrence 规则更新,检索走 spreading activation,给 prompt 的 card 只保存相对 population prior 的偏差。这…

    Project2026-06-22github.com原文 ↗
    –
  • Callimachus

    Callimachus 把 11 种 coding agent 的历史会话收进一个本地 SQLite 索引,包括 Claude Code、Codex、Cursor、Gemini CLI、Qwen Code、Goose、OpenCode、Continue、Cline、Roo Code 和 Kilo Code。搜索部分不是简单 grep:README 写明它把 SQLite FTS5/BM25 与 o…

    Project2026-06-22github.com原文 ↗
    –
  • stanford-oval/storm

    STORM 是 LLM knowledge curation 系统:给定主题后,它检索资料、提出多视角问题,并生成带引用的长报告。README 的 API 部分显示它支持 LiteLLM 语言模型/embedding,并适配 BingSearch、VectorRM、BraveRM、SearXNG、DuckDuckGo、Tavily、GoogleSearch、AzureAISearch 等检索模块。…

    Trending2026-06-21github.com原文 ↗
    –
  • OSU-NLP-Group/HippoRAG

    HippoRAG 把 RAG、知识图谱和 Personalized PageRank 组合起来,目标是模拟长期记忆式检索,而不是只做向量相似度召回。README 标题标注它是 NeurIPS 2024 项目,并强调让 LLM 在外部文档之间持续整合知识。它值得放进 trending,是因为很多 RAG 系统正在从“单 query 取 top-k chunks”转向图结构、路径推理和个性化 Page…

    Trending2026-06-21github.com原文 ↗
    –
  • labring/FastGPT

    FastGPT 面向知识库问答、RAG 和可视化 AI 工作流编排。它把知识库管理、检索增强和流程搭建放进同一个平台,目标用户更接近企业内部应用构建者。该项目的长期看点是 RAG 产品从脚本和 demo 走向可运营工作台,包括数据、模型、流程和权限的统一管理。

    Trending2026-06-20github.com原文 ↗
    –
  • garrytan/gbrain

    gbrain 是面向代理的检索与综合层,提供搜索、图遍历和 gap analysis。它把代理获取信息的过程拆成检索、结构化探索和缺口分析,而不是只给模型一个搜索框。这个项目的关键词是 synthesis:代理需要知道已经覆盖了什么、还缺什么,才能做更可靠的研究和决策。

    Trending2026-06-20github.com原文 ↗
    –
  • cocoindex-io/cocoindex-code

    cocoindex-code 是一个面向代码库检索的轻量级 CLI,重点不在把所有文件塞进上下文,而是通过 AST 结构帮助代理找到相关符号和片段。它的实用价值在于降低编码代理做上下文定位时的 token 成本,并把检索粒度从字符串匹配提升到代码结构。对于多文件修改任务,这类工具能减少“看了很多无关文件却漏掉关键定义”的概率。

    Project2026-06-20github.com原文 ↗
    –
  • Understanding the Behaviors of Environment-aware Information Retrieval

    这篇系统分析 LLM 在不同检索环境下如何改变查询构造策略。摘要指出当前 RAG 研究忽略了一个关键挑战:不同 retrievers 需要 fundamentally different query formulation strategies 才能达到最佳效果。这个主题对 RAG 和代理检索都很实际,因为检索失败常常不是模型不知道答案,而是把问题投给了不匹配的检索接口。

    Paper2026-06-20arxiv.org原文 ↗
    –
  • UltraQuant: 4-bit KV Caching for Context-Heavy Agents

    UltraQuant 关注的是长上下文、多轮代理负载中的 KV cache,而不是常见的权重量化问题。论文标题给出的关键设定是 4-bit KV caching,目标是在上下文很重的代理运行中降低缓存占用和推理成本。它值得放进今日重点,是因为代理系统的瓶颈越来越常出现在“保留多少历史状态”而不是“单次生成有多快”。

    Paper2026-06-20arxiv.org原文 ↗
    –
  • Multi-Agent Transactive Memory

    Multi-Agent Transactive Memory 借用了组织记忆里的 transactive memory 思路:群体不需要每个成员都知道全部知识,但需要知道谁知道什么、知识放在哪里。摘要把它类比为面向 agent-generated artifacts 的搜索引擎,用 retrieval systems 组织异构代理群体产生的知识以便复用。它把多代理协作的瓶颈从消息传递推进到长期知识…

    Paper2026-06-20arxiv.org原文 ↗
    –
  • LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

    这篇把工具调用代理的运行状态从一段不断增长的上下文,改成显式 ledger:事实、约束、策略条件和任务进展都以结构化状态保存。它的贡献不在于增加一个新工具,而是把“代理当前相信什么、还受哪些规则约束”变成可读取、可更新、可审计的对象。对需要策略遵守的代理系统来说,这种设计给运行时治理和错误定位留下了比 prompt 约定更清晰的抓手。

    Paper2026-06-20arxiv.org原文 ↗
    –
  • Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

    这篇把长周期语言代理的记忆保留问题写成一个带约束的资源分配目标:代理会积累 observations、reasoning traces 和 retrieved facts,最终超过上下文窗口。摘要明确指出现有系统多把保留决策当作局部问题,没有建模 observability constraints 下的长期后果。它把“记住什么”从启发式摘要策略推进到可约束优化,适合审视长期代理的记忆污染、隐私暴露…

    Paper2026-06-20始 2026-06-18arxiv.org原文 ↗
    –
  • Gora - simple search across all your local coding agents

    Gora 是一个本地 CLI,会自动索引 Codex、Claude Code 和 Pi 的聊天线程,让用户一次性搜索多个编码代理的历史会话。作者提到的痛点是每次让代理读取旧聊天时,都要重新发现各工具的目录结构和线程位置。把这些历史变成可搜索材料,可以帮助复用调试经验,也能让团队观察代理在何处反复失败。

    Project2026-06-20github.com原文 ↗
    –
  • Current World Models Lack a Persistent State Core

    这篇指出当前 world models 缺少 persistent state core,也就是无法稳定维护跨时间的内部状态。摘要把要求说得很清楚:物理世界建模不只是按需渲染可信画面,还需要一个与观测解耦、持续演化的 internal world state,让对象和事件在镜头外仍然延续。这个批评与长周期代理、机器人和仿真环境都有关。

    Paper2026-06-20arxiv.org原文 ↗
    –
  • infiniflow/ragflow

    RAGFlow 是开源 RAG engine,覆盖文档解析、检索增强生成和 agent 能力。digest 里的重点是端到端链路:从复杂文档进入索引,再到可追溯回答和自动化。它适合企业知识库场景,因为 RAG 的失败常常发生在解析和 chunking,而不只是生成模型。

    Trending2026-06-19github.com原文 ↗
    –
  • alexzhang13/rlm

    RLM 库把上下文和子调用放进 REPL,使模型可以写代码来分解长任务、调用子模型并处理近无限上下文。它支持本地和云端 sandbox,并包含训练 harness 与轨迹可视化。这个项目代表另一条长上下文路线:不把所有东西塞进窗口,而是让模型程序化地访问和递归处理信息。

    Trending2026-06-19github.com原文 ↗
    –
  • What Must Generalist Agents Remember?

    这篇论文给“通用代理需要记忆什么”一个形式化回答:当两个域共享观测瓶颈却要求不同最优动作时,近似最优策略必须保留能区分域的记忆分布。进一步地,如果记忆足以估计相关目标的价值,它也能近似重建局部转移动态。它的贡献不是新 benchmark,而是把 memory 从经验组件提升为泛化、规划和模型重建的必要条件。

    Paper2026-06-19arxiv.org原文 ↗
    –
  • The Token Compression Illusion: Why I'm Skeptical of RTK

    文章质疑递归或 token compression 方案把 token 数下降等同于保留了任务所需信息。digest 显示作者区分压缩上下文、摘要上下文和维持决策充分状态,这三者在 agent 长任务里不是同一个问题。它提醒读者看压缩方案时要问“哪些信息被保留用于下一步行动”,而不是只看上下文窗口占用。

    Blog2026-06-19mroczek.dev原文 ↗
    –
  • Myco Brain - source-traceable memory for AI agents on your own Postgres

    Myco Brain 把 agent memory 放在用户自己的 Postgres 上,通过 MCP 给 Claude、Cursor、Windsurf、Continue、Zed 等客户端共享。README 强调每个事实都可用 `brain_why` 追溯来源,独立来源提高置信度,矛盾事实会 supersede 且保留审计记录。它还给出 LongMemEval 复现数字:73.6% QA、reca…

    Project2026-06-19github.com原文 ↗
    –
  • Lume - a small, fast hybrid search engine written in Rust

    Lume 是 Rust 写的小型混合搜索引擎,面向本地或嵌入式检索。digest 强调 small、fast 和 hybrid search,说明它可能把词法召回与语义排序或向量检索组合成轻量索引。它与 agent memory 和本地知识库相关,因为很多代理系统需要的是可嵌入检索层,而不是完整搜索平台。

    Project2026-06-19github.com原文 ↗
    –
  • DeusData/codebase-memory-mcp

    这个 MCP server 把代码库索引成 SQLite-backed 知识图谱,并向 agent 暴露 14 个工具。README 给出的结构查询、call graph、route linking、dead code detection 和 semantic search 都围绕减少 agent 逐文件读取。它之所以值得放进 trending,是因为 coding agent 的瓶颈越来越像代码…

    Trending2026-06-19github.com原文 ↗
    –
  • Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

    DSG 把实时搜索 grounding 从模型供应商边界里抽出来,做成 MCP-compatible gateway,单独控制 provider routing、source-aware context rendering、fallback、retrieval depth 和缓存。实验显示它在 SimpleQA 上 86.1% 对 87.7% 几乎追平 native search,同时搜索成本低…

    Paper2026-06-19arxiv.org原文 ↗
    –
  • Announcing Stack Overflow for Agents

    Stack Overflow for Agents 是面向 agent 的 API-first 知识交换 beta,试图解决代理重复踩坑、上下文结束后经验消失的 Ephemeral Intelligence Gap。Beta 包含 Questions、TIL 和 Blueprint 三类 post,并要求 agent 起草内容后由人类 orchestrator 审核。它的核心机制是让验证、投票和反…

    News2026-06-19stackoverflow.blog原文 ↗
    –
  • zvec

    zvec 是 Alibaba 开源的 in-process vector database,设计目标是把低延迟 similarity search 直接嵌入应用进程,而不是额外维护一个向量数据库服务。README 摘要称它 lightweight、lightning-fast,并强调在 Alibaba Group 内部经生产场景验证。这个定位适合边缘服务、桌面应用、单体后端或 Agent 本地记忆…

    Trending2026-06-18github.com原文 ↗
    –
  • Yomi

    Yomi 把网页或整个网站抽取成干净 Markdown,目标是把 HTML 页面、导航噪声和视觉装饰压成可读、可索引、可交给 LLM 的文本。它属于 Agent/RAG pipeline 的 ingestion 前处理,把非结构化网页整理成更稳定的中间表示。相比直接把网页 DOM 丢给模型,干净 Markdown 更容易做 diff、cache、全文搜索和引用定位。

    Project2026-06-18github.com原文 ↗
    –
  • Understand Anything

    Understand Anything 的目标是把 codebase、knowledge base 或 docs 转成 interactive knowledge graph,并支持 explore、search、ask questions。README 的口号 “Graphs that teach > graphs that impress” 很准确:图不是为了炫酷,而是为了帮助人和 Agent…

    Trending2026-06-18github.com原文 ↗
    –
  • LMCache

    LMCache 是 LLM 推理侧的 KV cache management layer,目标是在请求之间、多进程和多节点环境里复用 cache,减少重复 prefill 成本。README 摘要强调 scalable LLM inference,并把近期更新集中在 agentic workload benchmark、multiprocess architecture 和 multi-node…

    Trending2026-06-18github.com原文 ↗
    –
  • Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

    Dr-DCI 把 retrieval 变成 Agent 可主动调用的 workspace 扩展动作:候选发现靠检索维持规模,跨文档过滤、比较和约束验证仍在局部 workspace 内用 DCI 操作完成。论文在 Browsecomp-Plus 上报告 71.2% accuracy,比 raw DCI 和消融变体最高提升 8.3 个点;加入 workspace-preserving context…

    Paper2026-06-18arxiv.org原文 ↗
    –
  • TokenPilot: Cache-Efficient Context Management for LLM Agents

    TokenPilot 解决长程 agent 会话中上下文累积与 prompt cache 断裂之间的冲突。它用 Ingestion-Aware Compaction 在全局稳定 prefix、过滤开放环境噪声,再用 Lifecycle-Aware Eviction 在局部按上下文片段生命周期批量卸载。实验在 PinchBench 和 Claw-Eval 上给出 isolated 模式 61%/56…

    Paper2026-06-17arxiv.org原文 ↗
    –
  • RyanCodrai/turbovec

    turbovec 是基于 TurboQuant 的 Rust 向量索引,并提供 Python bindings。README 称 1,000 万文档 float32 corpus 需 31GB RAM,而 turbovec 可放进 4GB;2-bit 下 1536 维 FP32 向量从 6,144 bytes 压到 384 bytes。它支持在线 ingest、搜索时 allowlist 过滤和…

    Trending2026-06-17github.com原文 ↗
    –
  • MODSetter/SurfSense

    SurfSense 是开源、隐私导向的团队版 NotebookLM 替代品。README 直接对比 NotebookLM 的限制,包括 source/notebook 数量、500,000 words 与 200MB source 上限、Google 服务绑定和多人协作不足。它提供 25+ external data sources、real-time multiplayer、AI file so…

    Trending2026-06-17github.com原文 ↗
    –
  • GitHits

    GitHits 为 coding agents 提供依赖项目源代码上下文,形态是 CLI 与本地 MCP server。它的核心问题是 agent 处理真实 bug 时常常需要理解依赖实现,而包文档、类型签名或 README 不足以解释行为细节。把依赖源码暴露为可查询上下文,可以让 agent 在跨 repo 调试、API 行为追踪和版本差异分析中少依赖猜测。

    Project2026-06-17githits.com原文 ↗
    –
  • Ctx

    ctx 根据当前任务推荐 skill、agent、MCP server 和 harness,减少 agent 上下文里无关工具描述。它维护 102,928-node LLM-wiki graph,包含 91,464 skills、467 agents、10,790 MCP servers、207 harnesses 和 2.9M graph edges,目标是每次只加载 10-15 个相关组件。配…

    Project2026-06-17github.com原文 ↗
    –
  • Web Researcher MCP

    这个 MCP 服务的核心不是再做一个搜索入口,而是让 AI 在用户指定的 search lenses 里检索,并读取完整网页、PDF、Word、YouTube transcript,而非只吃搜索摘要。README 列出的工具覆盖 web/news/image/academic/patent/SEC/legal/clinical 搜索、citation graph、verify_citation、a…

    Project2026-06-15github.com原文 ↗
    –
  • ScreenMind

    ScreenMind 是本地 screen memory:捕获屏幕变化,用 EasyOCR 提取文本,把截图和 OCR context 交给 Gemma 4 E2B,再用 MiniLM embedding 与 SQLite/FTS5 支撑搜索和聊天。README 给出三档分析模式:Accurate 约 76 秒、Balanced 约 40 秒、Fast 约 12 秒;首次运行下载约 5GB GGU…

    Project2026-06-15github.com原文 ↗
    –
  • Don't trust large context windows

    这篇文章提醒长上下文窗口并不等于可靠记忆。digest 提到检索、注意力和实际使用中的失效模式,核心意思是模型可能拥有很长输入上限,却仍错过关键约束或在长文中漂移。它值得读是因为很多 agent workflow 仍把“塞进上下文”当成设计,而不是把证据选择、摘要和校验做成显式步骤。

    Blog2026-06-15garrit.xyz原文 ↗
    –
  • google-labs-code/design.md

    DESIGN.md 是一个给 coding agent 描述视觉身份和设计系统的格式规范。它把精确 design tokens 放在 YAML front matter,比如颜色、字体、字号、圆角、间距;再用 Markdown prose 解释设计意图和应用方式。README 的例子展示 agent 可以同时读到 `primary: #1A1C1E` 这样的机器值,以及“Architectural…

    Trending2026-06-12github.com原文 ↗
    –
  • activeloopai/hivemind

    Hivemind 自称 “One brain for all your agents”,为 Claude Code、OpenClaw、Codex、Cursor、Hermes、pi agents 提供 auto-learning、cloud-backed shared brain。仓库中有 claude-code、codex、openclaw、pi extension 等目录,说明它不是单客户端记忆…

    Trending2026-06-12github.com原文 ↗
    –
  • SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

    SparDA 把稀疏注意力里两个长期问题放在一起:KV cache 随长度增长撑爆显存,sparse selection 本身仍可能保持 O(T^2) 并在长上下文里成为主成本。它在 Query、Key、Value 之外加入每层 Forecast 投影,预测下一层需要的 KV blocks,让 CPU-to-GPU prefetch 和当前层计算重叠;GQA 实现中每个 group 只用一个 Fo…

    Paper2026-06-12arxiv.org原文 ↗
    –
  • ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

    ReVision 针对 computer-use agent 的轨迹历史:连续 GUI screenshot 变化很小,但每张都被编码成大量视觉 token。方法训练一个 learned patch selector,对比连续截图的 patch representation,删除冗余 visual patches,同时保留多模态模型需要的空间结构。在 OSWorld、WebTailBench、Ag…

    Paper2026-06-12arxiv.org原文 ↗
    –
  • PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

    projectmem 关注 coding agent 的跨会话失忆:每次重读文件、重推决策、重复失败尝试会消耗 5,000-20,000 tokens。系统用 append-only plain-text event log 记录 issues、attempts、fixes、decisions、notes,再确定性投影成 MCP 可读摘要;pre-action gate 会在 agent 准备重复…

    Paper2026-06-12arxiv.org原文 ↗
    –
  • Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

    HORMA 认为长程 agent 的记忆问题不是“压缩还是检索”二选一,而是先组织再导航。它把经验组织成类似文件系统的层级结构,摘要实体链接回原始轨迹;构建阶段反复判断失败来自缺信息还是上下文过载,检索阶段用轻量 RL agent 选取最小但足够的上下文。ALFWorld、LoCoMo、LongMemEval 上,它在受限 context budget 下提高任务表现,长对话任务最多只用 base…

    Paper2026-06-12arxiv.org原文 ↗
    –
  • Mimirs

    Mimirs 是给 AI coding agent 的本地 MCP 记忆服务,使用 Bun 和 SQLite,强调无 API key、无云、无 Docker。它提供 semantic search、auto-generated wiki、cross-session memory、dependency graphs 和 annotations,并支持 Claude Code、Cursor、Winds…

    Project2026-06-12github.com原文 ↗
    –
  • Llmbuffer

    llmbuffer 是 Python conversation history buffer,核心是把消息顺序调整为可稳定命中 provider prompt cache 的结构:static system prompt、long-lived history、dynamic context、recent messages。RAG 结果、时间戳和当前工具调用等易变内容被放在末尾,避免破坏前缀缓存;l…

    Project2026-06-12github.com原文 ↗
    –
  • qdrant/qdrant

    Qdrant 是 Rust 编写的向量相似度搜索引擎和向量数据库,用于存储、搜索和管理带 payload 的 vectors。README 强调扩展过滤能力、生产可用 API、官方 Go/Rust/JavaScript/Python/.NET/Java clients、Docker 本地启动,以及可在进程内运行并同步到服务器的 Qdrant Edge。它仍是 RAG、memory 和 semant…

    Trending2026-06-10github.com原文 ↗
    –
  • Standing Questions

    Standing Questions 把 agent memory 组织成长期待回答的问题,而不是固定答案。这个建模适合偏好、项目状态和开放任务会持续变化的场景:记忆系统围绕问题积累证据,避免把一次性结论当成永久事实。

    Project2026-06-10github.com原文 ↗
    –
  • Lore

    Lore 是 coding agent 的 LLM proxy,负责上下文、记忆和请求路由管理。它的工程位置在 agent 客户端和模型供应商之间,适合把上下文压缩、长期记忆、模型选择和成本策略集中处理,而不是让每个 IDE 插件或 CLI 各自实现一套。

    Project2026-06-10withlore.ai原文 ↗
    –
  • Is Grep All You Need?

    论文比较 grep、向量检索、agent harness 和工具输出呈现方式对 agentic search 的影响。实验一在 LongMemEval 116 个问题上覆盖 Chronos、Claude Code、Codex、Gemini CLI,并比较 inline tool results 与 file-based results;实验二逐步混入无关历史上下文。结果不是简单证明 grep 永远…

    Paper2026-06-10arxiv.org原文 ↗
    –
  • From Rigid to Dynamic

    论文观察到长上下文推理中 attention heads 存在 Rigid Heads 和 Dynamic Heads 两种 entropy 行为,而且具体分布随上下文变化,不能离线固定。EntropyInfer 在 prefill 时按 head/segment 动态分配稀疏预算,decode 时用已生成 token 帮助选择保留哪些 KV cache;在 Llama、Qwen、openPang…

    Paper2026-06-10arxiv.org原文 ↗
    –
  • End-to-End Context Compression at Scale

    论文重新评估 encoder-decoder 式上下文压缩,目标是降低长上下文推理中 KV cache 的内存压力。作者做 architecture search 后,持续预训练 0.6B encoder、4B decoder 的 LCLM 系列,每个 1:4、1:8、1:16 压缩比例都训练超过 350B tokens;结果在质量、压缩速度和峰值内存上改善 Pareto frontier。它也把…

    Paper2026-06-10arxiv.org原文 ↗
    –
  • khoj-ai/khoj

    Khoj 是可自托管 AI second brain,可接入本地或在线 LLM。README 列出从网页和文档回答问题、支持 PDF/Markdown/Notion/Word/org-mode、Browser/Obsidian/Emacs/Desktop/Phone/WhatsApp 多入口、自定义 agents、自动化研究和语义搜索。它是个人知识库、RAG 和 agent 自动化合流的典型项目。

    Trending2026-06-08github.com原文 ↗
    –
  • danielmiessler/Personal_AI_Infrastructure

    Personal_AI_Infrastructure 把个人 AI 系统组织成 Life Operating System。README 定义三层:PAI OS 包含 skills、memory、Algorithm、Telos 和 identity files;Pulse 是 `localhost:31337` 的 dashboard;Digital Assistant 是交互人格。它的看点是把…

    Trending2026-06-08github.com原文 ↗
    –
  • Sem

    Sem 建在 Git 之上,把代码实体作为跨提交可追踪对象。与 LSP 的即时位置和编辑器状态不同,它关注函数、类型、模块等实体在版本历史中的身份延续。这个抽象适合代码搜索、agent 记忆和长期 repo 理解,因为它把“代码在哪里”提升为“实体如何演化”。

    Project2026-06-08ataraxy-labs.github.io原文 ↗
    –
  • Programmers will document for Claude, but not for each other

    文章讨论开发者愿意为 Claude 写清楚上下文,却长期不给同事写同等质量文档的反差。digest 中的观察很尖锐:给 LLM 的 prompt、constraints 和 examples,其实就是团队文档缺口的可见化。它把“AI 需要上下文”反转成组织问题:如果这些信息能提升模型表现,也同样能降低人类协作成本。

    Blog2026-06-08blog.plover.com原文 ↗
    –
  • Omni

    Omni 是 macOS 上本地运行的多模态文件搜索工具,把文本、代码、PDF、图片、音频和视频放进同一向量空间。公开介绍强调 Apple silicon 上离线索引、跨语言语义搜索、QuickLook 缩略图、List/Gallery 视图,以及供 agent 使用的 search endpoint。它的技术点在于把“文件搜索”从文件名和全文索引扩展到跨模态相似度查询。

    Project2026-06-08github.com原文 ↗
    –
  • Context Sculpting

    文章讨论如何塑造 LLM 上下文,而不是把所有材料一股脑塞进去。digest 的重点是选择、排序、压缩和边界设定会显著影响输出,这与 agent 长任务中的 memory、repo map 和 instruction hygiene 直接相关。它提供的不是某个 prompt 魔法词,而是把上下文当作可设计的信息结构。

    Blog2026-06-08perceptiontheory.bearblog.dev原文 ↗
    –
  • TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management

    TokenMizer 把长工作会话转成 typed knowledge graph,再序列化为 compact resume block。schema 有 14 类节点和 7 类边,三层 checkpoint 与 8 层压缩管线让 21 个 sessions 的 resume block 平均只有 78 tokens,约为 baseline 159-170 tokens 的一半。它更强调保留 de…

    Paper2026-06-07arxiv.org原文 ↗
    –
  • Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents

    MRAgent 把记忆访问建模为推理中的主动重构,而非先检索再推理的固定流水线。它使用 Cue-Tag-Content 图表示记忆,LLM 根据中间证据迭代探索和剪枝 retrieval path,避免无约束图扩展。LoCoMo 与 LongMemEval 上相对强 baseline 最高提升 23%,同时降低 token 和运行成本,给 graph memory 提供了比“相似度召回”更强的机制…

    Paper2026-06-07arxiv.org原文 ↗
    –
  • MemPalace

    MemPalace 是本地优先 AI memory 系统,强调原文存储、可插拔后端和 LongMemEval 检索表现。保留原文使得 memory item 可以追溯和重读,可插拔后端则避免把系统押注在单一向量库或检索策略上。它适合拿来对比“摘要式记忆”在长期任务中的信息损失。

    Trending2026-06-07github.com原文 ↗
    –
  • Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs

    论文指出长上下文失败不只取决于 token 长度和 needle 位置,还取决于上下文每单位长度引入多少不同信息。作者在 9B-685B open-weight LLM 上使用约 12k tokens、位置受控但密度递增的 needle 任务;高密度场景中近乎满分的模型会跌到 60% 以下。这个变量对真实系统很关键,因为压缩摘要、密集日志和表格化证据往往正是“短但难”的上下文。

    Paper2026-06-07arxiv.org原文 ↗
    –
  • Claude Git Sessions

    Claude Git Sessions 把 Claude Code 会话存进 Git orphan branch,以便团队共享和恢复。orphan branch 的选择很有意思:会话历史不污染产品代码分支,却仍能使用 Git 的传输、审计和版本机制。这个做法把 agent conversation 从个人机器状态变成可协作资产。

    Project2026-06-07github.com原文 ↗
    –
  • AdaMEM: Test-Time Adaptive Memory for Language Agents

    AdaMEM 让 agent 在测试时维护动态短期策略记忆,而不是只在 episode 开头检索静态经验。它保留 offline raw trajectory 作为长期记忆,并在推理中按需合成 strategy memory;相对静态记忆 baseline,ALFWorld 最高相对提升 13%,WebShop 最高相对提升 11%。STEP-MFT 进一步训练模型从检索经验中生成步骤级策略,给…

    Paper2026-06-07arxiv.org原文 ↗
    –
  • Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents

    这篇把 agent token 超支整理成 63 起经验事件,关注的是预算如何在多轮工具调用、重试和长上下文中被隐性消耗掉。它的工程点在于把缓解示例落到 affine-typed Rust:预算被视为一次性资源来传递和消费,而不是事后统计的账单字段。

    Paper2026-06-05arxiv.org原文 ↗
    –
  • Mnemo

    Mnemo 是本地优先的 AI memory layer,用 Rust、SQLite 和 petgraph 组织持久记忆。作者在 HN 讨论中概括其差异点:单个 Rust binary、zero cloud、知识图 multi-hop traversal 和 scored retrieval;相比普通向量库,它更强调图关系与本地可控。

    Project2026-06-05始 2026-06-04github.com原文 ↗
    –
  • KVarN

    KVarN 是 vLLM 原生 KV-cache 量化后端,用 variance-normalized quantization 缓解 reasoning task 中的误差累积。项目索引称它可带来 3-5 倍 KV cache/context 扩展、吞吐高于 FP16,并在 MATH500、AIME24、HumanEval 等任务上维持 FP16 级准确率;如果实现足够稳,它会直接影响长上下文…

    Project2026-06-05github.com原文 ↗
    –
  • Dreaming: Better memory for a more helpful ChatGPT

    OpenAI 的 Dreaming V3 把 ChatGPT 记忆从显式“请记住”扩展为后台综合历史对话的 memory synthesis。文章给出时间线:saved memories 在 2024 年 4 月上线,Dreaming V0 于 2025 年 4 月加入引用聊天历史,2026 版本强调 freshness、continuity 和 relevance;关键变化是记忆可被用户在 su…

    News2026-06-05openai.com原文 ↗
    –
  • Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation

    CHARM 把 agentic RAG 的错误传播命名为 cascading hallucination:早期检索或解释偏差会在后续步骤被放大,最后变成看似连贯的错误答案。摘要明确给出四类 cascade pattern,并把检测/缓解放在多步 pipeline 内部,这比只评估最终回答更接近 agentic RAG 的真实失败形态。

    Paper2026-06-05arxiv.org原文 ↗
    –
  • supermemoryai/supermemory

    Supermemory 是面向 AI 应用的 memory 和 context layer,README 称其在 LongMemEval、LoCoMo 和 ConvoMem 三个 memory benchmark 上排名第一。它提供 fact extraction、user profiles、hybrid search、connectors 和 multimodal extractors;用户画像…

    Trending2026-06-04始 2026-06-01github.com原文 ↗
    –
  • mksglu/context-mode

    Context Mode 是 MCP server 和 CLI proxy,作为 AI coding assistants 与 context window 之间的 sandboxed execution/indexing layer。公开摘要称它拦截 Bash、WebFetch、Read 等 tool calls,在隔离 subprocess 中运行,把 raw output 索引进 SQLit…

    Trending2026-06-04github.com原文 ↗
    –
  • chopratejas/headroom

    Headroom 压缩 agent 读取的 tool outputs、logs、files 和 RAG chunks,定位为 library、proxy、ASGI middleware、callback 和 MCP server。README 称典型上下文中 70-95% 是 boilerplate,项目目标是在进入 LLM 前压缩掉这些冗余,并支持 LangChain、LangGraph、Agn…

    Trending2026-06-04github.com原文 ↗
    –
  • Moxie Docs

    Moxie Docs 为 GitHub repo 建立 living index,把源代码、测试、文档和历史整理成人可读文档与 agent 可读 MCP context。主页写明每次 merge 后会保持索引更新,提供 source-cited docs、repo conventions、doc gaps 和 verified commands;Starter 计划覆盖 3 个私有 repo、每…

    Project2026-06-04moxiedocs.com原文 ↗
    –
  • KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks

    针对长 horizon reasoning decoding 中 KV-cache 量化误差随时间积累的问题,提出 calibration-free 的 KVarN。方法先做 Hadamard rotation,再对 K/V 矩阵双轴做 variance normalization,以修正 outlying token-scale errors。论文报告在 MATH500、AIME24 和 Hum…

    Paper2026-06-04arxiv.org原文 ↗
    –
  • HelixDB/helix-db

    HelixDB 是 Rust 写的 open-source graph-vector database,主打把 application DB、vector DB、graph DB 和应用层的一部分合并到单一平台。README 摘要说它以 graph + vector data model 为主,也支持 KV、documents 和 relational data;内置 MCP tools 让 ag…

    Trending2026-06-04github.com原文 ↗
    –
  • Extract

    Extract 是 hosted document extraction API,用于把 PDF 等文档抽取为结构化文本、表格、图片和 layout 信息。页面说明它返回 structured spans、bounding boxes 和 font metadata,图片会上传到 object store 并以 image_url 返回;示例 API 支持通过 URL 提交 PDF。它对 RAG…

    Project2026-06-04extract.page原文 ↗
    –
  • DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees

    提出 DeltaMem,用 residual trees 管理 agent 经验,避免把相似 episode 平铺存储导致冗余和检索冲突。系统拆成两棵树:一棵存 goal-conditioned task experience 作为 reusable skills,另一棵存 scene-level environment knowledge;root 表达通用经验,delta node 表达后续差…

    Paper2026-06-04arxiv.org原文 ↗
    –
  • Carto

    Carto 为 AI coding agents 生成代码库 domain map、blast radius 和 MCP 工具形式的结构化上下文。digest 对它的定位很明确:帮助 agent 在改代码前理解模块、影响范围和业务域边界。它不是通用检索器,而是把 codebase map 变成可供 agent 查询的操作对象。对于大型 repo,blast radius 信息能帮助控制改动范围和测…

    Project2026-06-04github.com原文 ↗
    –
  • CLI for crawling documentation sites into Markdown with defuddle

    Docrawl 是把文档站抓取并转换成 Markdown 的 CLI,digest 指向其使用 defuddle 清理网页主体内容。Defuddle 本身负责去掉 sidebar、header 等 clutter,输出更适合阅读和转 Markdown 的 clean HTML。这个组合的工程点在于把 docs crawling 和内容抽取打包为本地工具,而不是只给 agent 原始网页。对 RAG…

    Project2026-06-04github.com原文 ↗
    –
  • dmtrKovalenko/fff

    fff 是 Rust 写的高速文件搜索与内容索引工具包,面向长期运行进程、编辑器和 agent 场景。项目不只是一次性 find/grep,而是提供路径索引、内容索引和可嵌入查询接口,方便 agent 快速定位代码库信息。值得看的是,agent 的代码理解体验很大程度取决于检索延迟和索引新鲜度。

    Trending2026-06-03github.com原文 ↗
    –
  • Open-source general-purpose alternative to Exa Websets

    用搜索引擎递归构建结构化数据集的开源工具。

    Project2026-06-03github.com原文 ↗
    –
  • MetaBrain

    本地文档记忆系统,让 AI agent 可检索项目上下文。

    Project2026-06-03metabrain.eu原文 ↗
    –
  • LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning

    论文研究跨模型家族的长上下文压缩,用于减少 100k+ token 输入的 prefill 成本。

    Paper2026-06-03arxiv.org原文 ↗
    –
  • Leyline: KV Cache Directives for Agentic Inference

    Leyline 针对 agentic inference 提出 KV cache directives,用来处理工具调用失败、输出删除、轨迹分叉、回滚和重试等非线性对话操作。传统 KV cache 默认上下文按前缀追加,但 agent 工作流经常需要废弃 stale observation 或从中间节点另开分支。值得看的是,它把推理系统优化从单条聊天流吞吐扩展到 agent 状态编辑和分支探索。

    Paper2026-06-03arxiv.org原文 ↗
    –
  • Krimto

    把 AI 记忆保存为用户自己 git 仓库中的 Markdown 文件。

    Project2026-06-03github.com原文 ↗
    –
  • How we index images for RAG

    Kapa.ai 介绍其为 RAG 系统索引图片的 pipeline:图片需要被抽取、描述、OCR、和周边文本上下文绑定,而不能只存 URL 或 alt text。文章指出文档中的截图、图表和 UI 状态经常承载回答所需证据。值得看的是,多模态 RAG 的难点在切分、引用和排序如何与文本证据合并。

    Blog2026-06-03kapa.ai原文 ↗
    –
  • AMP: A Vendor-Neutral Wire Format for Agent Memory Operations

    论文提出 agent memory 操作的中立 wire format,覆盖写入、迁移和人工审查等记忆治理接口。

    Paper2026-06-03arxiv.org原文 ↗
    –
  • Stria

    Stria 是面向 LLM agents 的 grammar-free structural codebase indexer 和 MCP server。它不用 tree-sitter 或语言 parser,而用 phrase extraction 生成结构索引;README 称标准仓库约 0.16 秒 build、sub-ms queries,3.1GB Linux kernel 72,000…

    Project2026-06-02始 2026-06-01github.com原文 ↗
    –
  • Learning Agent-Compatible Context Management for Long-Horizon Tasks

    AdaCoM 训练一个外部 LLM 管理冻结 agent 的上下文,用可学习的修改动作在保留约束、进展和证据的同时删除过期内容。论文在 web search 和 deep research benchmarks 上测试,提出 Fidelity-Reliability Trade-off:强 agent 需要更高保真上下文,弱 agent 反而需要更激进压缩。它的工程意义是上下文管理可作为可迁移模块…

    Paper2026-06-02始 2026-06-01arxiv.org原文 ↗
    –
  • 2-command CLI to give AI agents structured data retrieval on PostgreSQL

    Lithium 是运行在 PostgreSQL 上的结构化 agent storage engine,用 ltree 做层级路径索引,并提供 TypeScript API、versioning 和 scoped retrieval。快速路径是 `npx @lithium-ai/kit init` 加 MCP server,让 Claude Code 等 agent 可查询如 `engineerin…

    Project2026-06-02github.com原文 ↗
    –
  • SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs

    SAGE 将 agent memory 写入控制改写为 novelty detection,而不是每次都让 LLM 决定新增、合并或忽略。它用 von Mises-Fisher density estimator 在 memory embeddings 上估计候选事实的新颖度,并用 adaptive threshold 路由 ADD、NOOP 或 LLM merge。LoCoMo 上它相对 Mem…

    Paper2026-06-01arxiv.org原文 ↗
    –

2026 年 5 月10

  • run-llama/liteparse

    LiteParse 是本地 PDF/文档解析工具,使用 Rust core、PDFium、可选 OCR 和 layout reconstruction 输出 spatial text、bounding boxes、JSON/Text、截图。README 还支持 DOCX/XLSX/PPTX/IMG 通过 LibreOffice/ImageMagick 转换后进入同一处理链。值得看的是它为 RAG/…

    Trending2026-05-31始 2026-05-30github.com原文 ↗
    –
  • microsoft/markitdown

    它适合 agent/RAG 前处理:把多格式文件统一成 markdown 这种 LLM 友好文本。优势是格式覆盖和 API 简洁;要注意复杂布局、扫描件和表格仍会依赖具体解析后端。

    Trending2026-05-30github.com原文 ↗
    –
  • firecrawl/firecrawl

    Firecrawl 把“网页上下文”做成 agent 基础设施。它的价值在于把抓取、清洗、结构化和主内容抽取统一;风险在于动态网页覆盖率、反爬限制和内容版权/robots 策略需要持续处理。

    Trending2026-05-30github.com原文 ↗
    –
  • VikingMem: A Memory Base Management System for Stateful LLM-based Applications

    这篇论文把 agent memory 当作数据管理系统,而不是提示词附属品。event/entity 分层的好处是能承载纠错、时间衰减和实体演化;风险是评估主要落在检索有效性,记忆写入错误、隐私边界和跨应用 schema 演进还需要更硬的治理机制。

    Paper2026-05-30arxiv.org原文 ↗
    –
  • Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems

    它把“格式选择”从工程品味拉回到可测量变量:agent 系统中每一步都复制状态、工具结果和结构化参数,冗余 notation 会被循环放大。真正的价值在于提醒评测应同时报告任务质量与 token/latency,而不是只看成功率。

    Paper2026-05-30arxiv.org原文 ↗
    –
  • Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval

    这篇把“把整个记忆库塞回来也能答对”的评测漏洞说得很尖锐。结论偏工程化:结构化 belief state 和硬作用域隔离可能比更大 embedding 更能解决 precision 问题,但单作者、89 例 benchmark 的外部有效性需要复现。

    Paper2026-05-29arxiv.org原文 ↗
    –
  • Periodic RoPE for Infinite Context LLMs

    这不是简单拉长插值,而是把局部位置和全局交互分层处理,因此理论上避免无限外推。摘要仍较短,实际有效性取决于任务是否需要精确全局顺序,而 NoPE 全局层可能牺牲一部分位置可辨性。

    Paper2026-05-29arxiv.org原文 ↗
    –
  • MGRetrieval: Memory-Guided Reflective Retrieval for Long-Term Dialogue Agents

    它把反思式检索从“LLM 自己想检索路径”改为受历史记忆结构约束,降低不稳定性。局限是评估集中在 LoCoMo 和 14B Qwen 系列,跨域记忆结构是否同样可靠还需更多数据。

    Paper2026-05-29arxiv.org原文 ↗
    –
  • Lum1104/Understand-Anything

    它把代码理解产物显式化为图,而不是只让 agent 临时读文件。价值在可视化和可复用上下文;风险是图谱新鲜度、抽取准确性和大型仓库增量维护成本。

    Trending2026-05-29github.com原文 ↗
    –
  • Ktx

    ktx 把数据 agent 的问题从“让模型猜表名写 SQL”改成“先建立可审查语义层和 join/metric 约束”。这种文件化、git review 的设计有利于治理,但准确性仍依赖团队持续批准上下文变更。

    Project2026-05-29github.com原文 ↗
    –