2026 年 7 月40
-
Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles
作者把人物、组织和事件的关系写入持续更新的 narrative profile,让模型通过检索少量档案完成跨实体推理,而不必显式暴露或查询完整知识图。配套 MemHop 基准覆盖一至五跳问题,用来区分单实体回忆、关系拼接和长链路检索能力。结果所指向的核心取舍是:叙事压缩提高可读性与检索效率,但档案生成阶段一旦丢失关系,后续多跳推理无法恢复。
原文 ↗– -
Marrow
Marrow 为 Claude Code 会话建立本地语义索引,让用户按概念而非文件名搜索过去的决策、错误和实现讨论。数据保留在本机,并通过向量检索与会话浏览界面重新定位上下文。它把一次性聊天日志转化为工程记忆,但索引质量仍受会话内容是否完整、是否含敏感信息影响。
原文 ↗– -
Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory
研究在固定检索器和推理流程下比较逐字对话块与摘要、事实表等结构化记忆工件,发现保留原始措辞往往优于有损抽取。关键原因不是结构化表示毫无用处,而是抽取阶段会提前抹掉语气、条件和跨轮依赖,检索时再也无法恢复。结论把长期记忆设计的优先级重新排为“先保证信息保真,再优化组织形式”。
原文 ↗– -
Supra Cognitive Modes: A Routed Architecture for Agent Memory
论文提出按问题性质选择记忆模式:事实问题走精确检索,关系问题走图式联结,长历史问题走分层综合。路由器避免每次都把所有记忆塞进上下文,并让不同模式使用各自的压缩与证据组织方式;这种模块化设计的看点在于承认“记住一个事实”和“解释跨会话演化”并非同一种检索任务。
原文 ↗– -
akitaonrails/ai-memory
ai-memory 为不同厂商的 coding agent 保存项目目标、已完成步骤、关键决定和待办,使任务可跨客户端交接。项目关注的是结构化工作状态,而不是无差别存储全部对话。这样可以降低更换模型或终端工具时的上下文损失,同时避免把大量历史原样塞回窗口。
原文 ↗– -
AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents
AgentBrew 让强教师模型在交互中产出可复用知识,再把这些经验沉淀到弱代理的外部记忆,而不是更新参数。论文在 5 类环境、11 个任务上测试,摘要报告弱模型平均提升 14.8 个百分点,并能持续吸收后续经验。方法把昂贵教师调用转化为可积累资产,但知识条目的筛选与过期管理会决定长期收益。
原文 ↗– -
Accurate and Efficient Long-Term Memory for LLM Agents
论文提出 MOSAIC,把长期记忆组织为带时间信息和实体关系的结构化表示,并用轻量分类器替代大量在线 LLM 判断。摘要报告,MOSAIC 在 LoCoMo 上达到 75.5%,同时把记忆构建时间降至约 1.5 分钟,相比强基线快约 100 倍。它展示了记忆系统不必在准确率和工程成本之间二选一,但效果仍依赖关系抽取与时间归一化的质量。
原文 ↗– -
CodeAlmanac
CodeAlmanac 从代理会话中提炼代码之外的知识:为何采用某个结构、哪些不变量不能破坏、跨文件流程怎样串联、过去踩过什么坑。它把 wiki 保存为仓库内 Markdown、本地索引,并要求知识更新走 Git review,使“代理记忆”成为可审查资产而非黑盒数据库;当前支持范围是 macOS、Codex/Claude Code 与 Python 3.12+。这个设计切中了长期代理工作的上下文…
原文 ↗– -
CogniKernel- Local Memory for AI Coding Assistants
CogniKernel 为 Claude Code 与 Codex 提供项目级本地记忆,监听会话 hook,抽取决策、硬/软约束和废弃方案,再在后续 session 注入压缩 context block。它不是 vector database wrapper,而是 event-sourced typed memory log,检索采用 lexical-primary、FTS5 BM25、optio…
原文 ↗– -
Amnesia - audit Claude Code's memory for contradictions
Amnesia 面向 Claude Code 长期 memory store 的腐化问题:过期事实、跨项目泄漏、重复规则和互相矛盾的记忆。它会扫描 `~/.claude/projects//memory/`,把 memory 显示成项目着色的 force graph,并调用本机 `claude` CLI 标记 contradiction、stale fact、duplicate 和 misfile…
原文 ↗– -
Knowledge graph skill for Claude/Kimi Code
SysEdge 是给 Claude Code / Kimi Code CLI 团队用的本体知识图谱,用节点记录需求、用例、功能、测试、缺陷和架构标准。页面把它的收益放在“显式项目记忆”上:能查询哪些需求没有测试、哪些缺陷关联了 PII、哪些 ADR 没有落实到代码。Formbricks 案例中,orientation token 从 14,512 input+output 加 1,797,494…
原文 ↗– -
Graphify-Labs/graphify
Graphify 是 AI coding assistant skill,目标是把代码、schema、脚本、文档和媒体转成可查询知识图谱。它不只做文本搜索,而是把项目资产抽取为节点与关系,让 agent 能查询代码结构、数据模型和文档之间的联系。这个方向的价值在大型代码库中更明显:agent 需要的不是更多上下文文本,而是能回答“这个功能、表、脚本和测试怎么关联”的结构化索引。Graphify 的…
原文 ↗– -
Track, Rank, Crack
论文提出 epistemic working memory,通过显式记录已确认、待验证和待探索信息来改善多跳推理。track、rank、crack 三个动作分别负责维护状态、排序缺口和推进求解。它的价值在于把 agent 的中间认知状态外显出来,减少多跳任务中“看似在推理、实际在混合猜测和遗漏”的不可观察性。
原文 ↗– -
TencentCloud/TencentDB-Agent-Memory
TencentDB-Agent-Memory 是本地运行的 agent 长期记忆系统,使用四层渐进式 memory pipeline。它围绕记忆写入、整理、检索和保存组织 agent 上下文,使交互经验可以被长期查询。项目值得观察的是企业数据库团队如何把记忆系统产品化,而不是只做向量库 demo。
原文 ↗– -
Open-source memory for coding agents, synced over SSH
deja-vu 为 coding agents 提供本地项目记忆,并通过 SSH 在机器之间同步。项目的做法是把上下文、决策和项目背景保存为开发者可检查的本地资料,而不是绑定在某个云端助手会话里。它对多设备开发尤其直接:agent 记忆可以跟着项目移动,同时仍保持普通文件的可审阅性。
原文 ↗– -
Guardian Angels: LLM Personalization for Productivity and Security
Gwern 讨论个性化 LLM 助手如何同时承担生产力增强和安全防护角色。文章涉及长期记忆、用户画像、提醒、过滤和风险拦截等能力,并把它们放进“guardian angel”式个人代理设想。它的核心张力是:助手越理解用户,越能提前行动,也越需要边界、审计和可撤销控制。
原文 ↗– -
Critic Experience Bank
论文提出 Critic Experience Bank,用自演化经验库支持 step-level confidence estimation。它把 critic 在历史步骤中的判断沉淀下来,供后续 agent 动作估计可靠性,而不是只在终局看 success/fail。这个方向把 agent 调试粒度拉到单步行动,适合分析复杂任务中“哪一步开始不可信”。
原文 ↗– -
Alluvia
Alluvia 做的是本地 AI 会话历史挖掘,目标来源包括 Claude Code、Cursor 和 ChatGPT。项目把分散在不同工具里的提示、代码讨论和模型回复索引到本机,便于跨工具找回旧上下文。它的现实意义在于,AI coding 的知识资产正在沉淀在聊天记录里,而这些记录通常比普通代码搜索更敏感。
原文 ↗– -
volcengine/OpenViking
OpenViking 是面向 AI agents 的 context database,整合 memory、knowledge RAG 和 skills。它试图把长期记忆、知识检索和可调用能力放到同一上下文层中,解决 agent 多轮任务中的资料找回问题。这个方向的成败会取决于检索精度、记忆更新策略和权限隔离。
原文 ↗– -
Kote
Kote 从 AI chat 和 Git 历史中自动捕获工程上下文,供后续检索和复用。它试图解决 coding-agent 多轮工作中的上下文断裂:一次会话里解释过的架构、约束和改动原因,下一次不应全部重来。项目的看点在于把对话和版本历史都纳入工程记忆,而不是只索引当前代码文件。
原文 ↗– -
Capn-hook
Capn-hook 是面向 coding agent 的 hook 工具,用来记录和复用已经探索过的代码上下文。它瞄准“同一个项目里反复 grep、反复读同一批文件、反复重建调用链”的低效模式。通过把探索痕迹变成可再注入上下文,项目让 agent 会话之间具备更强连续性。
原文 ↗– -
Remember When It Matters
论文提出 proactive memory agent,用于长程任务中在恰当时刻重新浮现历史状态。它维护任务事实、过往尝试、诊断和未完成子目标,并在上下文膨胀后主动判断哪些记忆应该回到当前推理链。这个方向把记忆系统从“向量库召回片段”推进到“围绕任务进展做时机判断”。
原文 ↗– -
Trace - open-source, self-organizing memory for LLM agents
TRACE 是一个 Python agent memory library,把对话历史组织成 hierarchical B+Tree 和 vector retrieval 结合的长期记忆结构。仓库分成 `trace_memory/` 引擎与 `nexus_terminal/` demo chatbot;它用 TopicNodes 与 MessageNodes 保存分支语义,再用 cosine se…
原文 ↗– -
StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems
StateFuse 解决的是多 agent 分支、重试、replica 写入中观察相互冲突的问题,选择保留冲突而不是用 overwrite 规则提前压平。它基于标准 OpSet/CRDT merge,定义 agent-facing semantics:immutable history、explicit conflict objects、claim_id/claim_ref correction…
原文 ↗– -
Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents
这篇论文把 agent 的 memory 从“每轮最多查一次的外部工具”移动到 observe-reason-act 循环内部,让每一步都能读写记忆。关键实验把延迟作为变量:in-process store 约 100us,云端 110ms round trip 下 redundant actions 从 0/12 升到 7.2/12;在 bounded window 中,in-loop memo…
原文 ↗– -
PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents
PLACEMEM 将 lifelong agent 的记忆层放到计算预算下设计,讨论哪些信息应持久化、何时修正、运行时是否值得检索。它把 memory plane 视作有放置策略和成本模型的系统组件,而不是无条件增长的外部存储。这个视角对长期运行 agent 很关键,因为检索本身也会消耗延迟、token 和推理注意力。
原文 ↗– -
Object-Centric Environment Modeling for Agentic Tasks
这篇提出用对象为中心的环境模型记录 agent 交互经验,把实体、属性、关系和状态变化从原始日志里抽出来。相比把历史都塞进 transcript 或向量库,对象视图更适合做一致性检查、状态复用和后续规划。论文的意义在于把 agent memory 往可维护状态模型推进,而不只是“存更多上下文”。
原文 ↗– -
MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents
MRMS 提出多分辨率记忆基底,把个人上下文、外部证据和可修订记忆分层处理。它避免把所有记忆都压缩成同一类摘要或 embedding:证据需要可追溯,状态需要可更新,长期偏好又需要稳定保留。论文的可读点在于它直接处理“长期 agent 会记错、会过期、会混淆证据和结论”这个现实问题。
原文 ↗– -
Claude Code Live Memory
Claude Code Live Memory 是 Claude Code plugin / MCP server,用低成本模型持续维护代码库记忆。它在编码会话之外提炼项目结构、约定和近期变化,供后续 Claude Code 调用。项目的看点是把代码库理解从“每次重新扫描”改成“持续增量维护”。
原文 ↗– -
Two-tier-memory
Two-tier-memory 面向 AI coding agents 提供可查询长期记忆,把短期工作上下文和长期项目知识分层管理。它试图解决长项目中 agent 遗忘历史决策、约束和事实的问题,让模型在需要时检索稳定记忆,而不是把所有内容塞进上下文窗口。这个设计对大型代码库尤其实际,因为项目记忆的可维护性会直接影响 agent 后续修改是否反复踩同一类坑。
原文 ↗– -
Aletheia
Aletheia 面向 Claude Code 和 Codex,提出 uncertainty-loop agent:系统维护 belief state、问题、假设和证据,当不确定性超过阈值时继续搜索和更新,低于阈值再输出。README 明确反对把复杂问题机械拆成 task list,而是让“是否足够确定”成为控制流的一部分。它有技术新意的地方在于把假设、证据和置信度作为 agent 工作记忆,而不…
原文 ↗– -
Memorizing session transcripts isn't useful
文章批评 agent 记忆系统直接保存完整会话 transcript 的做法,认为原始对话很快会变成噪声密集、检索困难的历史堆。它主张提炼决策、偏好、约束和长期事实,并记录哪些信息会过期。这个观点切中 agent memory 的核心:记忆不是存储越多越好,而是要把可复用信息从会话流水里蒸馏出来。
原文 ↗– -
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory
A-TMA 讨论长期 agent 记忆里的 state-aware failure,尤其是 ghost memory:旧事实、当前事实和状态转移事实在检索时混到一起。论文的关键拆分是把记忆错误和状态变化绑定,要求记忆系统理解事实何时失效、何时被替代。它切中长期 agent 的实际问题:向量相似度能找回相关片段,却不保证找回的是当前世界状态下仍然成立的片段。
原文 ↗– -
ctx - Search the coding agent history already on your machine
ctx 解决 coding agents 没有长期记忆的问题,但不引入 hosted memory service 或图数据库。它把本机已有的 agent transcripts 和 logs 索引到 SQLite,用 ranked text match 找回早前讨论、决策、失败尝试、命令、测试结果和 patch 线索。这个项目的实用性在于它承认“历史已经在你的机器上”,然后给当前 agent 一…
原文 ↗– -
From Signals to Structure: How Memory Architecture Drives Language Emergence in LLM Agents
作者用 Lewis signaling game 研究两个 LLM agents 如何仅凭交互历史形成共享编码,并比较五种记忆架构与不同信道容量。persistent private notebook 在 capacity=25 时达到 0.867±0.023 的协调率,同时避开 stateless agents 在高容量词汇变大后的 collapse。这个结果把“上下文窗口够不够大”的问题改写为…
原文 ↗– -
Context.md - A proposed standard for AI project context
context-md 提议用固定路径的 `context.md` 作为 Repository Context Layer,让 agent 在 planning 前读取项目事实,并把学到的约束以 Git diff 形式写回。核心原则包括 human-readable、reviewable、branch-aware、tool-independent 和 deterministic discovery;…
原文 ↗– -
world-model-mcp
world-model-mcp 把 coding agent 的项目经验组织成 temporal knowledge graph,在 edit boundary 前验证 API/function reference,并在 compaction 后重新注入相关约束。v0.10.0 文档称有 27 个 MCP tools、22 个 CLI subcommands 和 417 个测试,并把 adapte…
原文 ↗– -
The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory
论文提出 Janus,给已有长期记忆 updater 外面套一层选择性接受控制器,避免局部任务生成的 memory update 覆盖有用经验或过度贴合近期样本。它用 Memory Momentum Trigger 先找可疑的更新轨迹,再用 coverage、boundary 和 fresh tasks 组成的紧凑混合评测集比较新旧记忆,不需要重放完整历史。跨 6 个数据集、2 个 backbon…
原文 ↗– -
Mimir
Mimir repo 已重定向为 Perseus Vault,一个单 Rust binary 的本地优先 memory MCP server。它用 SQLite、FTS5、dense/hybrid search、AES-256-GCM 和约 46 个 MCP tools 提供 durable memory;README 的 stress test 给出 100K entity insert 1.0…
原文 ↗– -
GOAT2-General-Orchestrated-Agent-Topology
GOAT2 是带 proactive episodic memory 的 AI orchestrator 项目。digest 信息没有展开 README,但从定位看,它不是单个工具调用 server,而是尝试把 agent topology、任务编排和主动 episodic memory 结合。这个方向的技术问题在于记忆何时主动注入、如何避免过期经验误导,以及 orchestrator 如何在多…
原文 ↗–
2026 年 6 月35
-
topoteretes/cognee
Cognee 是开源 AI memory platform,用自托管知识图谱引擎给 agents 提供跨 session 长期记忆。它和 Agent Memory Bench 放在同一天看很有意思:一个提供记忆平台,一个测试记忆失败模式。Cognee 的技术押注是显式图结构能比纯向量检索更好表达实体、关系和历史事实。真正落地时,关键将是更新、冲突和遗忘策略,而不只是把内容写进 graph。
原文 ↗– -
OpenKnowledge - open source AI-first alternative to Obsidian/Notion
OpenKnowledge 是 local-first WYSIWYG Markdown editor 和 LLM Wiki,目标是把个人笔记、spec、知识库和 agent second brain 放在同一个工作面里。README 明确支持 Claude、Codex、Cursor 协作编辑,也能通过 MCP/CLI 给 OpenCode 等 harness 使用;它还用 git/GitHub…
原文 ↗– -
Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents
论文区分 memory access 和 memory depth:检索能找回事实,但不保证经历在上下文卸载后继续影响行为。作者用 loop-drift protocol 测试长期干扰下的目标保持,EVAF 通过 surprise 与 valence gated LoRA 写入实现选择性巩固;在 GPT-2/TinyLlama 上,retrieval 短事实准确率 0.956-0.973,EVAF…
原文 ↗– -
BetterDB, MIT Valkey-native context layer for AI agents
BetterDB packages 是一组 Valkey/Redis-native 的 agent context 组件,包括 semantic cache、agent cache、agent memory、retrieval、MCP observability server 和 monitor CLI。README 中 semantic-cache 使用 Valkey vector search…
原文 ↗– -
vectorize-io/hindsight
Hindsight 是 agent memory 系统,目标是让 agents learn over time,而不只是回忆对话历史。README 明确对比普通 memory 与 RAG,强调它关注从经验中学习,并提供 documentation、paper、cookbook 和 cloud 入口。它的定位代表一条趋势:agent memory 不再只是检索过去内容,而要把经验转化成未来行为改进。
原文 ↗– -
EvoEmbedding
EvoEmbedding 针对静态 embedding 把文本片段孤立编码、忽略上下文和时间顺序的问题,提出可演化表示。它面向长上下文检索和 agentic memory,让表示随上下文、序列位置和状态变化。这个方向反映出 memory 系统的检索单元正在从静态 chunk 走向带历史状态的动态对象。
原文 ↗– -
Recall
Recall 是 Claude Code 的本地项目记忆插件,把 session activity 追加进 `.recall/history.md`,再生成可恢复的 `.recall/context.md`。README 明确没有 API key、外部模型或网络调用,摘要由本地 TF-IDF + TextRank 完成;恢复上下文约 1-2K token,并提供 `/recall:save`、`/…
原文 ↗– -
PMB
PMB 给 Claude Code、Cursor、Codex 等 MCP-aware agents 提供本地长期记忆,把决策、教训、项目事实和文档放在一个 SQLite 文件里。README 描述了实体图 dashboard、时间线、PDF 索引、50+ 语言 embedding,以及 `prepare(message)` 在 4-16ms 返回 project_context、lessons、r…
原文 ↗– -
MemSlides
MemSlides 面向个性化幻灯片生成,把长期记忆拆成 user profile memory 与 tool memory,并用 working memory 保留当前会话偏好和约束。系统配合 scoped slide-local revision,在局部修改时作用于最小受影响区域,而不是反复重生成整套 deck;实验显示 profile memory 提升 persona alignment,…
原文 ↗– -
GeneralVLA-2
GeneralVLA-2 针对机器人规划中的 3D 证据和可复用操作经验,提出 GeoFuse-MV3D 重建分支和 governed KnowledgeBank。GeoFuse-MV3D 在 GSO-30 上让 CD 和 LPIPS 分别下降 2.20% 与 2.02%,PSNR 和 SSIM 分别上升 2.36% 与 1.03%;KnowledgeBank 在 Terminal-Bench S…
原文 ↗– -
FERNme
FERNme 不是把每轮对话都丢给 LLM 总结,而是用 fuzzy graph 做低成本长期记忆。README 里核心机制很具体:每个用户是 per-site graph 里的稀疏加权节点,edge 通过 Hebbian co-occurrence 规则更新,检索走 spreading activation,给 prompt 的 card 只保存相对 population prior 的偏差。这…
原文 ↗– -
Multi-Agent Transactive Memory
Multi-Agent Transactive Memory 借用了组织记忆里的 transactive memory 思路:群体不需要每个成员都知道全部知识,但需要知道谁知道什么、知识放在哪里。摘要把它类比为面向 agent-generated artifacts 的搜索引擎,用 retrieval systems 组织异构代理群体产生的知识以便复用。它把多代理协作的瓶颈从消息传递推进到长期知识…
原文 ↗– -
Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents
这篇把长周期语言代理的记忆保留问题写成一个带约束的资源分配目标:代理会积累 observations、reasoning traces 和 retrieved facts,最终超过上下文窗口。摘要明确指出现有系统多把保留决策当作局部问题,没有建模 observability constraints 下的长期后果。它把“记住什么”从启发式摘要策略推进到可约束优化,适合审视长期代理的记忆污染、隐私暴露…
原文 ↗– -
Current World Models Lack a Persistent State Core
这篇指出当前 world models 缺少 persistent state core,也就是无法稳定维护跨时间的内部状态。摘要把要求说得很清楚:物理世界建模不只是按需渲染可信画面,还需要一个与观测解耦、持续演化的 internal world state,让对象和事件在镜头外仍然延续。这个批评与长周期代理、机器人和仿真环境都有关。
原文 ↗– -
What Must Generalist Agents Remember?
这篇论文给“通用代理需要记忆什么”一个形式化回答:当两个域共享观测瓶颈却要求不同最优动作时,近似最优策略必须保留能区分域的记忆分布。进一步地,如果记忆足以估计相关目标的价值,它也能近似重建局部转移动态。它的贡献不是新 benchmark,而是把 memory 从经验组件提升为泛化、规划和模型重建的必要条件。
原文 ↗– -
Myco Brain - source-traceable memory for AI agents on your own Postgres
Myco Brain 把 agent memory 放在用户自己的 Postgres 上,通过 MCP 给 Claude、Cursor、Windsurf、Continue、Zed 等客户端共享。README 强调每个事实都可用 `brain_why` 追溯来源,独立来源提高置信度,矛盾事实会 supersede 且保留审计记录。它还给出 LongMemEval 复现数字:73.6% QA、reca…
原文 ↗– -
ScreenMind
ScreenMind 是本地 screen memory:捕获屏幕变化,用 EasyOCR 提取文本,把截图和 OCR context 交给 Gemma 4 E2B,再用 MiniLM embedding 与 SQLite/FTS5 支撑搜索和聊天。README 给出三档分析模式:Accurate 约 76 秒、Balanced 约 40 秒、Fast 约 12 秒;首次运行下载约 5GB GGU…
原文 ↗– -
activeloopai/hivemind
Hivemind 自称 “One brain for all your agents”,为 Claude Code、OpenClaw、Codex、Cursor、Hermes、pi agents 提供 auto-learning、cloud-backed shared brain。仓库中有 claude-code、codex、openclaw、pi extension 等目录,说明它不是单客户端记忆…
原文 ↗– -
PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents
projectmem 关注 coding agent 的跨会话失忆:每次重读文件、重推决策、重复失败尝试会消耗 5,000-20,000 tokens。系统用 append-only plain-text event log 记录 issues、attempts、fixes、decisions、notes,再确定性投影成 MCP 可读摘要;pre-action gate 会在 agent 准备重复…
原文 ↗– -
Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents
HORMA 认为长程 agent 的记忆问题不是“压缩还是检索”二选一,而是先组织再导航。它把经验组织成类似文件系统的层级结构,摘要实体链接回原始轨迹;构建阶段反复判断失败来自缺信息还是上下文过载,检索阶段用轻量 RL agent 选取最小但足够的上下文。ALFWorld、LoCoMo、LongMemEval 上,它在受限 context budget 下提高任务表现,长对话任务最多只用 base…
原文 ↗– -
Mimirs
Mimirs 是给 AI coding agent 的本地 MCP 记忆服务,使用 Bun 和 SQLite,强调无 API key、无云、无 Docker。它提供 semantic search、auto-generated wiki、cross-session memory、dependency graphs 和 annotations,并支持 Claude Code、Cursor、Winds…
原文 ↗– -
Standing Questions
Standing Questions 把 agent memory 组织成长期待回答的问题,而不是固定答案。这个建模适合偏好、项目状态和开放任务会持续变化的场景:记忆系统围绕问题积累证据,避免把一次性结论当成永久事实。
原文 ↗– -
danielmiessler/Personal_AI_Infrastructure
Personal_AI_Infrastructure 把个人 AI 系统组织成 Life Operating System。README 定义三层:PAI OS 包含 skills、memory、Algorithm、Telos 和 identity files;Pulse 是 `localhost:31337` 的 dashboard;Digital Assistant 是交互人格。它的看点是把…
原文 ↗– -
Sem
Sem 建在 Git 之上,把代码实体作为跨提交可追踪对象。与 LSP 的即时位置和编辑器状态不同,它关注函数、类型、模块等实体在版本历史中的身份延续。这个抽象适合代码搜索、agent 记忆和长期 repo 理解,因为它把“代码在哪里”提升为“实体如何演化”。
原文 ↗– -
Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
MRAgent 把记忆访问建模为推理中的主动重构,而非先检索再推理的固定流水线。它使用 Cue-Tag-Content 图表示记忆,LLM 根据中间证据迭代探索和剪枝 retrieval path,避免无约束图扩展。LoCoMo 与 LongMemEval 上相对强 baseline 最高提升 23%,同时降低 token 和运行成本,给 graph memory 提供了比“相似度召回”更强的机制…
原文 ↗– -
MemPalace
MemPalace 是本地优先 AI memory 系统,强调原文存储、可插拔后端和 LongMemEval 检索表现。保留原文使得 memory item 可以追溯和重读,可插拔后端则避免把系统押注在单一向量库或检索策略上。它适合拿来对比“摘要式记忆”在长期任务中的信息损失。
原文 ↗– -
AdaMEM: Test-Time Adaptive Memory for Language Agents
AdaMEM 让 agent 在测试时维护动态短期策略记忆,而不是只在 episode 开头检索静态经验。它保留 offline raw trajectory 作为长期记忆,并在推理中按需合成 strategy memory;相对静态记忆 baseline,ALFWorld 最高相对提升 13%,WebShop 最高相对提升 11%。STEP-MFT 进一步训练模型从检索经验中生成步骤级策略,给…
原文 ↗– -
Mnemo
Mnemo 是本地优先的 AI memory layer,用 Rust、SQLite 和 petgraph 组织持久记忆。作者在 HN 讨论中概括其差异点:单个 Rust binary、zero cloud、知识图 multi-hop traversal 和 scored retrieval;相比普通向量库,它更强调图关系与本地可控。
原文 ↗– -
Dreaming: Better memory for a more helpful ChatGPT
OpenAI 的 Dreaming V3 把 ChatGPT 记忆从显式“请记住”扩展为后台综合历史对话的 memory synthesis。文章给出时间线:saved memories 在 2024 年 4 月上线,Dreaming V0 于 2025 年 4 月加入引用聊天历史,2026 版本强调 freshness、continuity 和 relevance;关键变化是记忆可被用户在 su…
原文 ↗– -
supermemoryai/supermemory
Supermemory 是面向 AI 应用的 memory 和 context layer,README 称其在 LongMemEval、LoCoMo 和 ConvoMem 三个 memory benchmark 上排名第一。它提供 fact extraction、user profiles、hybrid search、connectors 和 multimodal extractors;用户画像…
原文 ↗– -
DELTAMEM: Incremental Experience Memory for LLM Agents via Residual Trees
提出 DeltaMem,用 residual trees 管理 agent 经验,避免把相似 episode 平铺存储导致冗余和检索冲突。系统拆成两棵树:一棵存 goal-conditioned task experience 作为 reusable skills,另一棵存 scene-level environment knowledge;root 表达通用经验,delta node 表达后续差…
原文 ↗– -
MetaBrain
本地文档记忆系统,让 AI agent 可检索项目上下文。
原文 ↗– -
Krimto
把 AI 记忆保存为用户自己 git 仓库中的 Markdown 文件。
原文 ↗– -
AMP: A Vendor-Neutral Wire Format for Agent Memory Operations
论文提出 agent memory 操作的中立 wire format,覆盖写入、迁移和人工审查等记忆治理接口。
原文 ↗– -
SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs
SAGE 将 agent memory 写入控制改写为 novelty detection,而不是每次都让 LLM 决定新增、合并或忽略。它用 von Mises-Fisher density estimator 在 memory embeddings 上估计候选事实的新颖度,并用 adaptive threshold 路由 ADD、NOOP 或 LLM merge。LoCoMo 上它相对 Mem…
原文 ↗–
2026 年 5 月3
-
VikingMem: A Memory Base Management System for Stateful LLM-based Applications
这篇论文把 agent memory 当作数据管理系统,而不是提示词附属品。event/entity 分层的好处是能承载纠错、时间衰减和实体演化;风险是评估主要落在检索有效性,记忆写入错误、隐私边界和跨应用 schema 演进还需要更硬的治理机制。
原文 ↗– -
Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval
这篇把“把整个记忆库塞回来也能答对”的评测漏洞说得很尖锐。结论偏工程化:结构化 belief state 和硬作用域隔离可能比更大 embedding 更能解决 precision 问题,但单作者、89 例 benchmark 的外部有效性需要复现。
原文 ↗– -
MGRetrieval: Memory-Guided Reflective Retrieval for Long-Term Dialogue Agents
它把反思式检索从“LLM 自己想检索路径”改为受历史记忆结构约束,降低不稳定性。局限是评估集中在 LoCoMo 和 14B Qwen 系列,跨域记忆结构是否同样可靠还需更多数据。
原文 ↗–