Agent Memory 全景盘点:从 ChatGPT 的「做梦」到 Claude 的文件系统,2026 年主流智能体记忆架构深度拆解

发布日期:2026-08-14 | 阅读时长:约 35 分钟 | 版本:v1.0(信息截至 2026 年 8 月中旬)
标签#AgentMemory #ContextEngineering #LLM #AI架构 #RAG #知识图谱

一句话摘要:本文以「编码—存储—检索—更新—遗忘」五段式生命周期为骨架,系统盘点 OpenAI、Anthropic、Google、Manus 四大产品阵营,以及 Letta(MemGPT)、Mem0、Zep/Graphiti、LangMem、MemOS 五大开源基础设施的 Agent Memory 设计,并给出评测基准、安全攻击面与工程选型决策树。


目录

  1. 为什么 Memory 是 2026 年 Agent 的必争之地
  2. 理论基础:认知科学映射与统一分类法
  3. 设计空间:五个可正交拆解的维度
  4. 产品阵营:闭源巨头们的记忆设计
  5. 基础设施阵营:五大开源记忆框架解剖
  6. 上下文工程阵营:Manus 的「反记忆」哲学
  7. 横向对比总表
  8. 评测基准:LOCOMO 之后,记忆有了度量衡
  9. 安全与治理:记忆层是最危险的攻击面
  10. 工程选型决策树与落地清单
  11. 趋势预判:2026 下半年到 2027
  12. FAQ 与参考资料

一、为什么 Memory 是 2026 年 Agent 的必争之地

大模型的原生设计是**无状态(stateless)**的:每一次 API 调用都是一次从零开始的计算。上下文窗口(32K~2M tokens 不等)本质上只是「工作记忆」,一旦跨会话、跨天、跨任务,Agent 就会集体「失忆」:

  • 调试了一下午修好的 Bug,第二天再遇到同类问题,Agent 毫无印象;
  • 长周期任务跑到第 10 步,Agent 忘了前 9 步做了什么;
  • 多 Agent 协作时,每个 Agent 都是一座「记忆孤岛」。

行业在 2026 年达成了三个共识:

  1. 推理能力在被快速攻克,记忆才是真正的瓶颈。 Sam Altman 在 2026 年初的访谈中直言:当前 AI 的记忆还处在「GPT-2 时代」,强个性化记忆将成为核心护城河。
  2. Agent 的竞争从「单轮智能」转向「跨 session 累积、跨任务复用、攻防对抗」,而这三件事全都发生在记忆层。
  3. 记忆从「功能特性」升级为「基础设施」。2025 年底以来,Mem0、Letta、Zep、Cognee、MemOS、MemoryScope、Memobase、SuperMemory、TiMem、GBrain……「Mem ×」框架批量涌现,记忆已经成为一个独立赛道。

一句话总结:2024 年卷上下文窗口,2025 年卷工具调用,2026 年卷记忆。


二、理论基础:认知科学映射与统一分类法

2.1 从人脑到 Agent:记忆类型的映射

目前工业界普遍采用认知科学的记忆分层模型来组织 Agent Memory:

人类记忆类型 Agent 中的对应物 典型实现
工作记忆(Working Memory) 当前上下文窗口 Prompt 中的消息历史、state
语义记忆(Semantic Memory) 「我知道什么」:事实与偏好 用户画像、KV 事实库、知识图谱
情景记忆(Episodic Memory) 「我经历过什么」:具体事件与经验 历史会话、任务轨迹、失败案例
程序性记忆(Procedural Memory) 「我会做什么」:技能与规则 系统提示词迭代、Rules 文件、Skills

LangChain/LangMem 是这套映射最忠实的工程化实践者;而 2026 年 6 月前后,Anthropic、OpenAI、Google DeepMind 等团队的多层记忆模型,也基本收敛到了「短期 / 长期 / 语义 / 情景 / 程序性」的五层结构。

2.2 学术界的统一分类法:Forms / Functions / Dynamics

2026 年影响力最大的综述论文 《Memory in the Age of AI Agents: A Survey》 提出了一个三维分类法,本文的盘点框架即以此为基础:

  • 形式(Forms):记忆以何种技术形态存在——原始文本、摘要、向量、知识图谱、文件、模型参数、激活/KV 缓存;
  • 功能(Functions):记忆扮演什么角色——事实检索、经验复用、人格一致性、技能沉淀;
  • 动态(Dynamics):记忆如何演化——编码(Encoding)、存储(Storage)、检索(Retrieval)、巩固(Consolidation)、遗忘(Forgetting)。

2.3 记忆的五段式生命周期

无论哪家实现,都可以抽象为同一个闭环:

        ┌─────────────────────────────────────────────────┐
        │                                                 ▼
  对话/轨迹 ──▶ [编码] ──▶ [存储] ──▶ [检索] ──▶ [注入上下文]
                抽取        向量/图/文件     召回          │
                摘要        KV/参数        排序          ▼
                实体抽取    分层归档       渐进披露     [推理生成]
                                                        │
                    ◀────── [巩固/遗忘] ◀───────────────┘
                         冲突消解、时序失效、压缩、删除

后续所有产品的差异,本质上都是在这五段中做了不同的取舍。


三、设计空间:五个可正交拆解的维度

在盘点具体产品前,先给出本文的分析坐标系。任何一个 Agent Memory 方案,都可以用以下五个维度定位:

维度一:记忆的表示形式

  • 原始文本块(RAG 式)→ 自然语言摘要 → 结构化三元组/知识图谱 → 文件系统(Markdown/目录树)→ 参数化(写进权重/激活)。
  • 规律:表示越结构化,检索越精准、写入成本越高;表示越接近自然语言,泛化越好、冲突越难管理。

维度二:写入时机——同步热路径 vs 异步冷路径

  • 同步(Hot Path):对话进行中实时抽取写入,延迟高但即时可用;
  • 异步(Background):会话结束后后台批处理整理,OpenAI 称之为 Dreaming(做梦),Letta 称之为 Sleep-time Compute,LangMem 称之为 Reflection
  • 2026 年的明显趋势:热路径只做轻量缓冲,重活全部下沉到异步巩固——这与人类睡眠巩固记忆的机制惊人一致。

维度三:检索策略——全量注入 vs 按需召回 vs 渐进披露

  • 全量注入:把记忆摘要直接拼进系统提示(早期 ChatGPT);
  • 按需召回:查询时向量/图检索 Top-K;
  • 渐进披露(Progressive Disclosure):先给模型一张「目录」,需要时再读具体文件——这是 Anthropic 在 Claude Opus 5 时代的主流设计。

维度四:冲突消解与时序感知

  • 用户三个月前说「我在北京」,昨天说「我搬去上海了」。是覆盖、追加,还是让旧边失效?
  • 代表方案:Zep/Graphiti 的双时间模型(bi-temporal)+ 边失效(edge invalidation);OpenAI Dreaming V3 的陈旧性检测

维度五:用户可控性

  • 能否查看、编辑、删除记忆?能否导出迁移?这既是产品问题,也是合规问题(GDPR 被遗忘权)。

四、产品阵营:闭源巨头们的记忆设计

4.1 OpenAI(ChatGPT):从「保存记忆」到「做梦 V3」

ChatGPT 的记忆系统是所有大厂中迭代最勤、公开信息最完整的,完整经历了四个阶段:

阶段 时间 机制 特点与问题
Saved Memories 2024.04 起 用户显式说「请记住 X」,模型调用工具写入记忆条目 依赖用户主动提示;条目少而碎
Reference Chat History 2025.04 起 自动引用过去聊天记录作为记忆来源 首次摆脱「请让我记住」的强提示
Dreaming V0 2025.04 起 引入后台进程,在不打扰用户的前提下从历史对话中自动筛选、整理记忆条目 作为 Saved Memories 的补充,缓解记忆陈旧问题
Dreaming V3 2026.06.04 发布 将 Dreaming 升级为完整底层记忆架构,重构为「能记、会用、记不过时」 面向亿级用户、多年使用周期做工程优化

Dreaming V3 的三个设计重点(据 OpenAI 官方博客及多家媒体报道):

  1. 记忆过时(Staleness)治理:例如用户计划「下周六生日派对」,到了周日系统不应再把其当作未来事件。V3 引入时间感知的记忆有效性判断;
  2. 准确性与冲突消解:对相互矛盾的记忆条目做合并、更新、删除;
  3. 规模化降本:官方称新系统算力开销降至原来的 约 1/5——记忆系统在亿级 DAU 下的推理成本本身就是一门生意。

发布节奏:先向美国 Plus/Pro 用户开放,逐步覆盖 Free 与 Go 用户。产品层面保留用户在设置页查看、编辑、删除记忆的完整控制权,并支持切回传统手动保存模式。

点评:OpenAI 的路线是典型的「异步巩固派」——把记忆整理当成一个离线/近线的数据管道问题来做。Sam Altman 将其定位为「终极杀招」,方向明确:个性化记忆 = 用户迁移成本 = 护城河

4.2 Anthropic(Claude 系):文件系统即记忆

Anthropic 是「文件派」的旗手,其记忆设计散落在四条产品线上,但哲学高度一致:

① API 层:Memory Tool + Context Editing(2025.09,随 Claude Sonnet 4.5 发布)

  • Context Editing:允许在长任务中主动清理上下文中过时的工具输出,腾出窗口空间;
  • Memory Tool:给模型一组 memory 文件操作工具(创建/读取/编辑/删除文件),由模型自主决定把什么信息存到客户端提供的存储后端。Anthropic 明确建议:文件系统是记忆的载体,模型像程序员管理代码库一样管理自己的记忆
  • 配合 Sonnet 4.5 将长任务持续执行能力从 7 小时拉升到 30 小时,这套组合拳直接瞄准「多日跨度的自主 Agent」。

② Claude.ai 消费端:Classic Memory → 双模记忆

  • 2026 年 3 月,Claude Memory 全量开放;
  • 2026 年 5 月,社区曝出 Anthropic 正在测试 「双模记忆系统(Dual-mode Memory)」:经典记忆(对话摘要条目)之外,新增 Memory Files——文件式记忆架构,被外界解读为迈向「永生 Agent」的关键一步。

③ Claude Managed Agents:记忆即共享文件

  • 平台级 Managed Agents 的记忆以文件形式持久化,可被单个或多个 Agent 跨会话访问,并支持通过 API 导出。
  • 多 Agent 共享记忆不再依赖中心化数据库,而是共享一个「记忆目录」——简单到离谱,也好用到离谱。

④ Claude Opus 5 系统提示词泄露揭示的「渐进披露」记忆
2026 年 8 月初泄露的 Opus 5 系统提示词(约 2049 行)显示,Claude 的记忆检索流程为:

当前问题 ──▶ 先读记忆目录(只有标题+一句话描述)
          ──▶ 判断是否相关 ──▶ 相关才调用 memory_read 加载正文
          ──▶ 不相关则完全不加载

这是**渐进披露(Progressive Disclosure)**的经典应用:目录常驻、正文按需,在上下文成本与召回率之间取得了极佳的平衡。

4.3 Claude Code:CLAUDE.md + Auto Memory 的六层体系

作为 2026 年最成功的编码 Agent,Claude Code 的记忆体系值得单独拆解。截至 v2.1.167(2026 年 6~7 月),它实际由两套互补机制、六个层级构成:

机制 层级 性质 内容
CLAUDE.md 企业策略级 / 用户级(~/.claude/CLAUDE.md)/ 项目级 / 子目录级 人写的规则(Procedural) 代码规范、命令约定、架构约束
Auto Memory(MEMORY.md 等) 项目级自动记忆目录 AI 写的经验(Episodic→Semantic) 调试经验、构建命令、踩坑记录

关键演进:2026 年 2 月底(v2.1.59)上线 Auto Memory——Claude 在会话中自动把值得沉淀的信息(构建命令、架构约定、调试经验)写入本地记忆文件,下次任意会话自动加载。社区的评价一针见血:

以前是「你写规则给它看」,现在是「它自己记笔记给自己看」。CLAUDE.md 只能写规则,写不了经验;Auto Memory 补上的正是经验这一环。

这也揭示了编码 Agent 记忆设计的一个普适规律:程序性记忆(规则)适合人类显式编写,情景/语义记忆(经验)适合 Agent 自动沉淀。

4.4 Google(Gemini):生态数据 + 记忆可携带

Google 的打法与 OpenAI、Anthropic 都不同,核心是用生态数据换记忆深度

  • Personal Intelligence / 个人上下文:在用户授权下,Gemini 的记忆上下文源不止于聊天记录,而是打通 Gmail、Google 相册、搜索历史与过往 Gemini 对话。记忆的「原料」维度上,Google 拥有全行业最厚的数据层;
  • 记忆导入(Memory Import,2026 年 3 月):允许用户把 ChatGPT、Claude 中的记忆、偏好与聊天历史一键导入 Gemini。操作方式颇具行为艺术感——系统生成一段提示词,你把它粘贴给旧助手,让它吐出自己的记忆,再喂给 Gemini。

点评:记忆导入是一次精准的生态战术——把「记忆积累」这个最大的迁移成本直接击穿。它同时预示了一个行业议题:记忆可携带权(Memory Portability) 很可能成为下一代 AI 产品的标配,甚至进入监管视野。


五、基础设施阵营:五大开源记忆框架解剖

如果说产品阵营决定了「记忆的天花板」,那么开源基础设施阵营决定的就是「记忆的平均水位」。以下是截至 2026 年 8 月最主流的五套方案。

5.1 Letta(前身 MemGPT):操作系统范式

出身:UC Berkeley 2023 年 10 月的 MemGPT 论文,2024 年 9 月团队成立 Letta 公司并融资 1000 万美元(Jeff Dean 参投),是 Agent Memory 领域当之无愧的「祖师爷」。

核心思想——虚拟上下文管理(Virtual Context Management):完全类比操作系统的虚拟内存。LLM 的上下文窗口是「物理内存」,外部存储是「磁盘」,Agent 通过自主调用工具完成「页面调度」:

┌─────────────── Context Window(主存)───────────────┐
│ System Prompt │ Core Memory Blocks │ In-context Msgs │
│               │  ├─ persona 块     │ (工作缓冲区)   │
│               │  ├─ human 块       │                 │
└───────┬───────┴────────┬───────────┴────────┬────────┘
        │ 自编辑(core_memory_replace)          │
        ▼                                    ▼
   Recall Storage(对话历史库)        Archival Storage(归档向量库)
        ▲  search_messages                ▲  archival_insert/search
        └────────── Agent 自主换页 ─────────┘

设计要点

  • Memory Blocks:结构化记忆模块,区分 Persona(人格)、Human(用户画像)、任务上下文等,且 Block 可被多个 Agent 共享——天然支持多 Agent 记忆协同;
  • 自编辑记忆:模型通过 function call 主动改写 core memory,是「Agent 自己管理自己记忆」的最早工程实现;
  • Sleep-time Agents:2025 年后推出的睡眠代理,在用户不活跃时后台重放对话、重组记忆,与 OpenAI 的 Dreaming 异曲同工;
  • 模型无关 + 存算分离:记忆数据与模型解耦,可随时切换 LLM 供应商。

适用:需要透明、可审计、有状态长周期 Agent 的团队;代价是概念多、上手曲线陡。

5.2 Mem0:轻量抽取管道范式

定位:「给任何 Agent 加一层记忆」的最快路径,主打多层级(用户级 / 会话级 / Agent 级)记忆的全生命周期管理,也是融资声量最大的记忆创业公司之一。

核心流水线:每次 add() 调用时,Mem0 对对话做两步处理:

  1. 抽取(Extract):用小模型从对话中提炼出候选事实;
  2. 更新(Update):对每条候选事实,与既有记忆做 LLM 判定,输出四种操作之一:
ADD      # 新信息,直接写入
UPDATE   # 与旧记忆相关,合并/改写
DELETE   # 与旧记忆矛盾,删除旧的
NOOP     # 无新增价值,忽略
from mem0 import Memory
m = Memory()
m.add(messages=[{"role": "user", "content": "我上个月换工作了,新公司在杭州"}],
      user_id="alice")
# 若旧记忆有 "alice 常驻北京",管道会自动触发 UPDATE/DELETE

Mem0-g(Graph 版):将记忆保存为知识图谱(实体-关系-实体三元组),增强多跳推理与关联召回。

数据与争议:Mem0 论文宣称在 LOCOMO 上相对 OpenAI 原生记忆有显著提升(约 +26%、延迟降低约 91%、token 节省 90%+)。但注意:独立基准机构 Cognee 的复现研究显示,不同方案在同一 LOCOMO 数据集上差异显著,且小规模测试波动大——跑分要信一半

适用:需要快速上线个性化助手的团队。优势是接入简单、API 优雅;局限是缺乏自动层级归纳,超长周期记忆管理偏弱。

5.3 Zep / Graphiti:时序知识图谱范式

定位:企业级记忆层,论文《Zep: A Temporal Knowledge Graph Architecture for Agent Memory》是记忆领域被引用最多的工程论文之一。

核心创新——双时间模型(Bi-temporal)。每条记忆边同时携带两组时间戳:

  • 事件时间(t_valid / t_invalid):事实在现实世界中何时成立;
  • 摄取时间(t_created / t_expired):系统何时知道这条事实。

当新事实与旧事实矛盾(「用户从 A 公司跳槽到 B 公司」),Graphiti 不删除旧边,而是执行边失效(edge invalidation)——给旧边打上 t_invalid。这让系统既能回答「用户现在在哪家公司」,也能回答「用户去年这个时候在哪家公司」——时序推理能力是所有框架中最强的

架构三要素

  • Episode(情节):消息、JSON、文档统一抽象为增量输入单元;
  • 增量构建:无需全图重建,新数据实时入图(这是相对传统 GraphRAG 的致命优势);
  • 混合检索:语义 + BM25 + 图遍历,cosine rerank,论文称 DMR 基准 p95 延迟比 MemGPT 低约 90%。

适用:需要精确时间线、事实频繁变化的企业场景(CRM、合规、医疗随访)。局限:图数据库依赖(Neo4j/FalkorDB/Kuzu),部署与调优成本高。

5.4 LangMem / LangGraph:认知科学映射范式

定位:LangChain 生态的原生记忆层,深度绑定 LangGraph 状态机。

设计骨架

  • 短期记忆 = Thread 内状态:由 LangGraph Checkpointer 按 thread_id 持久化,对应一次会话/任务的工作记忆;
  • 长期记忆 = 跨 Thread Store:按 (user_id, namespace) 隔离的 KV/向量存储,存用户目标、偏好与已确认事实;
  • 三类长期记忆对齐认知科学:
    • 语义记忆 → 用户画像与事实(Profile);
    • 情景记忆 → 历史任务轨迹与 few-shot 案例(Episodes);
    • 程序性记忆 → 动态改写系统提示词(Prompt 本身成为可学习的记忆载体)。

两条写入路径

  • Hot Path:会话中同步抽取(create_memory_manager);
  • Background:会话后反思(Reflection),生成摘要与经验。
from langmem import create_memory_manager
manager = create_memory_manager("openai/gpt-4o", instructions="抽取用户偏好与约束")
memories = await manager.ainvoke({"messages": conversation_history})

适用:已经在 LangGraph 技术栈内的团队,语义/情景/程序三分类非常利于架构沟通;脱离 Lang 生态则优势尽失。

5.5 MemOS:记忆操作系统(学术前沿)

出身:上海交通大学 + 浙江大学团队 2025 年提出的「记忆操作系统」,是把 Memory 抽象成 OS 级资源的学术代表作。

核心抽象——MemCube:统一的记忆封装单元,内部可承载三种形态的记忆,并支持形态间转换:

记忆形态 载体 特点
明文记忆 文本/KV 可解释、可编辑、可审计
激活记忆 KV Cache / 激活张量 注入快、成本敏感
参数记忆 LoRA 等权重增量 容量大、但黑盒、更新昂贵

MemOS 提供记忆的调度、迁移、合并与权限管理,类比进程管理与内存分页。它的意义不在于今天落地了多少业务,而在于预演了「记忆成为一等公民资源」之后的系统形态——明文记忆可以「编译」成参数记忆,参数记忆可以「解压」回明文,这种形态转换是其他框架尚未触及的维度。

5.6 其他值得关注的名字

  • Cognee:以「记忆管线 + 本体(ontology)」构建可解释记忆,同时运营独立记忆评测;
  • A-MEM:受 Zettelkasten(卡片盒笔记法)启发的自组织记忆网络,记忆条目自动建立链接并演化;
  • MemoryScope / Memobase / TiMem / EverMemOS / SuperMemory:分别在用户画像深度、时序优化、端侧部署等细分点做差异化的开源项目;
  • GBrain:YC CEO Garry Tan 开源的个人记忆引擎,用正则+规则替代部分 LLM 抽取来构建知识图谱,其 benchmark 显示「混合检索 + 图谱」相对纯向量 RAG 的召回提升巨大(P@5 从 ~18 提升到 ~49);
  • claude-mem:社区为 Claude Code 补长期记忆的轻量插件,代表了「给现成 Agent 外挂记忆」这一生态位。

六、上下文工程阵营:Manus 的「反记忆」哲学

与「外挂记忆库」相对,还有一条被验证有效的路线:不建记忆库,把一切塞回上下文本身。代表是 Manus 联合创始人季逸超 2025 年 7 月发布的《Context Engineering for AI Agents》复盘博客(历经四次重构、数百万真实交互后的经验总结)。其核心观点:

  1. 围绕模型构造记忆与流程,而不是重新训练模型——上下文工程让产品迭代以小时计;
  2. KV-Cache 命中率是生命线。输入前缀越稳定,缓存命中率越高,成本与延迟越低。由此衍生出一系列反直觉设计:
    • Append-only:上下文只追加、不重写。想「遗忘」某段内容时用掩码遮蔽而非删除,因为删除会破坏前缀稳定性、击穿 KV 缓存;
    • 保留错误:失败的工具调用不删除——它们既是情景记忆,也是模型自我纠错的素材;
  3. 状态外置到文件系统:把任务状态写成 todo.md 这类文件,通过反复复读与改写来「强迫」模型保持注意力。文件充当外部记忆,同时利用 KV 缓存,比向量检索更适合短周期高强度任务;
  4. 永远给模型留「面包屑」:长任务中任何恢复点都要可被模型从上下文中重建。

两条路线的本质区别

外挂记忆库(Mem0/Zep/Letta) 上下文工程(Manus 式)
记忆位置 外部存储,检索注入 上下文本身 + 文件系统
适用周期 跨天~跨月的长期关系 单任务~数天的高强度执行
成本模型 检索成本 + 写入管道 KV Cache 命中率
典型失误 召回不准 上下文污染、注意力衰减

生产级的成熟 Agent 往往两者兼用:短周期靠上下文工程,长周期靠记忆层。


七、横向对比总表

信息截至 2026-08-14。标注 ★ 者为该维度上的标杆。

方案 阵营 表示形式 写入机制 检索策略 时序/冲突处理 用户可控性 最佳场景
ChatGPT(Dreaming V3) 产品 摘要条目 ★ 异步后台巩固 注入+按需 陈旧性检测 ★ 查看/编辑/删除 亿级消费助手
Claude.ai / Memory Tool 产品 ★ 文件系统 模型自主写文件 ★ 渐进披露 模型编辑文件 文件级可控 长任务 Agent、企业
Claude Code 产品 Markdown 文件 人写规则+AI 自动笔记 目录+按需加载 文件合并 ★ Git 友好 编码协作
Gemini 产品 条目+生态数据 自动+导入 注入 基础 ★ 记忆可携带/导入 多模态个人助理
Letta (MemGPT) 开源框架 Blocks+归档库 ★ Agent 自编辑+Sleep-time 工具化换页 覆盖式 全透明可审计 有状态长周期 Agent
Mem0 开源框架 事实条目/图(Mem0-g) 抽取+ADD/UPDATE/DELETE 向量+图 LLM 判定冲突 API 管理 快速上线个性化
Zep / Graphiti 开源框架 ★ 时序知识图谱 增量入图 混合检索+图遍历 ★ 双时间模型+边失效 API 管理 企业级、时序敏感
LangMem 开源框架 语义/情景/程序三分 Hot+Background Store 检索 规则+LLM 命名空间隔离 LangGraph 生态
MemOS 学术 ★ MemCube 三形态 OS 调度 形态感知 生命周期管理 研究/未来系统
Manus(上下文工程) 产品 ★ 上下文+文件系统 Append-only 无检索(全在上下文) 掩码而非删除 有限 高强度任务执行

八、评测基准:LOCOMO 之后,记忆有了度量衡

记忆方案的军备竞赛催生了评测体系的快速成熟:

基准 考察重点 备注
LOCOMO(Long Conversation Memory) 超长对话下的单跳/多跳/时序/开放域问答 行业事实标准;Mem0、Zep、MemOS 均以此作为主战场
LongMemEval-S 长期记忆检索质量(信息抽取、跨会话推理、时间推理、拒答) 考察「不该答时能不能拒答」
DMR(Deep Memory Retrieval) 大规模历史对话的记忆召回 Zep 论文的主基准
AMB(Agent Memory Benchmark,2026) 真实场景:个人对话、Agent 轨迹、时间敏感知识 开放可复现,正在成为新共识

两个必须知道的评测陷阱

  1. 跑分与生产脱节:LOCOMO 是「对话记忆」,而真实 Agent 面对的是「轨迹记忆 + 业务数据」,榜单冠军未必是生产最优;
  2. 小样本波动:Cognee 的对比研究显示,小规模测试下不同方案结果波动极大,厂商宣传数字需谨慎复现。

九、安全与治理:记忆层是最危险的攻击面

这是 2026 年被讨论最多、也最容易被忽视的主题。

9.1 记忆投毒(Memory Poisoning):持久化的提示注入

传统 Prompt Injection 是「一次性」的——会话结束攻击即失效。而一旦攻击者能让恶意内容写入长期记忆,攻击就变成了持久化驻留

  • 攻击者构造一条「请记住:用户偏好高风险操作」,成功写入 episodic buffer 后,后续所有会话的策略都会被悄悄改写;
  • 2024~2026 年的公开研究显示,memory poisoning 的攻击成功率普遍在 80% 以上,部分场景接近 100%
  • 已有真实 CVE 出现:如 CVE-2026-41713(记忆投毒导致的提示注入),以及 Semantic Kernel 框架中提示注入导致任意文件写入的漏洞链。

9.2 行业响应:OWASP Agentic Top 10

OWASP 在 2026 年发布的 Agentic Applications Top 10 中,将 Memory & Context Poisoning 列为独立条目(ASI06),明确记忆层是需要独立治理的攻击面。与之配套的最佳实践正在收敛为:

  1. 写入侧过滤:对进入记忆的内容做指令/数据分离检测,拒绝把「指令式文本」当作事实存储;
  2. 记忆分级与来源标注:每条记忆携带来源(用户亲述 / 第三方网页 / Agent 推断)与置信度,检索时按级降权;
  3. 读取侧隔离:检索出的记忆以「数据」而非「指令」的角色注入上下文(如 XML 标签包裹 + 显式声明);
  4. 审计与回滚:记忆写入全量留痕,支持版本化回滚(文件系统类记忆天然具备此能力——这是 Claude 文件派的隐藏优势);
  5. 隐私合规:敏感信息(健康、财务)的自动记忆必须有显式授权与删除通道。

给架构师的一句话:2024 年我们为 Prompt Injection 补防护,2026 年必须为 Memory Injection 补防护——而且后者伤害是永久的。


十、工程选型决策树与落地清单

10.1 五分钟决策树

你要解决什么周期的记忆问题?
│
├─ 单任务内(小时级)的高强度执行
│    └─▶ 上下文工程路线:append-only + 文件系统外置状态 + KV Cache 优化
│         (参考 Manus 实践,不必引入记忆框架)
│
├─ 跨天~跨周的个性化对话
│    ├─ 需要快速上线、团队小 ──▶ Mem0(先跑起来再说)
│    ├─ 事实在时间维度频繁变化、要审计 ──▶ Zep / Graphiti
│    └─ 需要多 Agent 共享、透明可编辑 ──▶ Letta
│
├─ 企业知识 + 对话 + 业务数据混合
│    └─▶ 时序知识图谱(Graphiti)+ 既有 RAG 双轨并行
│
├─ 编码类 Agent
│    └─▶ 分层 Markdown 文件:人写 Rules + AI 写经验笔记
│         (Claude Code 模式,Git 即版本控制与审计)
│
└─ 自建基座、面向未来
     └─▶ 关注 MemOS 形态转换思路:明文 ↔ 激活 ↔ 参数

10.2 生产落地十条军规

  1. 先做减法:简单事实存储 + 足够强的模型,能解决 80% 的问题,别一上来就上图谱;
  2. 写入异步化:热路径只做缓冲,巩固下沉到后台(Dreaming/Sleep-time 已成行业共识);
  3. 永远带时间戳:没有 valid/invalid 时间的记忆,三个月后必然变成谎言源;
  4. 冲突策略显式化:覆盖、追加、失效三种策略要可配置,且默认保守;
  5. 记忆要可看、可改、可删:这既是信任问题,也是合规底线;
  6. 为遗忘设计:记忆系统的删除路径和写入路径同样重要;
  7. 来源标注 + 分级检索:这是抵御记忆投毒的第一道防线;
  8. 控制注入预算:渐进披露优于全量注入,给记忆留 token 预算上限;
  9. 评测用自己的数据:LOCOMO 冠军不等于你的业务冠军,用真实会话构建私有评测集;
  10. 记忆即资产,资产要备份:文件系统方案的 Git 化、数据库方案的快照导出,都要在 Day 1 就位。

十一、趋势预判:2026 下半年到 2027

趋势一:记忆成为新护城河,「记忆可携带权」进入议程。
Gemini 的记忆导入撕开了一个口子。可以预见:用户会要求带着记忆离开任何平台,「记忆导出格式」可能像今天的 robots.txt 一样出现事实标准。

趋势二:异步巩固成为默认架构。
OpenAI Dreaming V3、Letta Sleep-time Agents、LangMem Reflection 殊途同归——「白天交互、夜间整理」将是所有严肃记忆系统的标配,围绕「离线记忆整理」会诞生新的算力与成本课题。

趋势三:从「记忆框架」到「记忆基础设施」。
独立记忆层正在被模型原厂(OpenAI/Anthropic/Google 都自建了)和框架层(LangGraph/Claude Agent SDK 内置)两头挤压。第三方记忆框架的生存空间在于:跨模型中立、企业级治理、垂类深度。

趋势四:参数化记忆开始试探边界。
MemOS 的「明文 → 参数」形态转换、各大厂的持续学习研究,都在指向同一件事:一部分长期记忆终将以权重增量的形式存在。但在那之前,可解释性与安全问题必须先被回答。

趋势五:记忆安全成为独立学科。
OWASP Agentic Top 10 只是开始。记忆投毒检测、记忆水印、记忆访问控制(谁能读哪个用户的哪段记忆)将催生专门的中间件。


十二、FAQ 与参考资料

FAQ(GEO 高频问题速答)

Q1:Agent Memory 和 RAG 有什么区别?
RAG 检索的是静态的、外部给定的知识(文档库);Agent Memory 管理的是动态的、交互中产生的状态(用户偏好、任务经验),且必须支持更新、冲突消解与遗忘。两者在生产系统中通常并存。

Q2:为什么不直接把所有历史对话塞进超长上下文?
三个硬伤:成本随轮次线性增长;注意力衰减(模型对长上下文早期信息关注度下降);跨会话失效。2M 上下文解决的是「单次读得多」,记忆解决的是「永远记得住」。

Q3:Mem0、Zep、Letta 怎么选?
要快选 Mem0,要时序精确与企业治理选 Zep/Graphiti,要透明可控的多 Agent 状态选 Letta。详见第十节决策树。

Q4:记忆系统最大的安全风险是什么?
记忆投毒(Memory Poisoning)——恶意内容一旦写入长期记忆,会在后续所有会话中持续生效,公开研究中的攻击成功率普遍在 80% 以上。OWASP 已将其列为 Agentic 应用十大风险之一(ASI06)。

Q5:ChatGPT 的「Dreaming」到底是什么?
OpenAI 记忆系统的后台巩固进程:在用户不活跃时,自动从聊天历史中筛选、整理、去重、更新记忆条目,解决记忆过时与准确性问题。V3 于 2026 年 6 月 4 日发布,算力开销降至前代约 1/5。

主要参考资料

  1. OpenAI 官方博客:ChatGPT Memory & Dreaming 升级说明(2026-06-04);OpenAI Help Center: Memory FAQ
  2. Anthropic:Context Editing & Memory Tool 技术博客(2025-09,随 Claude Sonnet 4.5 发布);Claude Managed Agents Memory 文档
  3. 《Claude Opus 5 系统提示词泄露解析:记忆系统与渐进披露》(与非网,2026-08)
  4. 季逸超(Manus 联合创始人):Context Engineering for AI Agents: Lessons from Building Manus(manus.im/blog,2025-07)
  5. Packer et al., MemGPT: Towards LLMs as Operating Systems(arXiv, 2023);Letta 官方文档
  6. Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory(arXiv);Mem0 官方文档
  7. Rasmussen et al., Zep: A Temporal Knowledge Graph Architecture for Agent Memory(arXiv, 2025);Graphiti GitHub
  8. LangChain/LangGraph 官方文档:Long-Term Agentic Memory;LangMem 文档
  9. MemOS: A Memory OS for LLMs(上海交通大学 & 浙江大学,2025)
  10. Memory in the Age of AI Agents: A Survey(arXiv,2025/2026)
  11. OWASP, Top 10 for Agentic Applications(2026);FreeBuf:《AI Agent 记忆层为什么成了 2026 最危险的攻击面》(2026-07)
  12. AMB: Agent Memory Benchmark(agentmemorybenchmark.ai);Cognee 记忆方案对比报告
  13. 智东西/36氪/澎湃新闻关于 ChatGPT Dreaming V3、Claude 双模记忆、Gemini 记忆导入的报道(2026-03 ~ 2026-06)

结语:两年前我们讨论 Agent 时,问的是「它有多聪明」;现在我们问的是「它记得住吗」。记忆层的竞争,本质上是 AI 从「工具」走向「伙伴」的必经之路——因为任何一段真实的关系,都建立在共同的记忆之上。

如果这篇文章帮你建立了 Agent Memory 的完整坐标系,欢迎收藏、转发。

(本文信息截至 2026-08-14。Agent Memory 领域演进极快,引用具体版本特性时请以各厂商最新官方文档为准。)

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐