Skip to content
围炉聊科技微信公众号二维码关注公众号,获取新文章推送
添加我为微信朋友扫描二维码,添加我为朋友

智能体记忆的赛道地图——智能体基建系列

AI助手刚出来时你大概曾经遇到过这样的情况,跟一个 AI 助手聊了半天,第二天回来它既不认识你,也不记得昨天聊到哪。为什么会这样?其实是因为大模型每一轮对话对它都是从零开始,全靠那块有限的上下文窗口,窗口一满,前面的东西就被挤出去了。智能体记忆要解决的就是这件事。
管中窥豹,先来看一下近期智能体记忆的火爆程度:Mem0 攒到约 6.3 万星,成了生态最大的记忆层;腾讯云 5 月首次开源、8 月 v2.0 团队版引爆的 TencentDB-Agent-Memory,8 月 v2.0 发布后一周内冲上 GitHub 周趋势榜第一、涨到一万五千多星,如今约 2 万。热度是真的。但“记忆”这个词已经有点被用烂了,有人指聊天记录,有人指向量数据库,有人指知识图谱,大家聊的可能根本不是一件事。我们要进行智能体的基建就有必要把赛道铺开,看看到底有哪些玩家、各自占哪一块。

一、四类记忆

如果把 Agent 当成人,记忆可以分成四类。

  • 工作记忆,相当于人脑子里几秒到几分钟的意识缓冲区。Agent 里就是当前的上下文窗口,加上最近几轮对话。转瞬即逝,窗口一满就没了。

  • 情景记忆,"我经历过什么",带时间地点。Agent 里是历史交互、任务轨迹,存在向量数据库里,配时间戳。Mem0 主要做的就是这类。

  • 语义记忆,"事实是什么",不带时间标签。用户偏好、实体关系、领域知识,靠知识图谱或向量索引存。Zep、Graphiti 走的是这条线。

  • 程序性记忆,"怎么做",技能和流程。Agent 里是成功的工具调用序列、跑通的 SOP,存成代码或提示模板。腾讯云那个方案里的 Skill 资产,就是这类。

    四类记忆,落地方式完全不同。工作记忆靠上下文窗口,情景记忆靠向量库,语义记忆靠图谱,程序性记忆靠规则和模板。
    当我们想"给我的 Agent 加个记忆"就必须了解清楚场景、分析安装哪类记忆更合适。
    举个例子,"Agent 执行到哪一步、刚才调了什么工具",这是运行时状态,属于工作记忆。"用户上个月说过不喜欢红色",这是知识记忆,属于情景或语义记忆。两者是两回事,但很多工具想用一个东西同时解决,结果两个都搞砸。具体讲,运行时状态要快、要即时、用完即弃;知识记忆要稳、要持久、要能跨会话召回。把运行时状态塞进向量库,检索慢,还污染长期记忆;把知识记忆塞进上下文窗口,窗口一下就被撑爆。分不清这两件事,是记忆系统做得烂的第一大原因。

二、赛道地图:六个分区

按“架构范式 + 解决什么问题”可以把智能体记忆赛道分成六块。每块都有自己的代表,也有自己的天花板。

1. 通用记忆层:Mem0

典型代表Mem0,目前约 6.3 万星,生态最大,是大多数人“给我的 Agent 加个记忆”时的默认答案。

它的做法是向量优先:写入时用 LLM 把对话抽成原子事实,检索时多信号匹配。好处是上手成本最低,几乎不用改现有代码。代价是它有基于时间元数据的时序重排,但非 Zep 式双时序图谱,记不住“某个事实什么时候成立、什么时候失效”。你改了地址,它可能还把新旧两个地址一起检索出来,让模型自己猜。
同类里还有个 LangMem,是 LangChain 官方的,库而非服务。如果你已经在用 LangGraph,它更轻,热路径和后台管理分开处理。定位上和 Mem0 是一路,但一个卖服务,一个卖库。
这块是赛道的入口,量大、热闹,但上限看得见。

2. 时序图谱:Zep / Graphiti

Zep 是打包好的记忆产品,Graphiti 是它底下的开源图引擎。Zep 社区版 2025 年已弃用,如今真正在涨、值得跟的是 Graphiti——约 3 万星,Zep 本体才约 4.8 千星,相差六倍。

如果说 Mem0 回答“事实是什么”,Graphiti 回答的是“这个事实什么时候为真”。它用双时序知识图谱,每条边(一个事实)带两条时间线:一条记事件在现实里何时发生、何时失效(valid_at / invalid_at),一条记系统何时把它写进图(created_at / expired_at)。新旧事实冲突时,旧边不删,只标 invalid_at,历史全留着。所以它能答“这个客户 Q2 变更之前的方案是什么”,也能做“截至某天我们知道了什么”的点时间查询。
代价是实打实的:图构建贵,每一步摄入都要调 LLM 抽实体,Zep 每对话记忆足迹超 600K token,Mem0 才一千多,量级差几百倍。自托管还得自己维护图数据库和索引。但你要的是“事实随时间的演化”而非“最近聊了什么”,这是目前最干净的一条开源路线。

3. 文档图谱:Cognee

约 2.7 万星,走的是图谱路线的另一支。

它跟 Zep 不一样,Zep 存的是 agent 交互里沉淀的时序事实,Cognee 抽的是文档里的知识。

做法是 ECL 管道,extract、cognify、load,把文档抽成带类型的知识图谱,支持 SQLite、LanceDB、Kuzu 这些嵌入式存储,本地优先,不强制上云。

短板也清楚:它没有 MCP 工具,面向的是“文档→知识图谱”,不是实时 agent 记忆。真要在对话里做记忆,它帮不上;要做知识密集的本地 RAG,它挺合适。

4. 记忆自治:Letta(前 MemGPT)

约 2.4 万星,但它是这条赛道的思想源头。

2023 年 10 月伯克利那篇《MemGPT: Towards LLMs as Operating Systems》,把“给 LLM 无限上下文”这件事用操作系统的虚拟内存思路解掉了。

它跟前两派的根本区别在于:Mem0 和 Zep 都是“系统替 Agent 管记忆”,抽取、排序、注入都是平台干的;Letta 把钥匙交给 Agent 自己,让它决定什么该记、什么时候检索、什么该归档。

这思路漂亮,但绑定整套运行时,部署重,而且记忆质量直接取决于底层模型聪不聪明。模型弱了,会记出一堆脏东西。

5. 团队治理:TencentDB-Agent-Memory

腾讯云 5 月首次开源、8 月 v2.0 团队版引爆,MIT 协议,是目前这波里星涨得最猛的。

它不做单 Agent 的记忆精度,做的是团队记忆:多个 Agent 共享一套经验,配上权限治理。四类资产,Chat Memory(发生过什么)、Skill(团队通常怎么做)、Wiki(有效知识在哪)、CodeGraph(改这里会影响哪),再加一层 L0 到 L3 的语义金字塔,底层存数据库保证据,高层存 Markdown 保人可读。

它的对标不是 Mem0,是企业知识管理那套 Confluence 加 Jira。这是条不一样的路线,重治理而非记忆精度。

6. 前沿新锐:MindMemOS、Hindsight、OMEGA

这一撮普遍学术导向,工程成熟度还得再看。
华为诺亚的 MindMemOS 用实体、属性、时间三维结构,把孤立事实放回同一条时间轴。Hindsight 靠四策略检索加 rerank,在 LongMemEval-s 刷到 94.6%,还是 BEAM 十万 token 测试的榜首;OMEGA 是本地上下文引擎,LongMemEval 95.4%,零依赖,一个 SQLite 加 ONNX 就够;Supermemory 走 MCP-first,通用记忆(RAG+图谱)。
这几个分数都是单篇横向评测的数字,各家用各自的评测协议,别太当回事。但它们至少说明,纯靠工程堆出来的超长上下文记忆,上限还能往上顶。

其他值得留意

还有几个更小众的:MemOS 主打技能复用和自我进化,自称省 35% token;ReMe(阿里系)把后台巩固和前台检索分开;Memary 是轻量通用款;A-MEM 受卡片笔记法启发,走 Zettelkasten 那套。

三、格局判断

生态最大的是 Mem0,要最快落地就它,但记得它的基准有水分,Mem0 自家 LongMemEval 报 94.4%,第三方 Vectorize 独立测仅 49.0%;LoCoMo 自家 92.5% 无独立复现。
最值得研究的是 Letta,它定义了“记忆由谁管理”这个问题,后面 Mem0、Zep、TencentDB 的分化都能从它这追到根。
踩热点写评测就选 TencentDB,5 月首次开源、8 月 v2.0 引爆、争议点够多(无自动遗忘、向量检索瓶颈、Skill 精度没公开),正好做平衡评测。

一张选型矩阵收尾:

维度Mem0Zep/GraphitiLettaTencentDB
时间推理原生双时序弱(靠向量)
生态最大
记忆自治唯一半(Loadout)
团队治理核心
上手成本最低

Cognee 没放进这张表,因为它面向文档知识抽取,和这四个不在一个选型维度。要做本地知识图谱再单拎出来看。

结尾

赛道还在快速变,有的项目的星数几个月可能就翻番,这次不是在看现在“谁最强”,主要看看“谁在解决什么问题”,为后续智能体搭建做好基建分析。