这一年,Memory 赛道都经历了什么?
就算你请到世界上最好的私人助理,Ta 也不可能记住你这辈子说过的每一句话、读过你写的每一封邮件和每一份文档,但 AI 系统有可能做到接近无限的Memory能力,记住用户、偏好和长期的对话历史,而不是每次都从零开始。
这句话出自 OpenAI CEO —— Sam Altman 跟独立科技媒体 Big Technology 的创始人 Alex Kantrowitz 的一次播客对话,后来在 GPT-6 的规划里、在「无限完美Memory」这个说法里,又被反复提起。

当时不少人把这些话当成营销话术。
但这一年过去,各种 Agent Harness 相继推出,「把记忆能力内化进模型本身」的产品也陆续出现,大家才意识到,Agent Memory 才是真正能兑现这句话的核心之一。
而围绕 Agent Memory 的想象力,已经开始落地。这一年多,数十上百家做 Agent Memory 的创业公司陆续入局,一堆人挤进一条赛道,谁也不知道自己押注的技术路线对不对。
8 月 12 日,背后由清华大学、北京大学等一众机构支持的 Agent Memory Leaderboard(中文名「记忆之巅排行榜」)放出了首期成绩,目前该项目上榜 Huggingface Spaces Trending 首屏。

该榜单正好给了我们一个切入口,得以一窥这条赛道现在的真实水平。
🚥
这篇文章,我们想梳理一下 Agent Memory 这条赛道,走到哪一步了,做到什么程度了,技术路线又分了哪几派。
Agent Memory 赛道,外冷内热
Agent Memory 这条赛道里,有实力的玩家不算少:学术血统最纯正的 Letta,脱胎于伯克利 BAIR 实验室的 MemGPT 论文,2024 年成立就拿到千万美元种子轮。
Zep 靠时序知识图谱把 LongMemEval 准确率做到 63.8%,专攻「事实会过期」这类场景;Mem0 接入门槛低,是用户最多的厂商之一。成立一年多的 SuperMemory 已融资近 300 万美元,主打把 Gmail、Notion、GitHub 这些外部数据源接进 Agent Memory。

但整个赛道仍是「外冷内热」。
今年 7 月 New Market Pitch 的行业报告显示,Agent Memory Systems 全年只占 Agentic AI 融资总额约 0.78%,原因是大多数Memory系统的核心引擎开源,技术壁垒单薄。
更麻烦的是模型厂商自己也在下场。
今年 5 月,Anthropic 在 Claude Managed Agents 里同时上线 Dreaming、Outcomes、Multi-Agent Orchestration 三个功能,直接对标 LangGraph、CrewAI 这类编排工具,创业公司原本售卖的「Memory层」服务被平台方部分内化。

争夺用户上,Memory也成了平台的筹码:今年 3 月 Anthropic 先给 Claude 上线Memory迁移,三周后 Google 跟进,Gemini 开始支持从 ChatGPT、Claude 导入完整对话历史。
不过平台自带的 Memory 目前还停在用户偏好这类浅层信息,处理不了结构化知识。这也为创业公司留下了差异化创新的机会。相比一年前,市场机会正进一步向垂直场景、专业能力和技术壁垒集中。
持续学习
除了帮 Agent 记住用户,Memory还有另一层用途,更值得关注,即:让 Agent 自己越用越聪明,实现持续学习的效果。
今年上半年,伯克利等团队发了一篇 FST 的论文,吸引了大量目光,核心是将可持续更新的 Agent Context 视为快权重、模型参数视为慢权重。实验显示其最高提高约 3 倍样本效率,并在连续任务中显著优于纯 RL。

媒体传播者们对于这篇论文的判断是 「持续学习比推理重要 1000 倍」。而持续学习的核心之一,就是 Agent Memory。
Agent Memory 这条赛道,因此进入了一个很卷的阶段,一边是资金没跟上热度,一边是模型厂商自己在收编地盘,创业公司急需能拿出来说服投资人和客户的证据。
榜单就成了最简单、最直白的证据来源。
榜单背后的 Agent Memory
现在,市面上其实已经不缺跟 Agent Memory 相关的评测和榜单,而且每一个榜单背后,都有相当扎实的机构和技术背景。
比如,走综合路线的 AMB 和 Bench'd,是做Memory产品的创业团队自己搭的独立评测站,刻意跟商业公司保持一点距离,主要查刷分。AMA-Bench 则专注于长程的工作 Memory,作者名单里面还有 Meta 的研究员参与。
像文章开头所提到的 AML 属于新晋平台,其在 8 月 12 日放出了首期结果。热度很高,有超过 100 个团队提交了注册申请,一些海外博主也在转发相关信息。

这家评测榜单受到关注的原因在于其考试科目比较全面,文本Memory覆盖事实召回、多跳推理、时间与事件、Memory治理、个性化、上下文执行、安全与隐私七个方向,代码Memory则考察系统能不能复用历史调试和开发经验。

而且,在其官方所列的联合主办单位里,有清华大学、北京大学、复旦大学、上海交通大学、上海人工智能实验室、中国科学院自动化研究所、香港中文大学、香港科技大学等接近 30 家机构。
从结果来看,AML 这次放榜分了两条线,商业产品榜和开源方法榜。
商业产品榜这边,MemoraX 以 58.0 分排名第一,领先程度很高,七个能力维度全部拿下第一,写入和检索效率也稳居第一梯队。

开源方法榜这边,InvMem、ReFind、ActiveMemoryIndex 以 45.1、45.0、44.8 分排前三,分差很小,谁也没有拉开明显身位,三家的技术取向也不一样,各有优势。

其中,商业产品榜第一的 MemoraX 值得多说两句。
这是一家今年 3 月才成立的公司,今年 4 月种子轮、5 月种子 + 轮融资后,短时间内又拿到了第三轮大额融资。联合领投方有北洋海棠基金、尚势资本、仁爱资本,银杏谷资本跟投,华业天成、达泰资本等老股东继续加码投资。
很多人开始关注这家公司,一部分原因是它今年在 ICML 2026 上入选了 10 篇论文,其中 2 篇被选为 Spotlight(焦点论文)。
一家成立不到半年的公司能在顶会上拿到这个密度的论文产出,放在整个 Agent Memory 创业公司里都不多见,这也是把它当成理解这条赛道技术路线的一个抓手的原因,它某种程度上是这批 Agent Memory 新创团队技术打法的一个缩影。
MemoraX 的官方技术描述是「可学习Memory策略引擎、Memory基模、自演进 Agent Harness」,跟传统向量数据库相似度检索的路线不一样。其强调的是Memory本身能持续自我进化、动态更新,还能跨场景复用。
这套打法不是第一次被验证。
AML 这次的评测数据本身就整合了 LoCoMo-Refined 这类已有基准,而 MemoraX 更早的时候已经在 LoCoMo-Refined 上单独跑出过 82.65 分,比第二名高出 30% 以上。
这个基准由南京大学和上海人工智能实验室发布,意义在于把评测标准收紧之后,不少此前跑分不错的系统分数出现了明显回落,原因是过去的裁判标准偏宽松。
MemoraX 是在这套收紧后的标准下拿到 82.65 分的,他们的技术路线也是从这时候开始被更多人注意到。
当时,MemoraX 自己的说法是,把整个Memory系统建模成一个可学习的序列决策过程,写入、检索、利用这三个环节的每一步,都被当成可以被评估、可以被优化的决策,用任务最终的端到端结果做 reward,让系统在多轮使用里不断调整自己的策略,逐步收敛到更好的行为。

Memory因此从「记一次用一次」的静态组件,变成了一个用得越多、表现越好的动态系统。存了多少数据、用了什么向量库,不是决定一个Memory系统会不会越用越好的关键。
真正的关键,是有没有一个自行持续学习的闭环。
结合 MemoraX 之前公开过的技术细节,这套闭环具体可以拆解成写入、检索、利用三个环节。
这套先诊断、再优化、反复迭代的机制,可能会成为 Agent Memory 未来的基操。
Memory 的过去一年和未来一年
对关注这条赛道的人来说,AML 首期榜单的意义,可能不在名次本身。
从单一 Benchmark、到统一 Leaderborad,这些结果吸引注意力的一大原因是标准化评测让Memory能力变得可比较,让整个行业加速。最近 1 年层出不穷的 Agent Memory 榜单,说明了 Memory 赛道今天站的位置,很重要。
「外挂式」Memory 库胜在成熟、合规、即插即用,「内生式」路线胜在上限和想象空间。一期榜单证明不了哪条路线终局会赢,但它会让接下来的每一次产品迭代、每一轮技术选型,都多一个可引用的参照系。
其次,Memory 的商业化路径正在清晰。Mem0 的 API 调用量一年涨了 5 倍,说明「Memory As A Service」的付费意愿是真实的。
企业侧对私有化部署、多租户隔离、权限审计的要求,又会把竞争拉向工程厚度的比拼。这个赛道的收入模型,大概率会介于模型 API 和数据库之间。而这两个市场,都出过百亿美元级别的公司。
Agent 要从「单次对话工具」变成「能长线协作的同事」,Memory 是绕不开的那块拼图。现在,这块拼图有了公开的成绩单。
🚥
顺着这条故事线看下来,Memory 早就不只是「记住信息」这么简单。
它跟 Agent 的能力深度绑定在一起,变成了「Agent Memory」这样一个独立的技术方向,想象空间也跟着打开了不少,接下来大概率还是个热门赛道。
从 Mem0 这类做得早、规模最大的技术路线,到这次 MemoraX 展示出来的打法,思路差别都不算小。
之后,我们会长期关注 Agent Memory 赛道。
文章来自于微信公众号 “十字路口Crossing”,作者 “十字路口Crossing”
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI