智谱清华唐杰:LLM Memory最新全景综述
过去两年,记忆这个词在LLM圈子里被用滥了——KV Cache叫记忆,RAG叫记忆,Agent的向量库也叫记忆,Titans的测试时训练还叫记忆。每个人都在谈记忆,但没有人在同一个坐标系里谈。
这篇来自清华唐杰(也是市值5800亿智谱创始人)、NUS和Bosch AI的综述做了一件吃力但必要的事:给LLM的记忆机制建立一个统一的、以架构为中心的分类学。它把从注意力缓存、Mamba类循环状态、测试时训练(TTT)、MoE路由到Engram式查找存储这些看似毫不相关的技术,全部放进同一个设计空间里比较。
本综述相对于代表性以记忆为中心的综述的定位。
读完你会有一个强烈的感受:记忆正在从Scaling的副产品变成一等架构设计维度——这可能比单纯堆参数更深刻地影响下一代模型的形态。
Figure 1:LLM记忆的演进——从隐式、短暂的计算副产品,到显式、持久、自适应的架构设计维度
一、三轴分类法:给记忆建坐标系
这篇综述的核心贡献是一个三正交轴分类框架。任何记忆机制,都可以沿这三条轴定位:
| 轴 | 取值 | 回答的问题 |
|---|---|---|
| 表征(Representation) | 隐式 vs 显式 | 存的是什么?有没有独立的读写接口? |
| 更新动态(Update Dynamics) | 离线 vs 在线 | 什么时候更新?训练期还是推理期? |
| 持久性(Persistence) | 短期 vs 长期 | 信息能影响多久的计算? |
三条轴基本正交:显式记忆可以离线(MoE)也可以在线(Titans);在线记忆可以短期(滑动窗口注意力)也可以长期(Mamba)。
论文的Table I 把45+个代表性系统按三轴逐一归类(从2017年的Transformer到2026年的Mamba-3、Engram、Kaczmarz Linear Attention),是目前我见过最全的一张记忆架构编年表。
二、隐式记忆:计算动态中的工作记忆
Figure 3:隐式记忆总览——注意力作为内容寻址记忆(A)、稀疏/选择性/结构化记忆(B)、循环序列记忆(C)
2.1 注意力 = 可微分的内容寻址瞬时记忆
自注意力本质上是一个可微分的、内容寻址的工作记忆:历史token被编码为KV对,新token通过query按内容检索。它在线更新、访问灵活,但记忆是短期的、容量被上下文窗口锁死,且随推理结束即被丢弃。
两个值得注意的观察:
- 上下文窗口扩大 ≠ 记忆能力变强。实证研究表明,长上下文模型经常用不满名义容量——理论记忆大小和实际利用率之间有鸿沟。
- StreamingLLM 本质是隐式淘汰策略:滑窗+保留少量”注意力锚点”token,大部分历史被持续覆写。长程行为不是来自无限存储,而是来自精心设计的访问模式。
2.2 稀疏与选择性:记忆的准入控制
稀疏注意力(Sparse Transformer、BigBird、Longformer)从记忆视角看,是在固定预算内重塑访问路径;MoBA、NSA更进一步,用学习到的路由替代固定模式,做块级记忆访问控制。Selective Attention则是准入控制——决定哪些token值得被放大。RATTENTION的发现很精炼:少量精心选择的全局记忆锚点,就能显著稳定长上下文推理。
统一视角:注意力记忆的扩展方式不是”存更多”,而是”更精细地控制准入、访问与保留”。
2.3 循环序列记忆:把历史压缩进状态
这是2024-2026年最拥挤的赛道,论文梳理得非常细:
- 线性注意力与SSM主线:Linear Attention → GLA → Mamba/Mamba-2 →Mamba-3(复数MIMO状态空间,2026);RWKV系列演进到RWKV-7(向量门控广义delta规则)。
- 状态编辑语义:Gated DeltaNet-2把”键侧擦除”和”值侧写入”解耦;Kaczmarz Linear Attention把写入建模为键归一化投影;Kalman Linear Attention引入不确定性感知的滤波更新。
- KDA / Kimi Linear:通道级对角衰减 + 对角加低秩转移,是Kimi Linear的循环核心。
- 层级状态容量:Log-Linear Attention用Fenwick树层级状态,在”恒定大小状态”和”全量KV存储”之间找到对数级中间地带。
循环记忆的代价也很明确:状态与计算耦合,缺乏灵活读写控制;长程压缩会损失保真度。
三、显式记忆:可寻址、可持久、可写
Figure 4:显式记忆总览——参数化外部记忆(A)、查找/检索式记忆(B)、条件参数与MoE(C)、多时间尺度嵌套更新(D)
显式记忆的定义性属性不是实现形式,而是自主性:存储的信息独立于即时计算图存在,可以被独立于标准前向传播的机制更新、访问和维护。
3.1 参数化记忆模块:推理时也能长记性
- Titans:专用记忆模块在推理时通过”惊讶度驱动的梯度信号”逐token更新——只改记忆参数,不动骨干。
- TTT-E2E:辅助参数子集在推理时对输入做端到端优化。
- In-Place TTT:更激进——直接把FFN的down-projection矩阵当作可复用快权重记忆,在标准MLP块内部赋予自主写语义。论文因此提出一个重要判断:显式记忆不一定是一个独立的”记忆库”,也可以是一个被赋予写语义的静态参数矩阵。
- MEMORYLLM / LM2:固定大小的持久记忆槽/记忆池,跨层嵌入,前向自更新。
解耦学习动态是这一路线的共同心法:骨干编码通用能力,记忆参数吸收上下文信息——缓解灾难性干扰,但带来容量、更新稳定性和过拟合瞬时信号的新权衡。
3.2 查找式记忆:存储与计算解耦
- kNN-LM:外部持久datastore,跨推理调用存活——比KV Cache更”显式”。
- Engram(2026):哈希寻址的稀疏记忆槽,把记忆稀疏性和专家稀疏性明确分开——MoE稀疏激活的是”参数化变换”,Engram稀疏寻址的是”存储的记忆条目”。这个区分很关键:查找记忆不能被还原为条件计算。
- PlugLM / ExplicitLM:可编辑记忆库,条目甚至是人类可读的token序列——让存储知识可检查、可定点更新。
论文特意划清了与RAG的边界:RAG靠外部编排管线,这里讨论的是嵌入模型结构的持久存储——记忆库是架构组件,不是工程外挂。
3.3 MoE = 参数空间里的条件记忆
这是全文视角最新颖的一节:MoE本质上是一种离线显式记忆。每个专家是一个持久的参数化记忆块,路由器就是在参数空间上做”上下文相关的寻址”。Mixtral的专家涌现专业化、DeepSeek-MoE的细粒度专家划分,都在强化这个解读:MoE实现的是模块化、可选择性访问的持久知识记忆。
3.4 多时间尺度更新:记忆的时间维度
Nested Learning引入层级化更新频率——不同参数子集以不同速率演化,形成”快适应-慢适应”的连续谱,直接呼应经典的快慢权重分解。这触及了稳定性-可塑性两难:高频更新适应性强但易漂移,低频更新稳定但迟钝。时间控制与结构持久性同等重要。
三轴之外,论文还分解了记忆怎么写的五类机制,这是全篇最具工程参考价值的表格:
四、系统层:混合架构、效率管理与评测
4.1 混合架构:从固定配比到信号门控
- 层间交错:Samba(Mamba+滑窗注意力)、Jamba(SSM-Attention混合块)、LightTransfer(把预训练Transformer的”懒惰层”替换为流式组件)、Priming(把混合化变成知识迁移问题)。
- 固定预算混合:OLMo Hybrid、Kimi Linear、Hymba、Falcon-H1——注意力放在哪一层、哪个头,都是设计时静态决定的。
- 新趋势:自适应混合路由。AMOR只在高熵位置激活事后注意力精炼块;HAM让循环记忆处理每个token,只把”循环状态预测不好的token”准入稀疏KV缓存。核心问题从”注意力该插在哪”变成**“哪些token值得高分辨率存储”**——混合记忆从静态层布局变成动态资源。
4.2 记忆管理:不是工程事后补丁,而是架构设计轴
CommVQ(KV向量量化)、PagedAttention(KV分页虚拟化)、Bottlenecked Transformers(工作记忆周期性巩固覆写)、Memory Caching(缓存循环状态快照而非逐token KV)——论文的立场是:压缩、虚拟化、结构化稀疏,重塑的是记忆的表征、访问与扩展方式,这是架构问题,不是系统运维问题。
4.3 评测:记忆不是一个标量
NIAH、LongBench、RULER、L-Eval、SCROLLS各有分工,但论文批评现有协议把”记忆容量”和”推理能力、Scaling效应”混为一谈。它呼吁把记忆性能分解为正交维度:容量、保真度、持久性、抗干扰、效率——隐式和显式记忆需要不同的评测协议(前者看长程依赖与噪声稳定性,后者看更新一致性、检索精度与延迟)。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
