当前位置: 首页 > news >正文

智谱清华唐杰:LLM Memory最新全景综述

过去两年,记忆这个词在LLM圈子里被用滥了——KV Cache叫记忆,RAG叫记忆,Agent的向量库也叫记忆,Titans的测试时训练还叫记忆。每个人都在谈记忆,但没有人在同一个坐标系里谈

这篇来自清华唐杰(也是市值5800亿智谱创始人)、NUS和Bosch AI的综述做了一件吃力但必要的事:给LLM的记忆机制建立一个统一的、以架构为中心的分类学。它把从注意力缓存、Mamba类循环状态、测试时训练(TTT)、MoE路由到Engram式查找存储这些看似毫不相关的技术,全部放进同一个设计空间里比较。

本综述相对于代表性以记忆为中心的综述的定位。

读完你会有一个强烈的感受:记忆正在从Scaling的副产品变成一等架构设计维度——这可能比单纯堆参数更深刻地影响下一代模型的形态。

Figure 1:LLM记忆的演进——从隐式、短暂的计算副产品,到显式、持久、自适应的架构设计维度

一、三轴分类法:给记忆建坐标系

这篇综述的核心贡献是一个三正交轴分类框架。任何记忆机制,都可以沿这三条轴定位:

取值回答的问题
表征(Representation)隐式 vs 显式存的是什么?有没有独立的读写接口?
更新动态(Update Dynamics)离线 vs 在线什么时候更新?训练期还是推理期?
持久性(Persistence)短期 vs 长期信息能影响多久的计算?

三条轴基本正交:显式记忆可以离线(MoE)也可以在线(Titans);在线记忆可以短期(滑动窗口注意力)也可以长期(Mamba)。

论文的Table I 把45+个代表性系统按三轴逐一归类(从2017年的Transformer到2026年的Mamba-3、Engram、Kaczmarz Linear Attention),是目前我见过最全的一张记忆架构编年表

二、隐式记忆:计算动态中的工作记忆

Figure 3:隐式记忆总览——注意力作为内容寻址记忆(A)、稀疏/选择性/结构化记忆(B)、循环序列记忆(C)

2.1 注意力 = 可微分的内容寻址瞬时记忆

自注意力本质上是一个可微分的、内容寻址的工作记忆:历史token被编码为KV对,新token通过query按内容检索。它在线更新、访问灵活,但记忆是短期的、容量被上下文窗口锁死,且随推理结束即被丢弃。

两个值得注意的观察:

  • 上下文窗口扩大 ≠ 记忆能力变强。实证研究表明,长上下文模型经常用不满名义容量——理论记忆大小和实际利用率之间有鸿沟。
  • StreamingLLM 本质是隐式淘汰策略:滑窗+保留少量”注意力锚点”token,大部分历史被持续覆写。长程行为不是来自无限存储,而是来自精心设计的访问模式

2.2 稀疏与选择性:记忆的准入控制

稀疏注意力(Sparse Transformer、BigBird、Longformer)从记忆视角看,是在固定预算内重塑访问路径;MoBA、NSA更进一步,用学习到的路由替代固定模式,做块级记忆访问控制。Selective Attention则是准入控制——决定哪些token值得被放大。RATTENTION的发现很精炼:少量精心选择的全局记忆锚点,就能显著稳定长上下文推理。

统一视角:注意力记忆的扩展方式不是”存更多”,而是”更精细地控制准入、访问与保留”。

2.3 循环序列记忆:把历史压缩进状态

这是2024-2026年最拥挤的赛道,论文梳理得非常细:

  • 线性注意力与SSM主线:Linear Attention → GLA → Mamba/Mamba-2 →Mamba-3(复数MIMO状态空间,2026);RWKV系列演进到RWKV-7(向量门控广义delta规则)。
  • 状态编辑语义:Gated DeltaNet-2把”键侧擦除”和”值侧写入”解耦;Kaczmarz Linear Attention把写入建模为键归一化投影;Kalman Linear Attention引入不确定性感知的滤波更新。
  • KDA / Kimi Linear:通道级对角衰减 + 对角加低秩转移,是Kimi Linear的循环核心。
  • 层级状态容量:Log-Linear Attention用Fenwick树层级状态,在”恒定大小状态”和”全量KV存储”之间找到对数级中间地带。

循环记忆的代价也很明确:状态与计算耦合,缺乏灵活读写控制;长程压缩会损失保真度。

三、显式记忆:可寻址、可持久、可写

Figure 4:显式记忆总览——参数化外部记忆(A)、查找/检索式记忆(B)、条件参数与MoE(C)、多时间尺度嵌套更新(D)

显式记忆的定义性属性不是实现形式,而是自主性:存储的信息独立于即时计算图存在,可以被独立于标准前向传播的机制更新、访问和维护。

3.1 参数化记忆模块:推理时也能长记性

  • Titans:专用记忆模块在推理时通过”惊讶度驱动的梯度信号”逐token更新——只改记忆参数,不动骨干。
  • TTT-E2E:辅助参数子集在推理时对输入做端到端优化。
  • In-Place TTT:更激进——直接把FFN的down-projection矩阵当作可复用快权重记忆,在标准MLP块内部赋予自主写语义。论文因此提出一个重要判断:显式记忆不一定是一个独立的”记忆库”,也可以是一个被赋予写语义的静态参数矩阵。
  • MEMORYLLM / LM2:固定大小的持久记忆槽/记忆池,跨层嵌入,前向自更新。

解耦学习动态是这一路线的共同心法:骨干编码通用能力,记忆参数吸收上下文信息——缓解灾难性干扰,但带来容量、更新稳定性和过拟合瞬时信号的新权衡。

3.2 查找式记忆:存储与计算解耦

  • kNN-LM:外部持久datastore,跨推理调用存活——比KV Cache更”显式”。
  • Engram(2026):哈希寻址的稀疏记忆槽,把记忆稀疏性专家稀疏性明确分开——MoE稀疏激活的是”参数化变换”,Engram稀疏寻址的是”存储的记忆条目”。这个区分很关键:查找记忆不能被还原为条件计算。
  • PlugLM / ExplicitLM:可编辑记忆库,条目甚至是人类可读的token序列——让存储知识可检查、可定点更新。

论文特意划清了与RAG的边界:RAG靠外部编排管线,这里讨论的是嵌入模型结构的持久存储——记忆库是架构组件,不是工程外挂。

3.3 MoE = 参数空间里的条件记忆

这是全文视角最新颖的一节:MoE本质上是一种离线显式记忆。每个专家是一个持久的参数化记忆块,路由器就是在参数空间上做”上下文相关的寻址”。Mixtral的专家涌现专业化、DeepSeek-MoE的细粒度专家划分,都在强化这个解读:MoE实现的是模块化、可选择性访问的持久知识记忆

3.4 多时间尺度更新:记忆的时间维度

Nested Learning引入层级化更新频率——不同参数子集以不同速率演化,形成”快适应-慢适应”的连续谱,直接呼应经典的快慢权重分解。这触及了稳定性-可塑性两难:高频更新适应性强但易漂移,低频更新稳定但迟钝。时间控制与结构持久性同等重要。

三轴之外,论文还分解了记忆怎么写的五类机制,这是全篇最具工程参考价值的表格:

四、系统层:混合架构、效率管理与评测

4.1 混合架构:从固定配比到信号门控

  • 层间交错:Samba(Mamba+滑窗注意力)、Jamba(SSM-Attention混合块)、LightTransfer(把预训练Transformer的”懒惰层”替换为流式组件)、Priming(把混合化变成知识迁移问题)。
  • 固定预算混合:OLMo Hybrid、Kimi Linear、Hymba、Falcon-H1——注意力放在哪一层、哪个头,都是设计时静态决定的。
  • 新趋势:自适应混合路由AMOR只在高熵位置激活事后注意力精炼块;HAM让循环记忆处理每个token,只把”循环状态预测不好的token”准入稀疏KV缓存。核心问题从”注意力该插在哪”变成**“哪些token值得高分辨率存储”**——混合记忆从静态层布局变成动态资源。

4.2 记忆管理:不是工程事后补丁,而是架构设计轴

CommVQ(KV向量量化)、PagedAttention(KV分页虚拟化)、Bottlenecked Transformers(工作记忆周期性巩固覆写)、Memory Caching(缓存循环状态快照而非逐token KV)——论文的立场是:压缩、虚拟化、结构化稀疏,重塑的是记忆的表征、访问与扩展方式,这是架构问题,不是系统运维问题。

4.3 评测:记忆不是一个标量

NIAH、LongBench、RULER、L-Eval、SCROLLS各有分工,但论文批评现有协议把”记忆容量”和”推理能力、Scaling效应”混为一谈。它呼吁把记忆性能分解为正交维度:容量、保真度、持久性、抗干扰、效率——隐式和显式记忆需要不同的评测协议(前者看长程依赖与噪声稳定性,后者看更新一致性、检索精度与延迟)。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

http://www.jsqmd.com/news/1356689/

相关文章:

  • Unity URP半透明UI模糊背景:Dual Blur算法与Render Texture实战
  • 2026 年新发布:卢湾优秀的冷却塔回收施工公司哪家好,工厂淘汰的那台“烫手铁疙瘩”,居然靠这个赚了一笔,多数人还没发现门道 - 企业推荐官-
  • 2026年轻食创业推荐:蔬三时招商模式深度解析 - 装修教育财税推荐2026
  • 从VS Code到Cursor:AI原生编程副驾驶如何重塑开发效率
  • Linux终端记忆栏:提升运维效率的终极工具
  • 西门子S7-1200 PLC在码垛机自动化控制中的应用与实践
  • 数字绘画拆解学习法:从“绝对小丑爱音”案例掌握角色设计核心技法
  • 如何高效使用C++ Excel库:OpenXLSX的5个实用技巧与最佳实践
  • 把零信任落到代码:可运行的策略决策点(PDP)与网络微分段
  • 《幻兽帕鲁》Mod安装指南:从UE4SS加载器到实用护肝Mod推荐
  • 我热爱大语言模型,但我厌恶炒作
  • 公平抽签算法实现与随机性验证
  • 新手必看!AI Agent学习路线图:从入门到实战,告别混乱,快速掌握核心技能!
  • 2026年怎么选靠谱蚀刻厂家?交货准时的精密金属/金属/平面/铜蚀刻工厂哪家值得看 - 硬核推荐
  • DeepTutor本地部署与可视化AI学习平台实战指南
  • Google Meridian:贝叶斯营销组合模型实战指南
  • RAG(检索增强生成)工作原理与流程详解
  • Mac 党狂喜冒险岛怀旧服终于能玩上了!
  • SolidWorks_标准零件库19_标准件与PDM集成
  • Ollama部署Qwen3.5-9B破限版:本地大模型低成本实践指南
  • 技术项目深度拆解与落地验证框架:从信息碎片到可执行方案
  • Origin 2024b 在 Windows 系统下的完整安装与配置指南
  • 从零部署开源AI助手Codex:集成DeepSeek与RuoYi-Vue-Pro实战指南
  • Flux模型图像生成实战:Krea 2风格库与深度图ControlNet精准控制
  • 多智能体系统实战:从部署到应用,构建高效AI协作团队
  • 工业园区综合能源系统低碳调度优化实践
  • 终极NVIDIA显卡优化指南:免费开源工具解锁隐藏性能
  • 大模型名词精讲 01:LLM
  • 如何永久保存微信聊天记录?这个开源工具让你的数字记忆不再丢失
  • 硅光子集成:光电共封装的制造难点