惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
T
Threatpost
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Tenable Blog
AWS News Blog
AWS News Blog
Know Your Adversary
Know Your Adversary
TaoSecurity Blog
TaoSecurity Blog
P
Palo Alto Networks Blog
Spread Privacy
Spread Privacy
I
Intezer
Security Latest
Security Latest
The Last Watchdog
The Last Watchdog
Google DeepMind News
Google DeepMind News
Help Net Security
Help Net Security
Cyberwarzone
Cyberwarzone
N
News and Events Feed by Topic
O
OpenAI News
A
Arctic Wolf
S
Secure Thoughts
Attack and Defense Labs
Attack and Defense Labs
N
News and Events Feed by Topic
M
MIT News - Artificial intelligence
F
Full Disclosure
P
Privacy International News Feed
The GitHub Blog
The GitHub Blog
T
Troy Hunt's Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
H
Hacker News: Front Page
aimingoo的专栏
aimingoo的专栏
S
Security @ Cisco Blogs
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Apple Machine Learning Research
Apple Machine Learning Research
Engineering at Meta
Engineering at Meta
Cloudbric
Cloudbric
大猫的无限游戏
大猫的无限游戏
Google Online Security Blog
Google Online Security Blog
Recent Announcements
Recent Announcements
H
Help Net Security
量子位
V
V2EX
美团技术团队
G
Google Developers Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
S
Schneier on Security
V2EX - 技术
V2EX - 技术
D
Docker
博客园 - 【当耐特】
Project Zero
Project Zero
博客园 - 司徒正美

博客园 - marsggbo

LLM agent 为什么不稳?问题可能不在模型,在 harness Meta-Harness:让 LLM 自己搜索最优 harness,模型不动,性能白涨 从零理解 ASR:音频基础、Qwen3-ASR 架构,以及离线 vs 流式推理原理 arXiv'26 | LLM Agents 让群体信念变得可编程:当 AI 开始系统性操控舆论 巴西「主权大模型」翻车:当模型可以随便融合,怎么证明它偷了你的权重? 进阶篇 | 不靠人工设计,让遗传算法自己进化出 SOTA 的 LLM 剪枝指标 说人话:一文搞懂现在火热的 LLM agent 自进化原理 ICML'26 | Transformer 真的需要三个投影矩阵吗?Q-K=V 让 KV Cache 直接砍半 UPenn & Meta | NF-CoT:当 LLM 的思维链不再是文字,而是连续概率流 arXiv'26 | 为什么你的多智能体系统越加 agent 越慢?DeLM 用去中心化解了这个矛盾 arXiv'26 | Self-Harness:让 Agent 自己改自己的 harness,pass rate 最高翻倍 Anthropic | 当 AI 开始造自己:递归自我改进离我们有多远? arXiv'26 | Mirage:把世界模型的 3D 记忆搬进 Latent Space,快 10 倍还省 55 倍显存 arXiv'26 | FlashMemory-DeepSeek-V4:用 13.5% 的显存干 100% 的活,超长上下文推理的 less is more MoE 压缩新思路:别删专家、别合并专家,把它们"重映射"就够了 MoE 变 Dense:剪枝+蒸馏能救内存瓶颈吗? ReMoE:只动 Router 就让 MoE 推理快 2 倍?这才是端侧 MoE 部署该有的姿势 LLM 时代,还有人搞 AutoML 吗?有,而且变得更难了 arXiv'26 | Frontier:LLM 推理仿真器,端到端误差从 51.7% 降到 2.6% arXiv'26 | ELF:Flow Matching 生成文字,用 10 倍少的数据全面超越主流 Diffusion LM LLMRouterBench:当所有 routing 方法被拉到同一起跑线,结果有些尴尬 EuroSys'26 | TokenFlow:让 LLM 流式输出真正「流」起来 AAAI'23 | NAS-LID:用「局部内在维度」给超网做体检,省 86% 显存 ICLR'26 Workshop Spotlight | Lang-PINN:让 LLM 多智能体帮你从自然语言一键搭建物理信息神经网络 KDD'25 | BurstGPT:我们收集了 1031 万条 Azure OpenAI 真实 trace,LLM 推理系统没你想的那么稳 KBS'21 | 我写的 AutoML 综述被引 2700+ 次,今天来聊聊这篇文章的来龙去脉 EuroSys'26 | PARD 提前丢掉注定超时的请求,goodput 最高提升 176% EuroSys'26 | MFS 把整个 model family 融进一套嵌套模型,KVCache 跨 tier 直接共享 EuroSys'26 | LLMFolder 用常量折叠把 FFN 参数砍 80%,精度反超剪枝方法 65% EuroSys'26 | KUNSERVE 把冗余参数副本临时让给 KVCache,P99 TTFT 最快降 72× EuroSys'26 | IBP 用无损 bit 压缩缓解 PCIe 瓶颈,GNN/DLRM/LLM 推理都能用 FAST'26 | SolidAttention 把 SSD 搬进 LLM 推理,笔记本也能跑 128k 上下文 LLM 推理启动慢?华为用一个「可编程 Page Cache」把模型加载砍了 79% 延迟降47%!FineMoE如何用「细粒度」打破MoE推理的显存-延迟死局 训练一个「会管技能库」的 AI——SkillOS 让 agent 真正越用越强 MoE 训练通信瓶颈有救了?DySHARP 直接在交换机里做计算,干掉 50% 冗余流量 2026-05-12-2508_06526 把 Dense LLM 变成 MoE 还能推理提速?NeurIPS 2024 Read-ME 做到了 说人话理解 EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) KV Cache 也能「语义共享」?SemShareKV 用 LSH 做到了 写完 Markdown 还要手动排版?我写了个 VS Code 插件一键搞定微信公众号、知乎、小红书 多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作 让不同 LLM 之间共享 KV Cache?DroidSpeak 是怎么做到的 RouteMark: 基于路由行为指纹的模型合并知识产权归属 | A Fingerprint for IP Attribution in Routing-based Model Merging Lang-PINN: 从自然语言到物理信息神经网络的多智能体框架 | From Language to PINNs via a Multi-Agent Framework Ghost in the Cloud: 地理分布式大模型训练的安全隐患 | Your Geo-distributed LLM Training is Easily Manipulated GM-Skip: 基于度量引导的 Transformer 块跳过策略加速视觉语言模型 | Metric-Guided Transformer Block Skipping for Efficient VLMs ExpertFlow: 基于预测性专家缓存与令牌调度的高效MoE推理 | Efficient MoE Inference via Predictive Expert Caching and Token Scheduling AutoHete: 面向大语言模型的自动化高效异构训练系统 | An Automatic and Efficient Heterogeneous Training System for LLMs DAC'26 | ExpertFlow:让 MoE 大模型在单卡上跑起来,内存省 93%、速度快 10 倍 Eurosys26 | FineMoE如何用「细粒度」打破MoE推理的显存-延迟死局 LoRA fine-tune吞吐量提升1.96倍!LoRAFusion如何把内存带宽浪费和pipeline bubble一起干掉 Fast26 | LLM 推理启动慢?华为用一个「可编程 Page Cache」把模型加载砍了 79% KV Cache 的两层存储到底卡在哪?FAST'26 这篇论文给出了答案 NeurIPS24 | 把Dense LLM变身MoE还提速 ICML25 | EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) KV Cache 复用的第三条路:FAST 2026 CacheSlide 是怎么解决 Agent 推理的位置漂移问题的 MoE 推理的内存墙,被一块多芯粒芯片打穿了? KVCOMM:让多 Agent 系统的 KV Cache 真正“通起来”,TTFT 直接砍掉 7.8 倍 NSDI26 | DroidSpeak让不同 LLM 之间共享 KV Cache TokenDance 解决多 Agent LLM 推理的 KV Cache 冗余问题 当 AI 开始学会"记住":LLM Agent 记忆系统的统一视角 【转载】ACM MM 投稿论文模板修改成投稿模式 尝试从源头理解 SVD 原理和计算 LLM 场景下的强化学习技术扫盲 解决 Overleaf 中插入 PDF 图片失败的问题:排查与修复 Tmux ctrl+B快捷键失效处理办法 对抗训练综述学习笔记 【转知乎回答】一文看懂 LLaMA 中的旋转式位置编码(Rotary Position Embedding) 二进制中为什么负数是正数取反再加一 leetcode 常见题型代码总结 Prompt-Tuning、P-Tuning和Prefix-Tuning区别和代码实现【转】 Deepspeed ZeRO系列算法原理+通信开销详解 NSCC集群使用笔记 Huggingface Transformers实现张量并行的小坑 set/get_output_embeddings Pytorch 如何使用 storage 实现参数 offload? TACC 集群使用笔记 图解 vLLM 的推理调度策略 大模型推理框架 vLLM 源码解析(二):Block 模块分配和管理 OpenAI 的视频生成大模型Sora的核心技术详解(一):Diffusion模型原理和代码详解 大模型推理框架 vLLM 源码解析(一)
LLM Agent Memory 全景拆解:从 RAG 到 KV Cache 到参数写入,100+ 篇工作的方法演进与真实取舍
marsggbo · 2026-07-23 · via 博客园 - marsggbo

插播:之前写的《动手学 AutoML》终于出版了,从 NAS 到超参优化都有覆盖,适合想系统入门 AutoML 的同学。好了广告结束,现在进入正题。

动手学AutoML书籍封面

LLM Agent Memory 全景拆解:从 RAG 到 KV Cache 到参数写入,100+ 篇工作的方法演进与真实取舍

原文:LLM Agent Memory: A Survey from a Unified Representation–Management Perspective
作者:Zhenheng Tang, Xin He, Tiancheng Zhao 等(A*STAR CFAR / HKUST)


1. 先交代下背景:为什么我们觉得这篇综述有写的必要

你有没有发现一个现象:2024-2025 年几乎所有做 LLM agent 的团队都说自己"加了 memory",但你去看它们的实现,有人在做向量库检索,有人在做 KV cache eviction,有人在做 LoRA 持续学习——表面同名,底层完全不是一个问题

这就导致了一个很尴尬的局面:reviewer 问你 "和 XXX memory system 比怎样",你根本没法比,因为你们根本不在同一层解决问题。

所以这篇综述不是又列一遍论文清单。它想做的事情是:把 memory 这个被滥用的词还原成一个可拆分、可比较、可设计的系统问题。

核心切法很清晰——任何 LLM memory 机制都可以拆成两个正交维度:

  1. 表示层 (Representation):信息以什么形式存在——文本 token、KV cache 中间状态、还是模型参数?
  2. 管理层 (Management):信息怎么建、怎么改、怎么取——construction、update、query 三件事哪个是瓶颈?

下图是整个框架的总览:

LLM memory 统一框架

上层是应用场景(多轮对话、文档问答),中间层是三种 memory 表示,下层是统一的管理接口抽象。这张图最有价值的地方不是分类本身,而是它揭示的一个事实:不同 memory 方向的研究者其实在用同一套管理语义(构建、更新、查询)去操作不同的存储后端。

一旦你接受了这个统一视角,很多看似不相关的工作就突然可以互相对话了。


2. Token-level Memory:检索的演进远比你以为的深

2.1 RAG 的真实演进路线:从 naive retrieval 到可控 pipeline

大部分人对 RAG 的印象还停留在"向量检索 + 拼 prompt",但如果你把最近两年的方法按技术路线排开,会发现它其实已经经历了三代演进:

第一代:静态检索。 BM25 或 dense embedding 做一次检索,把 top-k 结果直接拼到 prompt 里。问题很明显——query 和检索 granularity 不匹配的时候,结果很差。

第二代:Query 重构与增强。 这里出现了一批很重要的工作:

  • CoVe (Dhuliawala et al., 2023):先让模型对自己的答案做 verification,再检索,减少 hallucination
  • Step-back prompting (Zheng et al., 2024):把具体 query 抽象成更高层的问题再去检索,拿到互补证据
  • HyDE (Gao et al., 2022):先让模型生成一个假设性答案,再用这个假设答案去检索真正的文档

这一代的共同 insight 是:检索质量的瓶颈往往不在索引端,而在 query 端。一个精心重构的 query 比更好的 embedding 模型带来的提升大得多。

第三代:动态可控检索。 这才是真正让 RAG 从"管道"变成"系统"的一步:

  • DSP (Khattab et al., 2022):把检索和生成拆成可组合的模块化 pipeline
  • FLARE (Jiang et al., 2023):在生成过程中动态判断何时需要检索——只在 confidence 低的时候触发
  • Self-RAG (Asai et al., 2023):训练模型本身输出 reflection token,让它自己决定是否检索、检索的结果是否有用、自己的生成是否 faithful

Self-RAG 之所以重要,不只是因为它好用,而是它代表了一个范式转移:检索不再是外部系统强加的,而是模型自身 reasoning 流程的一部分。这就把 memory query 从 "engineering heuristic" 提升到了 "learnable decision"。

2.2 Agentic Memory:从 log 到 evolving knowledge

RAG 处理的是相对静态的外部语料。Agentic memory 要解决的是一个更难的问题:agent 自己的交互历史怎么变成可复用的知识

关键区别在于:agent memory 不只是"存下来再查",而是需要持续演化。

看一下这条技术线的演进:

  • MemoryBank / RET-LLM (Zhong et al., 2024; Modarressi et al., 2023):最早的做法,对对话历史做摘要存下来
  • HippoRAG (Gutiérrez et al., 2024):引入 knowledge graph 结构,让记忆之间有 relation
  • A-MEM (Xu et al., 2025):不只是存储,而是让 memory 自己去合并、裂变、重组
  • Synapse (Zheng et al., 2024) / SCM (Wang et al., 2024):引入 self-reflection 和 memory blending

这里最值得注意的 insight 是:区分一个 agentic memory 系统是不是真正有价值的,关键不在于它怎么存,而在于它怎么"忘"和怎么"变"。

单纯存得多没有用,甚至有害。一个 agent 跑 1000 轮之后,如果不做 memory evolution(选择性遗忘、冲突消解、抽象化),它的 memory 就会退化成一个高噪声的 log——这几乎必然拖垮 query 质量。

Reflexion (Shinn et al., 2024)、BoT (Yang et al., 2024) 和 ReAct (Yao et al., 2022) 代表了另一条相关的线:让 agent 对自己的经验做 reasoning 和 self-reflection,把"经历"变成"教训"再存入 memory。这比 raw experience replay 有效得多。


3. KV Cache Memory:一个被低估的系统问题

3.1 四条技术路线与它们的 OS 对应物

这是我个人觉得这篇综述整理得最有价值的一节。KV cache 的工作数量爆炸式增长,但如果你站远一步看,几乎所有方法都可以映射到操作系统或数据库里的经典问题:

KV Cache 方法类别 OS/DB 对应概念 代表工作
Eviction & dropping Page replacement (LRU/LFU) H₂O, StreamingLLM, FastGen, NACL
Merging & compression Data deduplication / compaction CaM, D2O, similarity-based merge
Quantization & low-rank Lossy compression / tiered storage KIVI, KVQuant, Gear
System-aware allocation NUMA-aware / disaggregated memory vLLM PagedAttention, Mooncake

H₂O (Zhang et al., 2023) 本质上做的事情是:统计每个 token 在过去所有 attention 计算中被关注的累积分数,优先保留"重度命中"的 token。这几乎就是 LFU (Least Frequently Used) 的翻版。

StreamingLLM (Xiao et al., 2024) 更有意思:它发现"第一个 token 的 attention sink 现象"——模型总会把一些 attention 分配给第一个 token,不管内容是什么。于是它永久保留前几个 token + 最近几个 token 的 KV,中间全部丢掉。这本质上就是 pinned pages + sliding window

QUEST (Tang et al., 2024) 和 TokenSelect (Wu et al., 2025) 走的是 query-dependent selection:不是对所有 query 用同一套 cache,而是每次 attention 计算只选择和当前 query 最相关的 KV subset。这非常接近 demand paging——只有被"访问"到的 page 才加载进来。

3.2 为什么我说 KV cache 不只是"推理优化"

很多人会把 KV cache 压缩归类到"推理加速"里。但从这篇综述的视角看,它其实在回答一个更本质的问题:

当 context 越来越长,模型内部的 working memory 该怎么管理?

考虑一个实际场景:一个 agent 在执行 100 步的长任务。每步生成都需要 attend to 前面所有步骤的 KV cache。到第 80 步时,可能 step 3-20 的信息完全不会再被用到了,但 step 45 的关键决策需要一直被记住。

这时候 KV cache management 面对的就不是"压缩"问题,而是一个真正的在线内存管理问题——你需要在 latency constraint 下做出 evict/keep/merge 的实时决策,而且这个决策的质量直接决定了 agent 后续推理的正确性。

Table 1 给出的判断非常精准:Intermediate latent memory 的核心瓶颈在 update(什么时候丢什么),而不是 construction 或 query。

Decision matrix

3.3 Steering Vectors:一种被低估的"行为记忆"

这篇综述还把 steering vectors 归入了 intermediate latent memory,我觉得这个归类相当有洞察。

Steering vectors 是什么?简单说就是一组方向向量,注入到模型中间层的 activation 里,可以持续改变模型的行为倾向(比如让它更 truthful、less toxic、或者更像某个 persona)。

演进路线:

  • PPLM (Dathathri et al.):最早的尝试,用梯度引导 hidden states
  • Turner et al., 2023:contrastive 方法——用"好行为"和"坏行为"的 activation 差作为 steering direction
  • Arditi et al., 2024:把 refusal behavior 定位到具体的 steering direction 并移除
  • Hernandez et al., 2023:optimization-based,用单个样本就能学出 steering vector

为什么说它是"行为记忆"?因为 steering vector 本质上编码的是持久的行为偏好(不是事实知识),以一种不需要在每次推理时重新指定的方式存在于模型里。它和 KV cache 的区别是:KV cache 存的是"当前会话的上下文状态",steering vector 存的是"跨会话的行为倾向"。

但 steering vector 目前的局限也很明显:contrastive method 依赖精心构造的对比数据,很容易捕获到 spurious correlation 而非 causal direction。这也是为什么 probe-based 和 low-shot 方法(Li et al., 2024; Cao et al., 2024)在尝试解决鲁棒性问题。


4. Parameter-level Memory:写入成本决定了研究格局

4.1 为什么这条线的工作最"碎"

如果你看参数层面的 memory 工作,会发现一个有趣现象:研究方向极其分散——continual learning、knowledge editing、PEFT、model merging、task arithmetic 都算,但大家之间几乎不互引。

原因在于:参数写入的成本太高了,没有任何一个方法能做到"对所有类型的知识都通用",于是每种方法都只能在自己的 niche 里深耕:

  • EWC / TaSL / POCL:防灾难性遗忘——先算哪些参数对旧知识重要,再限制这些参数的更新幅度
  • Knowledge editing (ROME, MEMIT):精准改一个事实,但只能处理"单跳事实",multi-hop 效果就崩
  • LoRA / PEFT:轻量级适配,但本质上是在编码 task-specific bias,不是 factual memory
  • Model merging (TIES, DARE, Model Breadcrumbs):把多个 fine-tuned model 合成一个,用参数空间的向量运算解决

这些方法看似差异巨大,但如果用这篇综述的框架来看,它们都在回答同一个问题:

如何在不破坏已有能力的前提下,让参数空间对新信息产生可控的、局部的响应。

4.2 Task Arithmetic 与 Model Merging:参数空间的"向量记忆"

这里面我觉得最有启发性的方向是 task arithmetic(Ilharco et al., 2023)。

它的核心思想很简单但很漂亮:把 fine-tuning 后的模型减去 base model,得到一个"任务向量"(task vector)。这个向量可以被加减组合——加上它就获得某种能力,减去它就移除某种能力

这意味着参数 memory 在某种意义上可以被"可编辑化"了。你不需要重新训练,只需要做向量运算就能组合多种知识。

当然,现实没这么美好。Task vector 之间会有 interference(两个任务向量加在一起可能互相抵消),这也催生了 TIES(修剪冲突参数)、DARE(随机 drop 低幅度参数)等后续工作。

但方向是对的:让参数层面的写入变得更 composable、更 reversible,是参数 memory 最有前景的演进方向之一。


5. 三层之间的真正 insight:瓶颈转移定律

如果你把上面三节的分析放在一起看,会发现一个非常有意思的规律:

Memory 的写入成本和查询成本成反比。写入越便宜的 memory,查询越贵;写入越贵的 memory,查询越廉价。

具体来说:

  • Token memory:写入几乎无成本(直接存文本),但查询极贵(要在海量文档中精确检索)
  • KV cache:写入成本中等(forward pass 自然产生),但维护成本高(要不断 evict/merge/compress)
  • Parameter memory:写入极贵(需要 fine-tune 或 editing),但查询几乎为零(推理时自动激活,不需要额外检索步骤)

这不是巧合。这和计算机体系结构里的 存储层次 (memory hierarchy) 规律完全一致:寄存器快但小且贵,DRAM 大但慢,磁盘最大最便宜但最慢。

所以论文给出的 practical guideline 非常实用:

设计指南

翻译成工程语言就是:

  • 频繁变动的信息 → token memory(向量库、RAG)
  • 会话内的推理状态 → KV cache(intermediate latent)
  • 稳定的长期知识 → 参数(fine-tune、model merge)

一个健壮的 LLM agent 系统,最终一定是多层 memory 的组合,就像操作系统同时有 L1/L2 cache、RAM、SSD 一样。问题只是:谁来做跨层的 routing 和 scheduling。


6. 未来方向:不是更 fancy 的方法,而是更成熟的系统思维

6.1 跨层 Memory Routing 与联合调度

目前几乎所有系统都是各层独立工作:RAG 是一套检索逻辑,KV cache 有自己的 eviction policy,参数更新走单独的 fine-tuning pipeline。三者都在试图让模型"记住对的信息",但没有人在做统一的调度

想象一下:如果一个 agent 发现某条信息被 RAG 检索了 50 次,是不是应该考虑把它"下沉"到 KV cache(prefix caching)甚至直接 consolidate 到参数里?反过来,如果某个参数化的知识过时了,是不是应该"浮上来"到 token memory 层用新数据覆盖?

这就是 memory tiering——数据库和存储系统里早就成熟的东西,但在 LLM 领域几乎没有工作在认真做。

6.2 从 OS 借鉴的不只是 eviction policy

这篇综述在 Appendix C 明确指出了三个跨学科迁移方向:

  1. OS page management → KV cache:不只是 LRU/LFU,还有预取(prefetch)、copy-on-write、huge pages 等概念都有对应
  2. 数据库 query optimization → RAG query:Cost-based optimizer、query plan selection、materialized view 都可以借鉴
  3. 分布式系统 → 多节点 memory 协同:Mooncake、DistServe 这类工作已经开始把 KV cache 做成 disaggregated service

最有潜力的方向可能是 "LLM memory 也该有 garbage collector"。目前 agent memory 几乎都是 append-only 的——信息只增不减(或者简单地按时间丢弃)。但一个真正长期运行的 agent 需要类似 GC 的机制:定期检测 unreachable 或 contradicted 的记忆碎片并回收。

6.3 Unified Training–Inference:模糊训练和推理的边界

这是最激进但也最有前景的方向。

目前 LLM 的训练和推理是严格分离的:训练时学知识,推理时只能读。但长期运行的 agent 必然需要在使用过程中不断学习新东西。

  • Continual learning(EWC, TaSL)已经在做这件事,但成本太高
  • PEFT + online fine-tuning 能做轻量级适配,但精度有限
  • Memory consolidation——像人类睡眠时做的那样,把 episodic memory 定期整合进 semantic memory(参数)

未来可能出现的架构:agent 在推理时用 token memory + KV cache 做"快思考",定期(比如空闲时)把高频使用的 memory pattern consolidate 成参数更新,实现真正的"学习-使用"闭环。


7. 看完之后的一些个人 take

  1. Memory research 的下一个爆发点不在任何单层,而在跨层协同。谁先把 memory routing 做好,谁就定义了下一代 agent 基础设施。

  2. KV cache 方向已经进入"方法论内卷期"。eviction + merging + quantization 排列组合可以无限水文章,但真正有影响力的下一步应该是 system-level memory management(像 vLLM PagedAttention 那样改变整个范式的东西)。

  3. Agentic memory 的关键不在"记住"而在"忘记"和"重组"。A-MEM、Synapse 这类做 memory evolution 的工作比单纯做 memory bank 有前途得多。

  4. Steering vectors 作为"行为记忆"被严重低估了。如果未来每个 user 的 persona preference 都能编码成一个 steering vector 并在推理时注入,这就是真正 zero-cost 的个性化——不需要 per-user fine-tuning。

  5. 系统领域的同学应该认真看 LLM memory。这里面大量问题(cache replacement、tiered storage、query optimization、garbage collection)都是你们已经解决过的——只是换了个 domain。


写到这里差不多了。如果让我用一句话总结这篇综述给我最大的启发:

LLM memory 不是一个功能模块的设计问题,而是一个完整的存储系统设计问题——带着所有存储系统该有的层次、调度、一致性和生命周期管理。

谁先用系统的视角去设计 memory,谁就能做出真正能长期运行的 agent。