惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
云风的 BLOG
云风的 BLOG
小众软件
小众软件
V
V2EX
博客园 - Franky
博客园 - 司徒正美
Apple Machine Learning Research
Apple Machine Learning Research
量子位
博客园 - 【当耐特】
雷峰网
雷峰网
WordPress大学
WordPress大学
Jina AI
Jina AI
Google DeepMind News
Google DeepMind News
N
Netflix TechBlog - Medium
爱范儿
爱范儿
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
阮一峰的网络日志
阮一峰的网络日志
IT之家
IT之家
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
Visual Studio Blog
Microsoft Security Blog
Microsoft Security Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
别迷信1M - 少数派
2026-04-27 · via 少数派

这次发生了什么

2026 年 4 月 26 日,Yoav Goldberg 在 X 上做了一个很直观的粗算:如果按 40 层、每层 4000 维、每维 2 bytes 估算,单个 token 相关的推理内存会到约 640k,1M token 则会到约 640GB。基于这个量级,他直接提出疑问:长上下文推理在内存上到底是怎么成立的。

同一天,Chelsea Finn 预告自己将在 ICLR 的 MemAgents workshop 分享一个题为“long-term memory for long-term autonomy”的报告。注意她强调的是“长期记忆”和“长期自治”,不是更长的聊天窗口。

这两条信息放在一起,刚好点出一个常被混在一起的概念:上下文窗口变长,和系统真正具备长期记忆能力,不是一回事。

为什么这件事值得关心

过去一段时间,很多模型宣传都会把“1M context”当作显著卖点。这个指标当然重要,因为它决定单次会话里能塞进多少材料。但对真实工作流来说,用户真正关心的通常不是“能装多少”,而是另外三件事:

  • 装进去之后,模型能不能稳定找到关键内容
  • 这么做的推理成本和延迟是否可接受
  • 跨多轮、跨多任务之后,系统是否还能保留有用记忆

Yoav 的粗算价值,不在于它已经证明了什么工程结论,而在于它把宣传数字重新拉回了底层账本。哪怕这个估算没有覆盖所有优化手段,仅从量级直觉看,也足以说明长上下文背后不是“白来的能力”,而是伴随明显系统代价。

真正重要的判断是什么

真正重要的判断是:长上下文更像“大工作台”,长期记忆才更像“档案系统”。前者解决的是单次任务里可见信息不够的问题,后者解决的是系统如何在长周期内保留、更新、检索和遗忘信息。

这也是为什么很多 Agent 场景里,只堆大窗口并不能自动换来长期自治。一个能长期工作的系统,往往还需要明确的 memory architecture,包括什么该持久化、什么该摘要、什么该丢弃、什么时候检索旧信息,以及如何避免旧记忆污染当前决策。

如果把这两件事混为一谈,团队很容易高估“更长 context”对产品能力的实际提升,低估记忆设计、成本控制和检索策略的复杂度。

我建议怎么理解和应对

如果你在做 Agent、Copilot 或长流程自动化,这里有几个更实用的判断标准:

  • 不要只问模型支持多少上下文,要追问长输入下的延迟、成本和召回稳定性。
  • 不要把“能放进去”当成“能记得住”,要单独评估跨任务记忆是否可靠。
  • 产品设计上,优先区分临时上下文、会话摘要和长期记忆库三层,而不是把所有东西都塞进同一个窗口。
  • 采购或选型时,把“窗口大小”从宣传指标改成系统指标,和真实任务成功率一起看。

1M 上下文当然有价值,但它真正提示行业的,不是“记忆问题已经解决”,而是大家开始更频繁地碰到底层账本。对从业者来说,下一步更该关注的不是窗口数字本身,而是系统究竟如何记、如何忘、如何在成本可控的前提下长期工作。 #长上下文 #长期记忆 #AIAgent #LLM #Autonomy