惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Tailwind CSS Blog
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
L
LangChain Blog
博客园_首页
Recent Announcements
Recent Announcements
月光博客
月光博客
酷 壳 – CoolShell
酷 壳 – CoolShell
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
H
Hackread – Cybersecurity News, Data Breaches, AI and More
爱范儿
爱范儿
博客园 - 叶小钗
博客园 - 【当耐特】
The Cloudflare Blog
J
Java Code Geeks
G
Google Developers Blog
云风的 BLOG
云风的 BLOG
Blog — PlanetScale
Blog — PlanetScale
博客园 - 司徒正美
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
2025年终复盘:强化学习的第一性原理与超越LLM的智能终局/2
Echo想要全链跑通 · 2025-12-21 · via 人人都是产品经理

LLM的繁荣背后,隐藏着怎样的认知局限?强化学习之父理查德·萨顿直指当前大语言模型的核心缺陷——它们只是人类行为的模仿者,而非世界的理解者。本文深度解析萨顿对于智能本质的犀利批判,揭示强化学习为何才是通往AGI的真正路径,以及未来AI发展必须跨越的认知鸿沟。

理查德·萨顿:超越模仿——为何LLM不是智能的终局

书接上回,上一篇我们深入剖析了安德烈·卡帕西(Andrej Karpathy)对于大语言模型(LLMs)工程化落地与软件2.0的实践视角,展现了当前AI领域最强劲的“实证派”力量。然而,在AI的另一端,作为强化学习(Reinforcement Learning, RL)的鼻祖、DeepMind的灵魂人物之一,理查德·萨顿(Richard Sutton)在2025年9月27日的最新访谈中,对当前的LLM热潮也泼下了一盆冷水。

与卡帕西关注“如何让当下的模型更好用”不同,萨顿关注的是“什么是真正的智能”。在这份访谈中,他基于第一性原理,对以Transformer和Next-token prediction(下一词元预测)为核心的主流范式提出了严厉的认识论批判,并重申了强化学习才是通往通用人工智能(AGI)的唯一路径。

一、对LLM范式的本体论批判:模仿并非理解

萨顿的核心论点在于区分“模仿(Imitation)”与“理解(Understanding)”。他认为,目前基于大规模文本训练的LLM,本质上是对人类行为的概率拟合,而非对物理世界的因果建模。

1. 缺乏“基本事实(Ground Truth)”与目标导向

内在机制缺陷:LLM的训练目标是最小化预测误差(Predicting the next token),这是一种内部的一致性检查,而非外部的效用验证。萨顿指出,单纯的“预测下一个词”并不能构成对现实世界的改变,因此不算作具有“目标(Goal)”。引用约翰·麦卡锡的定义,智能必须包含实现目标的能力。

无法验证真伪:在LLM的框架下,不存在客观的“正确”。模型只是输出了训练语料中概率最高的回答。而在强化学习框架中,行为的正确性由环境反馈的奖励(Reward)这一客观信号决定。缺乏Ground Truth导致LLM无法在没有人类反馈(RLHF)的情况下进行自我纠错和持续学习。

2. 拟人而非拟物(Modeling Humans vs. Modeling the World)

LLM学习的是“人类在特定情境下会说什么”,这构建的是一个“人类行为模型”。

真正的智能需要构建“世界模型(World Model)”,即预测“我的物理/社会行为会引发环境发生什么变化”。LLM能预测对话的走向,但无法预测行为的物理后果,因此它们是被动的观察者,而非主动的行动者(Agent)。

二、强化学习:智能的唯一公理化定义

萨顿坚守强化学习并非仅仅是一种算法,而是智能定义的本身。他将智能解构为“感知-行动-奖励”的闭环流。

1. 时序差分学习(TD Learning)与价值函数

针对长周期任务(如创办公司、解决科学难题),奖励信号极其稀疏。萨顿强调,时序差分学习是解决这一问题的核心机制。

价值函数(Value Function):作为对未来累积奖励的预测,价值函数将长期目标折现为当前的决策依据。

内在奖励:当智能体的状态评估(Value estimate)提升时(例如在棋局中获得优势),这种评估的提升本身即构成一种内在奖励。这种机制允许智能体在缺乏外部即时反馈的情况下,依然保持目标导向。

2. 智能体的完备架构

萨顿指出,仅仅有“策略(Policy,即LLM所充当的角色)”是不够的。一个完备的AGI系统必须包含四个解耦的组件:

  1. 感知(Perception):状态表征。
  2. 策略(Policy):行为选择。
  3. 价值函数(Value Function):长期利益评估。
  4. 世界模型(Transition Model):因果推演与规划。

三、 “惨痛的教训(The Bitter Lesson)”在2025年的回响

萨顿曾提出的“惨痛的教训”理论——长期来看,利用算力的通用方法(搜索与学习)总是战胜利用人类先验知识的方法——在当前语境下被赋予了新的含义。

1. LLM实际上违背了“惨痛的教训”

虽然LLM利用了海量算力,但萨顿认为它们陷入了新的陷阱:过度依赖人类产生的数据

LLM的上限被人类互联网文本的总量和质量所锁死。

真正符合“惨痛的教训”的系统,应当是像AlphaZero一样,通过自我博弈和环境交互产生数据。萨顿预测,未来能够直接从经验(Experience)中生成数据并学习的系统,将在性能上超越受限于人类语料库的LLM。

2. 知识获取的路径依赖

研究人员倾向于将人类知识(如语法规则、逻辑模板、文本数据)硬编码进系统,因为这能带来短期的性能提升。但这种做法最终会成为瓶颈,阻碍系统发现超越人类理解范畴的新策略。

四、生物学启示:拒绝“人类中心主义”

萨顿激烈反对将人类语言作为智能核心的观点,并提出“松鼠测试”:

松鼠即智能:如果我们能完全理解一只松鼠如何在复杂的三维环境中生存、跳跃、寻找食物(即感知运动控制与规划),我们就解决了智能95%的问题。

语言仅是表层:语言只是建立在深层感知运动智能之上的一层薄薄的“饰面”。

主动探索(Active Learning):生物界的学习从未是监督学习(Supervised Learning)。没有动物是通过被喂养标注好的数据集来学习的。所有的生物学习都是基于“试错(Trial and error)”和“预测-观察偏差”的主动探索过程。

五、演替(Succession):从“复制”到“设计”

针对AI的未来,萨顿提出了“演替”的概念,这是一个超越人类生存焦虑的宏大视角。

1. 宇宙级的相变

萨顿将AI的出现视为宇宙演化的一个阶段性跃迁:从“复制者时代”(Replication,通过DNA变异和自然选择进行低效迭代)进入“设计者时代”(Design,智能体可以理解自身构造并进行有目的的自我改进)。

2. 数字智能的特有风险:精神腐败(Mental Corruption)

不同于物理毁灭,萨顿提出了一个关于AI安全的新颖观点: 当一个AI系统通过分身(Copies)并行学习后重新融合时,如果不加辨别地引入外部错误信息或有害策略,会导致主体思维的瓦解。这种“认知污染”是数字智能在实现知识指数级扩张时必须解决的内生性安全问题。

本文由 @Echo想要全链跑通 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议