惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
The GitHub Blog
The GitHub Blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
小众软件
小众软件
博客园_首页
G
Google Developers Blog
Apple Machine Learning Research
Apple Machine Learning Research
MyScale Blog
MyScale Blog
Engineering at Meta
Engineering at Meta
Jina AI
Jina AI
酷 壳 – CoolShell
酷 壳 – CoolShell
人人都是产品经理
人人都是产品经理
B
Blog RSS Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
D
Docker
B
Blog
雷峰网
雷峰网
WordPress大学
WordPress大学
Stack Overflow Blog
Stack Overflow Blog
宝玉的分享
宝玉的分享

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
告别“刷榜”时代:Meta 新范式重构 AI Agent 的“中训练”机制
静观AI · 2025-12-19 · via 人人都是产品经理

2025年的AI赛道正经历一场范式革命,从参数竞赛转向Agent任务能力的实战检验。Meta最新研究《Agent Learning via Early Experience》提出的'中训练'范式,通过'早期经验'和'自我反思'机制,正在解决智能体训练中最棘手的反馈匮乏问题。本文将深度解析这一突破性技术如何重构Agent训练路径,以及它为何能令7亿参数的小模型击败十倍规模的对手。

在 2025 年的 AI 赛道上,风向已经发生了根本性的逆转。行业巨头们不再执着于单纯的参数跑分,而是将目光投向了 Agent(智能体)的任务完成能力 。从 xAI 到 Anthropic,大家都在追逐同一个圣杯:如何让 AI 自主完成复杂的长程任务 。

然而,现实与理想之间存在巨大的鸿沟。除了编程辅助等少数领域,通用 Agent 在真实业务场景中的落地应用依然寥寥无几 。

Meta 在 2025 年 10 月发布的最新论文《Agent Learning via Early Experience》或许为打破这一僵局提供了新的思路。这篇文章提出了一种介于预训练和后训练之间的“中训练”(Mid-training)范式,试图解决 Agent 训练中最大的瓶颈——反馈机制的匮乏

一、当前困局:两条“瘸腿”的主流路径

要理解 Meta 的新解法,首先需要复盘当前 Agent 训练面临的核心痛点。目前主流的 Agent 后训练方法主要有两种,但它们在面对真实世界的复杂任务时,都存在难以克服的“昂贵代价” 。

1. 模仿学习(SFT):知其然,不知其所以然

第一种路径是监督微调(SFT),即模仿学习 。这种方法类似于让学生死记硬背标准答案,Agent 模仿人类专家的操作轨迹 。

局限性: 这种反馈是静态的。它只告诉模型“应该做什么”,却从不教它“如果不这么做会有什么后果” 。

后果: 模型无法建立行为与结果之间的因果联系,泛化能力极差 。一旦遇到训练数据之外的边缘情况,Agent 就会因为缺乏对环境的理解而束手无策。

2. 强化学习(RL):依赖完美的“上帝视角”

第二种路径是强化学习,依赖环境反馈的奖励(Reward)信号进行试错 。

局限性: RL 极其依赖清晰、即时且可验证的奖励信号。但在网页浏览、多步工具调用等真实场景中,奖励往往是缺失、稀疏或极度延迟的 。

后果: 在缺乏成熟模拟器和标准化重置机制的真实环境中,RL 训练不仅低效,而且极不稳定 。

这就导致了一个尴尬的行业现状:简单的方法(SFT)不够强,强大的方法(RL)在落地时用不了

二、破局之道:“中训练”与早期经验

Meta 提出的“中训练”范式,核心在于利用“早期经验”(Early Experience)来搭建一座桥梁 。

核心洞察:无需奖励的“自监督”

Meta 的研究人员认为,即便没有外部奖励,Agent 自身与环境交互产生的状态变化,本身就是一种极具价值的监督信号 。 与其依赖昂贵的专家数据或稀缺的奖励信号,不如让 Agent 先去“试错”。通过观察“如果我这样做,环境会发生什么变化”,Agent 可以低成本地习得世界的运行规律 。

为了实现这一理念,论文设计了两种具体的训练策略:

策略一:隐式世界建模 (Implicit World Modeling, IWM)

这是一种让 Agent 学习预测未来的机制 。

  • 训练逻辑: 在专家轨迹的每一个节点,让 Agent 生成多种备选动作,并在环境中执行,记录下这些动作带来的真实后果 。
  • 能力构建: 模型并非直接学习“动作”,而是学习“当前状态+动作 -> 未来状态”的预测能力 。
  • 实际意义: Agent 开始理解操作的后果。例如在文件管理任务中,它通过尝试明白 rm 命令是删除而不是移动,从而建立起因果认知 。

策略二:自我反思 (Self-Reflection, SR)

这是一种让 Agent 学习“专家思维”的机制 。

  • 训练逻辑: 利用强大的 LLM 作为“教练”,对比专家动作和 Agent 的备选动作,生成详细的解释 。
  • 能力构建: 训练 Agent 在决策前先生成“反思内心独白”,解释为什么专家的选择在权衡效率、约束条件后是最优解 。
  • 实际意义: 将简单的“输入-输出”映射转化为“输入-推理-输出”的深度思考模式。例如在购物场景中,Agent 能学会不仅要考虑颜色偏好,还要同时通过预算限制来筛选商品 。

三、 效果验证:小参数量也能跑赢大模型

“早期经验”范式的有效性在多个维度的测试中得到了验证。

  • 性能提升: 在涵盖网页浏览、工具使用等 8 个多样化环境的测试中,该方法比传统模仿学习的成功率平均提升了 9.6% 。
  • 泛化与潜力: 在未见过的任务上,表现提升了 9.4%;且作为强化学习的初始化阶段,它能让后续的 RL 训练最终性能提升最多 6.4% 。

更值得关注的是参数效率。实验显示,通过这种自我递归和反思训练,一个仅 7 亿(700M)参数的小模型,在某些任务上甚至能超越参数量大其十几倍的模型 。这表明,通过优化训练深度,我们能挖掘出模型中大量“冗余参数”的潜力 。

四、理论支撑:通用 Agent 必须拥有“世界模型”

Meta 的这项工程创新,实际上与 Google DeepMind 在 2025 年 ICML 上发表的理论研究《General agents contain world models》遥相呼应 。

DeepMind 的研究证明:任何能够处理多步骤复杂任务的 Agent,其内部必须拥有一个精确的“世界模型”

  • 传统的模仿学习之所以脆弱,是因为它只学到了浅层的行为映射,而没有建立对环境运行规律的理解 。
  • Meta 的“早期经验”本质上是在补课。它迫使 Agent 在正式决策前,先建立起对“因果”和“未来”的预测模型 。

五、行业启示:三段式训练与 Scaling Law 的新方向

这篇文章对 AI 产品经理和研发人员有两个重要的启示:

1. 训练范式的重构:从二段式到三段式

未来的 Agent 训练流程可能会演变为标准的“三段式” :

  • 预训练 (Pre-training): 学习语言与基础知识。
  • 中训练 (Mid-training): 通过“早期经验”建立因果模型,理解世界运行规律 。
  • 后训练 (Post-training): 在具体任务中优化策略 。 这种循序渐进的路径,可能是通往通用 Agent 的必经之路 。

2. Test Time Compute 的前置化

GPTo1 开启了 Test Time Compute(测试时计算)的新时代,即通过增加推理时的计算深度来换取智能 。Meta 的研究表明,这种“深度”可以前置到训练阶段。通过隐式世界建模和自我反思,我们实际上是在让模型在训练期就进行大量的“思维演练” 。

这预示着一种新的 Scaling Law:与其无休止地堆砌参数,不如通过更高效的训练机制(如中训练),激活模型中沉睡的神经元,追求参数效率的极致 。

总结: AI Agent 的竞争已不再是单纯的数据量或模型规模的比拼。Meta 的“中训练”范式告诉我们,让 Agent 学会“观察后果”和“反思差异”,或许比单纯的喂养数据更为关键。对于从应用层切入的开发者而言,构建低成本的环境交互反馈机制,将是提升 Agent 实战能力的核心壁垒。

本文由 @静观AI 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议