惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Jina AI
Jina AI
T
Threat Research - Cisco Blogs
量子位
Last Week in AI
Last Week in AI
aimingoo的专栏
aimingoo的专栏
Martin Fowler
Martin Fowler
F
Fortinet All Blogs
爱范儿
爱范儿
D
Docker
人人都是产品经理
人人都是产品经理
S
SegmentFault 最新的问题
Microsoft Azure Blog
Microsoft Azure Blog
B
Blog RSS Feed
A
About on SuperTechFans
P
Proofpoint News Feed
博客园 - 司徒正美
Recent Announcements
Recent Announcements
I
InfoQ
Hugging Face - Blog
Hugging Face - Blog
Microsoft Security Blog
Microsoft Security Blog
有赞技术团队
有赞技术团队
Webroot Blog
Webroot Blog
云风的 BLOG
云风的 BLOG
Vercel News
Vercel News
SecWiki News
SecWiki News
Attack and Defense Labs
Attack and Defense Labs
Hacker News: Ask HN
Hacker News: Ask HN
AI
AI
博客园_首页
腾讯CDC
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Recorded Future
Recorded Future
T
Tailwind CSS Blog
MyScale Blog
MyScale Blog
T
Tenable Blog
宝玉的分享
宝玉的分享
Google Online Security Blog
Google Online Security Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
S
Secure Thoughts
C
Check Point Blog
S
Security Affairs
L
LINUX DO - 最新话题
大猫的无限游戏
大猫的无限游戏
Scott Helme
Scott Helme
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Hacker News - Newest:
Hacker News - Newest: "LLM"
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
月光博客
月光博客
Y
Y Combinator Blog

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
具身大模型R1时刻:LIBERO终结者,99.9%背后的物理推理新范式
思邈 · 2026-05-11 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-11 09:51:36 来源:量子位

真正学会了在隐空间里进行“物理思考”

允中 发自 凹非寺

量子位 | 公众号 QbitAI

机器人拉个拉链,到底需不需要“脑子”?

过去几年,从OpenVLA到π0、π0.5,具身大模型已经能让机器人把指令和动作连得有模有样。

但一旦包的位置挪了几厘米,或者光照暗了一点,它们往往就会“大脑宕机”。

究其原因,是因为这些机器人大多在玩“连连看”:看到观察结果,直接输出动作。

它们只是记住了轨迹,却并不理解背后的物理逻辑。

现在,一种让机器人“先想明白,再稳定行动”的新范式来了。

由至简动力、北大、港中文联合提出的LaST-R1,首次将隐空间物理推理塞进了强化学习的闭环。

同时,LaST-R1作为LaST₀基座模型的物理世界后训练范式,LaST₀首创面向机器人的隐空间物理思维链推理,并已中稿ICML2026 Spotlight(top 2.2%)。

它的表现有多夸张?

  • 仿真满分级别:在LIBERO benchmark上,仅靠1条轨迹预热,平均成功率就冲到了99.9%
  • 真机性能起飞:在真实抓取、旋转等复杂任务中,比目前最强的SOTA模型π0.5还要高出22.5%
  • 强化“物理推理”:即便换了物体、背景或光照,它依然能稳如老狗,不再是单纯的动作复刻,而是真正学会了在隐空间里进行“物理思考”。

这个让机器人长出“物理脑”的LaST-R1,到底是怎么炼成的?

那个让环境反馈同时优化“怎么想”和“怎么动”的LAPO算法又藏着什么玄机?

我们顺着这篇论文,深挖了一下这套能让机器人“深思熟虑”的后训练黑科技。

具身大模型的隐形天花板:只会模仿,不懂物理

尽管从OpenVLA到π0.5,具身大模型已经完成了图像、语言与动作的初步对齐。

但在实际落地中,工业界发现了一个致命的“幻觉”:

能模仿,不等于能在物理世界泛化。

这就导致了极差的泛化性。

打个比方,机器人可能记住了100种拉拉链的轨迹,但只要拉链的角度偏转15度,或者光照发生变化,单纯靠“观察→动作”的端到端映射就会失效。

核心问题在于,现有的VLA模型缺少一个“思考”的中间层——即让机器人在行动之前,对物理世界进行推理。

过去,学术界也曾尝试引入思维链(CoT)来解决推理问题。

但对于机器人操作而言,语言推理往往太慢且颗粒度太粗,你很难用文字精准描述“拉链咬合时的细微阻力反馈”。

LaST-R1的核心突破,就是放弃了低效的语言CoT,转而在隐空间(Latent Space)中构建物理推理链。

它不再让机器人看到图像就“闭眼”出动作,而是先在隐性空间里建模场景的结构、物体的物理关系以及未来的动态变化。

然而,要让机器人学会这种“思考”,仅靠静态的模仿学习(SFT)是不够的。

目前的强化学习(RL)方法大多像是一个只看结果的严厉教练:它只告诉机器人动作成没成功(优化Action Space),却无法指导机器人“刚才那下你是怎么想的”。

针对这一痛点,该团队提出的LAPO(Latent-to-Action Policy Optimization)算法,正式将“思考过程”拉进了强化学习的优化闭环。

它让环境反馈不仅优化动作,也优化机器人行动前的“物理思考”。

不只练“手”更要修“脑”:如何让机器人强化模型的物理推理?

近日,至简动力、香港中文大学、北京大学计算机学院多媒体信息处理国家重点实验室,提出了一种面向机器人操作的自适应物理隐空间推理强化学习框架——

LaST-R1(Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning)。

它希望通过强化学习后训练,让具身大模型不仅学会生成动作,也学会在行动前,进行面向物理世界的隐空间推理。

△LaST-R1概览

  • (a) 不同于仅严格优化动作的 vanilla RL 基线方法,
  • (b) 我们的方法利用 LAPO 联合优化自适应 latent CoT 与物理执行过程。通过连接认知推理与控制,LaST-R1 实现了
  • (c) 更快的收敛速度、更高的仿真成功率,
  • 以及 (d) 更强的真实世界泛化能力。

与以往主要优化action space(动作空间,即机器人所有可执行指令的集合)的具身大模型RL不同,LaST-R1的核心思想是:

机器人不应只从图像和指令直接预测下一步动作,而应先在latent space(隐空间,可以理解为机器人大脑里的“隐性认知层”)中理解场景结构、物体关系和物理动态,再生成更稳定、精准的动作。

换句话说:

LaST-R1不只优化机器人的“手”,也优化它的“脑”。

具体来看,LaST-R1构建了一个面向latent reasoning-before-acting策略的强化学习后训练框架,核心由三步组成:

1、物理隐空间推理建模(Physical Latent Reasoning)

  • 传统具身大模型往往直接从observation生成action,动作前缺少可建模、可优化的物理推理过程。
  • LaST-R1在模型推理中引入latent CoT:生成动作前,先在latent space中建模当前场景、物体关系和未来物理动态。
  • 相比语言推理,latent reasoning更适合承载连续、高频、难以语言化的物理信息。

2、隐空间推理与动作生成的联合强化优化(Latent-to-Action Policy Optimization)

  • 传统具身大模型RL多数只优化动作结果:哪个action带来更高reward,就强化哪个action。
  • LaST-R1提出LAPO,把环境奖励同时作用于latent reasoningaction generation:成功轨迹不仅强化正确动作,也强化动作之前的“好推理”;失败轨迹不只修正动作结果,也反向调整内部物理推理空间。
  • 让reward真正塑造动作背后的reasoning process。

3、自适应latent CoT推理机制(Adaptive Latent CoT)

  • 不同任务决策需要不同长度的思考。
  • LaST-R1引入adaptive latent CoT:简单状态下,模型可以快速结束推理并执行;拉拉链、擦花瓶、拧瓶盖等复杂接触式操作,则分配更长reasoning horizon。
  • 在交互中学会:什么时候该多想,什么时候该立刻执行。

LaST-R1改变的是具身大模型后训练的优化对象:从只优化动作,转向同时优化动作背后的物理推理。

研究团队在仿真和真机环境中都进行了系统验证。

在仿真LIBERO benchmark上,LaST-R1仅依赖1条轨迹完成warm-up,随后通过在线RL优化,最终取得99.9%平均成功率,并相比Action-Only+PPO展现出更快收敛和更高最终性能。

在真机部署中,LaST-R1仅使用30条轨迹warm-up,再通过RL后训练将平均成功率从52.5%提升到93.75%,显著超过使用100条专家轨迹的π0.5(71.25%)。

更重要的是,在真实扰动条件下,LaST-R1仍保持较小性能下降,说明其学习到的不是单一场景中的动作轨迹,而是更可迁移的空间语义和物理动态理解。

上述结果意味着,具身大模型强化学习的重点正在发生变化——

机器人不再只是通过RL学会更熟练地执行动作,而是开始通过RL学会更合理地进行物理推理。

LaST-R1的意义,在于它提出了一种新的具身大模型后训练范式,能够让环境反馈同时塑造机器人的“思考方式”和“行动方式”。

一旦隐空间推理从模仿学习的“静态脚本”进化为强化学习的“演进核心”,机器人便能摆脱对演示数据的刻板复现。

在不断的交互试错中,它们开始强化模型的物理推理。

这或许也是具身大模型从“会模仿”走向“会适应”的关键一步。

LaST-R1框架概述

△LaST-R1框架

  • (a) LaST-R1 是一个统一模型,以视觉观测和语言指令作为输入,其中视觉基础模型提供具有物理语义约束的 latent targets,用于在动作生成前引导 latent CoT 推理。
  • (b) 在 LAPO 强化学习后训练过程中,LaST-R1 以闭环方式与环境交互,并将 latents、actions 和 rewards 存储到 rollout buffer 中,以联合重塑 latent space 与 action space。进一步地,模型通过基于预测概率学习生成 token,实现自适应推理,从而在不同任务中动态调整推理长度。
  • (c) 通过 LAPO,LaST-R1 能够在多样化任务中形成自适应推理长度,从而提升泛化能力与执行稳定性。

整个LaST-R1框架可以概括为三个关键阶段:先推理、再优化、动态决定想多久。

第一阶段:行动前的隐空间推理(Latent Reasoning-before-Acting)

给定当前视觉观测和语言指令,LaST-R1不会直接生成动作,而是先生成一段隐空间推理嵌入(latent reasoning embeddings),作为行动前的“隐空间物理思考”,用于建模物体关系、未来状态和操作动态。

随后,模型再基于这些隐空间推理 (latent reasoning) 并行生成action tokens。

这一步解决的是:如何让动作生成建立在物理推理之上。

第二阶段:LAPO同时优化隐空间(latent)和动作(action)

LaST-R1的核心算法是LAPO(隐空间到动作策略优化,Latent-to-Action Policy Optimization)

传统具身大模型RL主要优化action,而LAPO将latent reasoning也纳入强化学习目标,让环境奖励同时塑造“怎么想”和“怎么动”。

论文中最关键的是latent-level ratio surrogate

其中,

表示rollout时旧策略生成的latent sequence,

表示当前策略重新生成的latent sequence,

控制latent分布宽度。

直观来说,如果某条轨迹成功,LaST-R1不仅会强化对应动作,也会强化动作之前产生的“好推理”。

随后,LAPO将latent和action放进统一的clipped objective中:

其中,

表示同时优化latent reasoning和action generation,

是advantage estimate,

用于限制策略更新幅度。

最终,总训练目标为:

这意味着:LaST-R1的RL后训练不只是优化机器人的动作结果,也在优化行动前的物理推理过程。

第三阶段:Adaptive Latent CoT

不同任务需要不同的思考长度。

因此,LaST-R1引入Adaptive Latent CoT,通过token让模型动态决定何时结束latent reasoning并进入action generation。

这是为了让机器人根据任务难度自适应分配推理预算。

也就是说,LaST-R1不是让机器人每一步都固定想同样久,而是让它学会:简单状态快速执行,复杂状态多想一步。

为了优化这个结束标识符token的自适应生成,训练目标需要进一步加上L_end。

实验结果分析

1、仿真实验:LIBERO 99.9%

LaST-R1在LIBERO benchmark上进行系统评估,覆盖Spatial、Object、Goal 和Long四个任务套件。实验在one-shot SFT warm-up设置下进行,随后进入在线RL后训练。

结果显示,LaST-R1在四个suite上分别达到99.8%/100.0%/100.0%/99.8%,平均成功率达到99.9%,超过OpenVLA-OFT、π0.5、SimpleVLA-RL和πRL等强基线。

相比只优化动作空间的Action-Only + PPO,LaST-R1 + LAPO收敛更快、最终成功率更高,说明latent reasoning与action generation的联合优化能够为RL提供更稳定的“认知缓冲区”,从而提升复杂长程操作能力。

2、真机实验:从52.5%到93.75%

LaST-R1在四个真实操作任务上进行测试,覆盖单臂高精度插入、双臂协同、接触式擦拭和连续旋转等复杂物理交互。

为了突出RL后训练效果,论文将其与SOTA模型π0.5对比:π0.5使用100条专家轨迹进行SFT,而LaST-R1仅使用30条轨迹warm-up,并通过RL后训练继续优化。

结果显示,LaST-R1将真机平均成功率从warmup后的52.5%提升到93.75%,显著超过π0.5的71.25%,说明其优势不仅存在于仿真环境,也能迁移到真实物理交互中,并形成更稳定的执行策略。

3、泛化实验:换物体、换背景、换光照,依然稳

在LIBERO OOD设置中,研究团队采用9个seen tasks进行在线RL,并保留1个held-out task做泛化测试。

结果显示,Action-Only + PPO容易出现性能停滞甚至退化,而LaST-R1 + LAPO能在OOD tasks上持续提升,说明latent reasoning能帮助模型学到更可迁移的空间语义和物理动态。

在真实世界中,论文进一步测试了unseen object、background variation和lighting condition三类扰动。

相比SFT π0.5,LaST-R1在这些变化下保持更小的性能下降,说明它并不是简单记住训练场景中的动作轨迹,而是形成了更鲁棒的物理推理与动作生成能力。

结语:具身大模型不只是要会行动,而是开始学会“思考推理”

LaST-R1的意义,不只是把LIBERO平均成功率推到99.9%,也不只是让真机任务成功率提升到93.75%

更重要的是,它提出了一种新的具身大模型后训练范式:强化学习不应该只优化机器人的动作,也应该优化动作背后的物理推理过程

过去,我们更关心机器人能不能生成正确动作。

现在,LaST-R1在此基础上进一步追问:机器人能不能在行动前进行正确的物理推理?

通过LAPO,环境reward可以直接塑造latent reasoning space;

通过adaptive latent CoT,机器人可以根据任务难度动态调整思考长度。

这意味着,机器人不再只是复现演示数据中的动作轨迹,而是在交互中逐步强化模型的物理推理。

从这个角度看,LaST-R1让具身大模型强化学习从“看见就动”走向“先想明白,再稳定行动”。

当具身大模型开始学会在latent space中思考,机器人距离真正的自主操作,也许又近了一步。

论文链接: https://arxiv.org/abs/2604.28192
项目主页: https://siriyep.github.io/last-r1/
代码链接:https://github.com/CHEN-H01/LaST-R1

版权所有,未经授权不得以任何形式转载及使用,违者必究。