惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
Google DeepMind News
Google DeepMind News
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
T
The Blog of Author Tim Ferriss
MongoDB | Blog
MongoDB | Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog
AWS News Blog
AWS News Blog
K
Kaspersky official blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 叶小钗
Last Week in AI
Last Week in AI
T
Threat Research - Cisco Blogs
The Cloudflare Blog
人人都是产品经理
人人都是产品经理
C
Cyber Attacks, Cyber Crime and Cyber Security
L
Lohrmann on Cybersecurity
P
Privacy & Cybersecurity Law Blog
P
Proofpoint News Feed
S
Security @ Cisco Blogs
Recorded Future
Recorded Future
G
GRAHAM CLULEY
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
S
Secure Thoughts
腾讯CDC
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Simon Willison's Weblog
Simon Willison's Weblog
S
SegmentFault 最新的问题
Google Online Security Blog
Google Online Security Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
A
About on SuperTechFans
S
Schneier on Security
L
LINUX DO - 热门话题
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Microsoft Security Blog
Microsoft Security Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Apple Machine Learning Research
Apple Machine Learning Research
NISL@THU
NISL@THU
Recent Announcements
Recent Announcements
Schneier on Security
Schneier on Security
小众软件
小众软件
Stack Overflow Blog
Stack Overflow Blog
Jina AI
Jina AI
V
Visual Studio Blog
TaoSecurity Blog
TaoSecurity Blog
C
Cybersecurity and Infrastructure Security Agency CISA
O
OpenAI News
S
Securelist

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
具身大模型R1时刻:LIBERO终结者,99.9%背后的物理推理新范式
思邈 · 2026-05-11 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-11 09:51:36 来源:量子位

真正学会了在隐空间里进行“物理思考”

允中 发自 凹非寺

量子位 | 公众号 QbitAI

机器人拉个拉链,到底需不需要“脑子”?

过去几年,从OpenVLA到π0、π0.5,具身大模型已经能让机器人把指令和动作连得有模有样。

但一旦包的位置挪了几厘米,或者光照暗了一点,它们往往就会“大脑宕机”。

究其原因,是因为这些机器人大多在玩“连连看”:看到观察结果,直接输出动作。

它们只是记住了轨迹,却并不理解背后的物理逻辑。

现在,一种让机器人“先想明白,再稳定行动”的新范式来了。

由至简动力、北大、港中文联合提出的LaST-R1,首次将隐空间物理推理塞进了强化学习的闭环。

同时,LaST-R1作为LaST₀基座模型的物理世界后训练范式,LaST₀首创面向机器人的隐空间物理思维链推理,并已中稿ICML2026 Spotlight(top 2.2%)。

它的表现有多夸张?

  • 仿真满分级别:在LIBERO benchmark上,仅靠1条轨迹预热,平均成功率就冲到了99.9%
  • 真机性能起飞:在真实抓取、旋转等复杂任务中,比目前最强的SOTA模型π0.5还要高出22.5%
  • 强化“物理推理”:即便换了物体、背景或光照,它依然能稳如老狗,不再是单纯的动作复刻,而是真正学会了在隐空间里进行“物理思考”。

这个让机器人长出“物理脑”的LaST-R1,到底是怎么炼成的?

那个让环境反馈同时优化“怎么想”和“怎么动”的LAPO算法又藏着什么玄机?

我们顺着这篇论文,深挖了一下这套能让机器人“深思熟虑”的后训练黑科技。

具身大模型的隐形天花板:只会模仿,不懂物理

尽管从OpenVLA到π0.5,具身大模型已经完成了图像、语言与动作的初步对齐。

但在实际落地中,工业界发现了一个致命的“幻觉”:

能模仿,不等于能在物理世界泛化。

这就导致了极差的泛化性。

打个比方,机器人可能记住了100种拉拉链的轨迹,但只要拉链的角度偏转15度,或者光照发生变化,单纯靠“观察→动作”的端到端映射就会失效。

核心问题在于,现有的VLA模型缺少一个“思考”的中间层——即让机器人在行动之前,对物理世界进行推理。

过去,学术界也曾尝试引入思维链(CoT)来解决推理问题。

但对于机器人操作而言,语言推理往往太慢且颗粒度太粗,你很难用文字精准描述“拉链咬合时的细微阻力反馈”。

LaST-R1的核心突破,就是放弃了低效的语言CoT,转而在隐空间(Latent Space)中构建物理推理链。

它不再让机器人看到图像就“闭眼”出动作,而是先在隐性空间里建模场景的结构、物体的物理关系以及未来的动态变化。

然而,要让机器人学会这种“思考”,仅靠静态的模仿学习(SFT)是不够的。

目前的强化学习(RL)方法大多像是一个只看结果的严厉教练:它只告诉机器人动作成没成功(优化Action Space),却无法指导机器人“刚才那下你是怎么想的”。

针对这一痛点,该团队提出的LAPO(Latent-to-Action Policy Optimization)算法,正式将“思考过程”拉进了强化学习的优化闭环。

它让环境反馈不仅优化动作,也优化机器人行动前的“物理思考”。

不只练“手”更要修“脑”:如何让机器人强化模型的物理推理?

近日,至简动力、香港中文大学、北京大学计算机学院多媒体信息处理国家重点实验室,提出了一种面向机器人操作的自适应物理隐空间推理强化学习框架——

LaST-R1(Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning)。

它希望通过强化学习后训练,让具身大模型不仅学会生成动作,也学会在行动前,进行面向物理世界的隐空间推理。

△LaST-R1概览

  • (a) 不同于仅严格优化动作的 vanilla RL 基线方法,
  • (b) 我们的方法利用 LAPO 联合优化自适应 latent CoT 与物理执行过程。通过连接认知推理与控制,LaST-R1 实现了
  • (c) 更快的收敛速度、更高的仿真成功率,
  • 以及 (d) 更强的真实世界泛化能力。

与以往主要优化action space(动作空间,即机器人所有可执行指令的集合)的具身大模型RL不同,LaST-R1的核心思想是:

机器人不应只从图像和指令直接预测下一步动作,而应先在latent space(隐空间,可以理解为机器人大脑里的“隐性认知层”)中理解场景结构、物体关系和物理动态,再生成更稳定、精准的动作。

换句话说:

LaST-R1不只优化机器人的“手”,也优化它的“脑”。

具体来看,LaST-R1构建了一个面向latent reasoning-before-acting策略的强化学习后训练框架,核心由三步组成:

1、物理隐空间推理建模(Physical Latent Reasoning)

  • 传统具身大模型往往直接从observation生成action,动作前缺少可建模、可优化的物理推理过程。
  • LaST-R1在模型推理中引入latent CoT:生成动作前,先在latent space中建模当前场景、物体关系和未来物理动态。
  • 相比语言推理,latent reasoning更适合承载连续、高频、难以语言化的物理信息。

2、隐空间推理与动作生成的联合强化优化(Latent-to-Action Policy Optimization)

  • 传统具身大模型RL多数只优化动作结果:哪个action带来更高reward,就强化哪个action。
  • LaST-R1提出LAPO,把环境奖励同时作用于latent reasoningaction generation:成功轨迹不仅强化正确动作,也强化动作之前的“好推理”;失败轨迹不只修正动作结果,也反向调整内部物理推理空间。
  • 让reward真正塑造动作背后的reasoning process。

3、自适应latent CoT推理机制(Adaptive Latent CoT)

  • 不同任务决策需要不同长度的思考。
  • LaST-R1引入adaptive latent CoT:简单状态下,模型可以快速结束推理并执行;拉拉链、擦花瓶、拧瓶盖等复杂接触式操作,则分配更长reasoning horizon。
  • 在交互中学会:什么时候该多想,什么时候该立刻执行。

LaST-R1改变的是具身大模型后训练的优化对象:从只优化动作,转向同时优化动作背后的物理推理。

研究团队在仿真和真机环境中都进行了系统验证。

在仿真LIBERO benchmark上,LaST-R1仅依赖1条轨迹完成warm-up,随后通过在线RL优化,最终取得99.9%平均成功率,并相比Action-Only+PPO展现出更快收敛和更高最终性能。

在真机部署中,LaST-R1仅使用30条轨迹warm-up,再通过RL后训练将平均成功率从52.5%提升到93.75%,显著超过使用100条专家轨迹的π0.5(71.25%)。

更重要的是,在真实扰动条件下,LaST-R1仍保持较小性能下降,说明其学习到的不是单一场景中的动作轨迹,而是更可迁移的空间语义和物理动态理解。

上述结果意味着,具身大模型强化学习的重点正在发生变化——

机器人不再只是通过RL学会更熟练地执行动作,而是开始通过RL学会更合理地进行物理推理。

LaST-R1的意义,在于它提出了一种新的具身大模型后训练范式,能够让环境反馈同时塑造机器人的“思考方式”和“行动方式”。

一旦隐空间推理从模仿学习的“静态脚本”进化为强化学习的“演进核心”,机器人便能摆脱对演示数据的刻板复现。

在不断的交互试错中,它们开始强化模型的物理推理。

这或许也是具身大模型从“会模仿”走向“会适应”的关键一步。

LaST-R1框架概述

△LaST-R1框架

  • (a) LaST-R1 是一个统一模型,以视觉观测和语言指令作为输入,其中视觉基础模型提供具有物理语义约束的 latent targets,用于在动作生成前引导 latent CoT 推理。
  • (b) 在 LAPO 强化学习后训练过程中,LaST-R1 以闭环方式与环境交互,并将 latents、actions 和 rewards 存储到 rollout buffer 中,以联合重塑 latent space 与 action space。进一步地,模型通过基于预测概率学习生成 token,实现自适应推理,从而在不同任务中动态调整推理长度。
  • (c) 通过 LAPO,LaST-R1 能够在多样化任务中形成自适应推理长度,从而提升泛化能力与执行稳定性。

整个LaST-R1框架可以概括为三个关键阶段:先推理、再优化、动态决定想多久。

第一阶段:行动前的隐空间推理(Latent Reasoning-before-Acting)

给定当前视觉观测和语言指令,LaST-R1不会直接生成动作,而是先生成一段隐空间推理嵌入(latent reasoning embeddings),作为行动前的“隐空间物理思考”,用于建模物体关系、未来状态和操作动态。

随后,模型再基于这些隐空间推理 (latent reasoning) 并行生成action tokens。

这一步解决的是:如何让动作生成建立在物理推理之上。

第二阶段:LAPO同时优化隐空间(latent)和动作(action)

LaST-R1的核心算法是LAPO(隐空间到动作策略优化,Latent-to-Action Policy Optimization)

传统具身大模型RL主要优化action,而LAPO将latent reasoning也纳入强化学习目标,让环境奖励同时塑造“怎么想”和“怎么动”。

论文中最关键的是latent-level ratio surrogate

其中,

表示rollout时旧策略生成的latent sequence,

表示当前策略重新生成的latent sequence,

控制latent分布宽度。

直观来说,如果某条轨迹成功,LaST-R1不仅会强化对应动作,也会强化动作之前产生的“好推理”。

随后,LAPO将latent和action放进统一的clipped objective中:

其中,

表示同时优化latent reasoning和action generation,

是advantage estimate,

用于限制策略更新幅度。

最终,总训练目标为:

这意味着:LaST-R1的RL后训练不只是优化机器人的动作结果,也在优化行动前的物理推理过程。

第三阶段:Adaptive Latent CoT

不同任务需要不同的思考长度。

因此,LaST-R1引入Adaptive Latent CoT,通过token让模型动态决定何时结束latent reasoning并进入action generation。

这是为了让机器人根据任务难度自适应分配推理预算。

也就是说,LaST-R1不是让机器人每一步都固定想同样久,而是让它学会:简单状态快速执行,复杂状态多想一步。

为了优化这个结束标识符token的自适应生成,训练目标需要进一步加上L_end。

实验结果分析

1、仿真实验:LIBERO 99.9%

LaST-R1在LIBERO benchmark上进行系统评估,覆盖Spatial、Object、Goal 和Long四个任务套件。实验在one-shot SFT warm-up设置下进行,随后进入在线RL后训练。

结果显示,LaST-R1在四个suite上分别达到99.8%/100.0%/100.0%/99.8%,平均成功率达到99.9%,超过OpenVLA-OFT、π0.5、SimpleVLA-RL和πRL等强基线。

相比只优化动作空间的Action-Only + PPO,LaST-R1 + LAPO收敛更快、最终成功率更高,说明latent reasoning与action generation的联合优化能够为RL提供更稳定的“认知缓冲区”,从而提升复杂长程操作能力。

2、真机实验:从52.5%到93.75%

LaST-R1在四个真实操作任务上进行测试,覆盖单臂高精度插入、双臂协同、接触式擦拭和连续旋转等复杂物理交互。

为了突出RL后训练效果,论文将其与SOTA模型π0.5对比:π0.5使用100条专家轨迹进行SFT,而LaST-R1仅使用30条轨迹warm-up,并通过RL后训练继续优化。

结果显示,LaST-R1将真机平均成功率从warmup后的52.5%提升到93.75%,显著超过π0.5的71.25%,说明其优势不仅存在于仿真环境,也能迁移到真实物理交互中,并形成更稳定的执行策略。

3、泛化实验:换物体、换背景、换光照,依然稳

在LIBERO OOD设置中,研究团队采用9个seen tasks进行在线RL,并保留1个held-out task做泛化测试。

结果显示,Action-Only + PPO容易出现性能停滞甚至退化,而LaST-R1 + LAPO能在OOD tasks上持续提升,说明latent reasoning能帮助模型学到更可迁移的空间语义和物理动态。

在真实世界中,论文进一步测试了unseen object、background variation和lighting condition三类扰动。

相比SFT π0.5,LaST-R1在这些变化下保持更小的性能下降,说明它并不是简单记住训练场景中的动作轨迹,而是形成了更鲁棒的物理推理与动作生成能力。

结语:具身大模型不只是要会行动,而是开始学会“思考推理”

LaST-R1的意义,不只是把LIBERO平均成功率推到99.9%,也不只是让真机任务成功率提升到93.75%

更重要的是,它提出了一种新的具身大模型后训练范式:强化学习不应该只优化机器人的动作,也应该优化动作背后的物理推理过程

过去,我们更关心机器人能不能生成正确动作。

现在,LaST-R1在此基础上进一步追问:机器人能不能在行动前进行正确的物理推理?

通过LAPO,环境reward可以直接塑造latent reasoning space;

通过adaptive latent CoT,机器人可以根据任务难度动态调整思考长度。

这意味着,机器人不再只是复现演示数据中的动作轨迹,而是在交互中逐步强化模型的物理推理。

从这个角度看,LaST-R1让具身大模型强化学习从“看见就动”走向“先想明白,再稳定行动”。

当具身大模型开始学会在latent space中思考,机器人距离真正的自主操作,也许又近了一步。

论文链接: https://arxiv.org/abs/2604.28192
项目主页: https://siriyep.github.io/last-r1/
代码链接:https://github.com/CHEN-H01/LaST-R1

版权所有,未经授权不得以任何形式转载及使用,违者必究。