惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Forbes - Security
Forbes - Security
The Register - Security
The Register - Security
G
Google Developers Blog
罗磊的独立博客
WordPress大学
WordPress大学
L
LangChain Blog
博客园 - 三生石上(FineUI控件)
Recorded Future
Recorded Future
Microsoft Azure Blog
Microsoft Azure Blog
Google DeepMind News
Google DeepMind News
大猫的无限游戏
大猫的无限游戏
MongoDB | Blog
MongoDB | Blog
小众软件
小众软件
Recent Announcements
Recent Announcements
T
Tailwind CSS Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
云风的 BLOG
云风的 BLOG
Apple Machine Learning Research
Apple Machine Learning Research
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
F
Full Disclosure
The Cloudflare Blog
B
Blog RSS Feed
S
Schneier on Security
T
Tenable Blog
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
T
Tor Project blog
N
Netflix TechBlog - Medium
T
Threatpost
NISL@THU
NISL@THU
Stack Overflow Blog
Stack Overflow Blog
N
News | PayPal Newsroom
N
News and Events Feed by Topic
aimingoo的专栏
aimingoo的专栏
博客园 - 叶小钗
P
Privacy & Cybersecurity Law Blog
C
CERT Recently Published Vulnerability Notes
Last Week in AI
Last Week in AI
M
MIT News - Artificial intelligence
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Privacy International News Feed
博客园 - 【当耐特】
Help Net Security
Help Net Security
The Hacker News
The Hacker News
Hugging Face - Blog
Hugging Face - Blog
TaoSecurity Blog
TaoSecurity Blog
S
Secure Thoughts
C
Cisco Blogs
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
李飞飞再出手,空间智能的ImageNet来了
听雨 · 2026-05-22 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-22 16:25:25 来源:量子位

一个专门用来评测具身空间智能的新基准

听雨 发自 凹非寺

量子位 | 公众号 QbitAI

ImageNet之后,李飞飞再出手!

李飞飞团队最新发布ESI-Bench——一个专门用来评测具身空间智能的新基准。

过去的空间智能评测默认给模型最优观测,而ESI-Bench第一个把观察者变成行动者,闭合了感知-行动回路。

它为具身空间智能领域提供了一个系统性的评测框架,覆盖人类核心空间认知能力的四大维度。

论文的核心结论是:现在的AI看图很厉害,但离「会动、会摸、会主动找答案」的空间智能还差得远

ESI-Bench是什么

ESI-Bench发布的背景,是由于目前的空间智能benchmark,测的都是「被动感知」。

把一张或几张图片扔给模型,问「A物体在B物体的左边还是右边」「这个杯子能装多少水」「抽屉里有没有东西」,这样的题目测出来的是模型的视力,而非空间推理能力。

反观人类是怎么做的?人类会站起来绕到物体背后去看,会把抽屉拉开,会把水倒出来量一量。

这就是ESI-Bench的核心立场:把观察者变成行动者

现实世界里,智能体必须像人类一样,主动决定行动、获取证据,再基于新观测做下一步判断。团队把它称为「感知-行动回路」(Perception-Action Loop)。

ESI-Bench就是这样一套超越现有基准的空间智能新评测基准,它包含10个任务类别,29个子类别,3081个任务实例,全部在OmniGibson仿真平台上构建,场景素材来自BEHAVIOR-1K场景库。

所有任务围绕Spelke的四大核心知识系统设计,也就是人类婴儿天生就具备的空间直觉:物体表征、布局与几何、数量表征、目标导向行动。

它的关键设定在于行动强制。每一道题,AI智能体必须主动行动才能拿到足够信息作答。模型不能坐在原地等图片,它要决定往哪走、看什么、拿什么、怎么操作。

举几个具体的例子:

比如评测中有一道「刚性容纳」题:给定几个容器和几个物体,要求把物体全部装进去。有的容器开口小、有的内部有隔板、有的盖子需要掀开才能看到真实容量。

模型必须走近、俯身、甚至把容器拿起来从底部观察,才能判断能不能装得下。

还有「液体体积」题:两个杯子,从外观看不出容量差异,模型需要把水倒进去测试,或者直接拿起来掂量。

这么一说,大家应该也能直观感受到这套评测基准的设计理念:

正确答案不在任何单张图片里,智能体必须主动行动并推理出正确结果

团队特别指出,与此前工作相比,ESI-Bench在三个地方有所超越:

从空间感知到空间能力:在这里,智能体不仅根据他们能感知到什么来评估,还根据他们是否知道部署哪些具体能力来解决空间任务来评估;

选择性感知:智能体必须确定哪些观察值得获取,优先考虑与任务相关的信息而不是冗余或无信息的输入;

解决感知歧义:智能体必须通过误导性观察进行推理,以推断隐藏的空间结构和超越直接观察的潜在物理约束。

测完发现了啥?3个核心结论

团队拿当前最强的多模态大模型做了全面测试,包括GPT-5和Gemini系列。

这是最主要的实验结果图,包含了ESI-Bench在被动感知、主动探索、Oracle三种范式下的各项任务准确率,涵盖2D+VLM、3D+LLM及人类基线。

核心结论有3个。

第一,感知不是瓶颈,行动才是

好消息是,主动探索确实有效。在没有额外指令的情况下,智能体自发涌现出多种空间策略。

比如绕到物体背后观察(move-behind)、切换俯视角度(top-down)、把物体拿起来(pick-up)、把水倒出来验证(pour-out)。

Gemini 3.1在「部分遮挡」任务上,如果给到最佳观察视角,准确率从14.6%暴涨到95.1%。

这说明,模型本身的感知能力是好的,只要给对视角,它就能看得懂。

但问题在于,模型自己找不到那个对的视角。

更糟糕的问题在于,被动多视角策略不仅没用,反而有害。

让GPT-5多看几张随机角度的图片,空间距离任务的准确率从53.9%降到49.1%。图看得多了,分反而低了。

GPT-5和Gemini 3.1在主动探索中达到正确答案所需的平均步数

团队把这个现象命名为「动作盲视」(Action Blindness),一个差动作导致一个差视角,差视角触发更差动作,形成不可逆的级联失败。

在结构围合任务上,主动探索策略和上帝视角的差距高达49.7%。

也就是说,空间智能的卡点不在于视觉模型不够强,而是行动策略几乎为零

第二,3D重建不是万能药,不完美的3D比2D更坑。

既然2D被动看图不行,那上3D呢?这也是当前很多具身智能团队的路子,先重建三维场景,再在场景图上做推理。

结果发现,如果给的是真值3D(上帝视角的完美几何),那确实很强。

Gemini在材质透明任务上,2D版本得分44.0%,3D版本得分60.4%,提升16.4个百分点。在需要精确深度信息的任务上,3D grounding有天然优势。

但如果是真实重建呢?团队用当前最先进的VGGT模型做场景重建,再把重建结果喂给推理模型。

结果那叫一个惨不忍睹:几何配置任务上,2D基线得分27.5%,VGGT重建后的场景图得分只有9.9%。

这说明,不完美的3D不是中性失败,它是负向失败。几何伪影、遮挡补全错误、深度估计偏差,把这些失真信息编码成场景图,就等于给推理模型喂了一份「有毒」的输入。

相比之下,2D虽然信息少,但至少不失真;3D如果重建质量不过关,比2D还不如。

第三,元认知缺陷:模型不知道自己看没看够。

论文里还有一组对比实验,探讨了智能体和人类的空间推理能力究竟还有多大差距。

结果发现,尽管人类与模型之间存在感知差距,但该差距可能比普遍认为的要小。

在部分类别中,模型的被动表现甚至能与人类持平或超越人类

在真实轨迹条件下,Gemini在部分遮挡任务上达到88.4%的准确率,而人类为87.4%;GPT-5在材质透明度任务上达到96.3%,人类则为97.2%。

然而在主动探索场景下,二者的差距急剧显现。

人类凭借明确的观察目标和停止时机,表现远超模型,且主动探索的表现更接近真实轨迹下的被动表现。

例如在物理接触任务中,人类准确率为88.3%,而 GPT-5仅为 64.2%;在材质透明度任务中,人类准确率为93.6%,Gemini 3.1则为52.3%。

通过分析模型与人类的探索轨迹,团队发现人类表现出更强的认知谨慎性:在做出判断前会收集更多观测,主动寻找可能证伪当前假设的视角,并在模糊情境下降低置信度。

而模型则会过早停止探索,即便证据存在模糊性,也仅在少数步骤后就以高置信度做出判断,进而产生与场景状态相悖的空间幻觉。

模型的过度自信,还因动作选择的方向偏差而加剧:模型不会探查正交角度或寻找能推翻初始印象的视角,而是反复向同一方向移动,积累的是冗余信息而非有效观测。

团队把它定性为元认知(metacognition)缺陷:模型不知道自己不知道。

它缺乏一种内建的「怀疑机制」,无法评估当前信息是否充分,无法根据矛盾证据调整信念。

这个问题从根本上区别于感知能力,也是一个更加底层的挑战,仅靠更强的视觉编码器或更多的探索步骤无法解决。

论文作者

最后,再介绍一下这项工作的作者团队。

一作是Yining Hong

Yining Hong,斯坦福大学的博士后,导师为Yejin Choi教授,同时受到Leonidas Guibas教授、吴家俊教授和李飞飞教授的密切指导。

她曾在UCLA获得计算机科学博士学位,本科就读于上海交通大学电子工程系。

此外,她还是一名职业音乐家,平时会和乐队一起巡演,同时也是CVPR 2026的社交主席,负责组织CVPR招待会和音乐表演。

Jiageng Liu(刘家耕),加州大学洛杉矶分校(UCLA)Mobility Lab的博士生。

其本科就读于浙江大学竺可桢荣誉学院及计算机科学与技术学院的图灵班,获人工智能学士学位。

Han Yin,清华大学本科生,斯坦福大学Intern,专业为计算机科学与技术。

李飞飞、吴佳俊(Jiajun Wu)、Yejin Choi,三位斯坦福教授,也同时出现在作者列表里。

另外还有来自西北大学的Manling Li教授和斯坦福的Leonidas Guibas教授参与。

参考链接:
[1]https://arxiv.org/abs/2605.18746
[2]https://esi-bench.github.io/

版权所有,未经授权不得以任何形式转载及使用,违者必究。