惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
U
Unit 42
T
Tailwind CSS Blog
罗磊的独立博客
WordPress大学
WordPress大学
小众软件
小众软件
Recent Announcements
Recent Announcements
博客园 - 聂微东
Jina AI
Jina AI
云风的 BLOG
云风的 BLOG
博客园 - 【当耐特】
爱范儿
爱范儿
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
V
V2EX
博客园 - 三生石上(FineUI控件)
I
InfoQ
雷峰网
雷峰网
G
Google Developers Blog
阮一峰的网络日志
阮一峰的网络日志
B
Blog
腾讯CDC
A
About on SuperTechFans
博客园 - 叶小钗

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
让具身模型学会“先想后做”!星源智推出400万问答对大规模数据...
华卫 · 2026-05-28 · via InfoQ - 促进软件开发领域知识与创新的传播

让 AI 在真实环境中不仅“看懂”世界、还能“做出”决策,这是具身智能的终极目标之一。

然而,现有的具身问答数据集和基准普遍“偏科”:有的聚焦空间理解,有的侧重过程推理,几乎没有哪一个能同时覆盖场景理解、空间推理、任务动态推理和实时决策这四个维度。

北京大学副教授穆亚东及北京大学、星源智团队给出了答案,并提出了一套名为 EQA-Decision 的大规模数据集与 RoboDecision 训练框架。首次将具身问答从静态感知扩展到动态决策,构建了覆盖四大推理模块、超过四百万问答对的大规模数据集,并设计了从监督微调到思维链再到强化学习的三阶段训练方法,让模型真正学会“先想后做、看图决策”。该方案论文《Extending Embodied Question Answering from Perception to Decision》已被全球计算机视觉顶会 CVPR 2026 录用,为具身智能前沿研究提供了新思路。

EQA-Decision:超 400 万问答对,覆盖四大推理维度

EQA-Decision 数据集规模相当可观:超过 400 万对多模态问答数据,涵盖模拟环境、图像问答、第一人称视频和真实机器人轨迹四大来源。

数据被系统性地分为四个核心推理模块:

静态场景构建: 关注基本的场景理解任务,包括物体存在性、状态、计数和位置。

空间理解:该模块的空间推理从三个互补视角探索:深度与方向、定位与指代、行动可能性。

任务动态推理:捕捉具身任务中的时间和因果关系:子任务规划、状态跟踪和进度估计。

即时决策: 该模块专注于建模机器人在动态具身环境中的实时决策过程。

其中,任务动态推理和即时决策是此前数据集完全没有覆盖的任务类型。这意味着,EQA-Decision 第一次让模型不仅要“看懂”当前状态,还要推演任务进程、预测最优动作。

RoboDecision:三阶段训练,把“看懂”变成“做对”

有了数据集,还需要一个能充分利用它的模型。团队提出的 RoboDecision 以 Qwen3-VL-8B 为基座,设计了一套三阶段渐进式训练 pipeline。

第一阶段:SFT(监督微调)。在 EQA-Decision 的四个模块上均匀采样数据,用 LoRA 微调语言层和融合层,注入具身领域知识。

第二阶段:CoT-SFT(思维链监督微调)。从中抽取约 10%的数据,用 Gemini-2.5-Pro 生成思维链标注(包含推理过程和最终答案),再专门微调。这一步让模型学会“先想后答”,形成显式的多步推理能力。

第三阶段:GRPO(强化学习微调)。这是最关键的一步。团队设计了一个混合奖励函数:

  • 推理奖励:用 E5-large 计算模型生成的推理链与参考思维链的相似度,鼓励因果一致的空间和时间推理。

  • 答案奖励:对自由回答用语义相似度,对结构化输出(坐标、深度等)用规则评分。

  • 视觉一致性奖励:用 OpenCLIP 对齐生成的推理与视觉观察,确保模型不是靠文本先验瞎猜,而是真正“看图说话”。

  • 三个奖励协同作用,迫使模型从“文本驱动的应答器”转变为“感知驱动的决策者”。

实验结果:RoboDecision-8B 全面领先,超越 GPT-5

团队构建了一个包含 2118 条样本的 EQA-Decision Benchmark,覆盖六类任务。结果非常清晰:

  • RoboDecision-8B 以 68.06 的整体得分大幅领先。对比 Qwen3-VL-8B-Instruct(48.84),提升了近 20 个点;对比 RoboBrain-7B-2.0(37.32),更是接近翻倍。

  • 在指代定位任务上,RoboDecision 得分 68.12,而 Qwen3-VL-8B-Thinking 只有 23.14。差距悬殊的核心原因,正是视觉一致性奖励强制模型把推理锚定在图像像素上。

  • 在即时决策任务上,RoboDecision 得分 69.93,比最强基线(GPT-5 的 62.25)高出 7.7 个点。

图注:EQA-Decision Benchmark 综合成绩对比

图注:RoboDecision 与 Qwen3-VL-8B-Instruct 在六类任务上的差异

此外,团队还在 RoboVQA、ERQA、Where2Place 三个外部基准上验证了泛化能力,RoboDecision 在所有任务上均超过通用模型和具身专用模型。

结语

总之,EQA-Decision 和 RoboDecision 把具身问答从“静态体检”升级为“动态实战”。通过系统性地覆盖场景、空间、时间、决策四个维度,并设计能够显式优化感知-决策链路的训练方法,这项工作为具身智能提供了一个更贴近真实需求的研究范式和数据集。

未来,这类“从感知到决策”的统一数据集和训练框架,很可能会成为具身智能研究的标配。毕竟,一个只会看不会做的 AI,永远无法真正走进物理世界。