惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
A
About on SuperTechFans
博客园 - Franky
Engineering at Meta
Engineering at Meta
Recent Announcements
Recent Announcements
云风的 BLOG
云风的 BLOG
B
Blog
Microsoft Security Blog
Microsoft Security Blog
L
LangChain Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
U
Unit 42
Martin Fowler
Martin Fowler
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
博客园 - 叶小钗
Vercel News
Vercel News
Apple Machine Learning Research
Apple Machine Learning Research
The Cloudflare Blog
Last Week in AI
Last Week in AI
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
爱范儿
爱范儿
V
V2EX
G
Google Developers Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
场景泛化能力反超主流VLA模型?大晓机器人开源新世界模型,以...
华卫 · 2026-06-17 · via InfoQ - 促进软件开发领域知识与创新的传播

整理|华卫

近日,大晓机器人开悟世界模型(Kairos)同时在 RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、DreamGen 等全球针对世界模型视频生成和状态预测的权威具身智能评测中均实现第一,超越 Cosmos3、PI、MotuBrain、being-H0.7、Abot、Fast-WAM、Wan2.2 等全球主流世界模型 。

据介绍,该模型首创原生统一世界模型架构——“多模态理解—生成—预测”一体化架构,将向全行业开源。

项目链接:

https://github.com/kairos-agi/kairos-sensenova

https://huggingface.co/kairos-agi

https://modelscope.cn/collections/kairos-team/kairos30

针对行业普遍基于视频生成模型做后训练所固有的物理缺失、因果匮乏与推理延迟等痛点,大晓机器人(ACE ROBOTICS)于 2025 年 12 月重磅推出创新的一体化统一架构。作为国内唯一坚持自主设计网络架构与自主预训练范式的团队,大晓彻底摒弃了“外挂式”改良捷径,从底层重构世界模型运行逻辑。该架构深度融合理解、生成与预测三大核心能力,依托自研混合线性注意力算子与全局状态共享机制实现全链路高效协同。

在数据层面,得益于完全自主的预训练范式,Kairos 广泛汇聚十余万小时 human-centric 实景数据与数百万小时互联网真实世界视频,全面覆盖数百类职业场景。结合显式模仿学习与隐空间强化学习,模型彻底打通了从数据感知到深度理解的闭环,使基模型的场景认知、时序因果推演与泛化适配取得全方位突破。这不仅夯实了具身智能落地的底层基座,更为世界模型数据层面的尺度定律探索做出了重要贡献。凭借领先架构与海量高质量数据,Kairos 兼具强劲物理直觉、顶尖泛化能力与极致鲁棒性。基于此打造的 Kairos-4B 成为全球首款可端侧直驱机器人本体的具身世界模型,成功打通世界理解与状态预测的端到端闭环,消除中间转译延迟,让机器人真正实现“想到即做到”。这一里程碑式突破大幅提升了实时响应与作业精度,为具身智能的商业化落地开辟了全新路径。

登顶 RoboTwin 2.0,复杂双臂操作能力获验证

在全球最具挑战性的双臂机器人操作评测基准 RoboTwin 2.0 中,Kairos 以 96.1% 的平均成功率位列所有参评方法第一,刷新当前最好成绩,并显著领先传统 VLA 模型,展现出在复杂双臂协作、精细操作与多任务泛化场景中的领先能力。

RoboTwin 2.0 由上海交通大学、香港大学 ,联合上海人工智能实验室等研究团队共同推出的高难度双臂操作评测基准,包含 50 项复杂协同任务。该基准核心对比了 VLA(视觉语言动作)模型与 WAM(世界动作模型)两大技术范式,后者因具备环境动力学预测能力,更契合长时序推理与复杂规划需求。

在这一极具挑战的测试中,Kairos 以 96.1 分的平均成功率强势登顶榜首。其在 Clean(标准)场景取得 96.9 分,在 Randomized(随机化)场景取得 95.2 分,不仅远超 G0.5(93.2)starVLA(88.3)等 VLA 模型,也全面超越 AIM(93.1)Fast-WAM(91.8)MotuBrain(96.0)等主流世界模型。这一显著优势得益于 Kairos 对世界动力学与动作演化的联合建模,使其在复杂双臂操作的规划、执行及应对现实不确定性方面实现了质的飞跃。

登顶 LIBERO-Plus,实现世界模型路线范式超越

在全球最严苛的场景级泛化能力评测基准 LIBERO-Plus 中,Kairos 世界模型以 89.0 分的总成绩力压所有主流 VLA 模型和世界模型,登顶全球榜首。

LIBERO-Plus 由上海创智学院、复旦大学、同济大学和新加坡国立大学的研究团队共同提出,通过模拟相机视角、机器人形态、语言指令、光照条件、背景环境、噪声干扰、空间布局等 7 种真实场景变量,测试模型在未知扰动下的鲁棒性,是衡量机器人能否适应开放世界的 “终极考验”。

评测结果显示,Kairos 不仅大幅超越同为世界模型的 Being-H0.7(84.8 分),更全面超越了包括 ACoT-VLA(88.0 分)、Pi 0.5(85.7 分)、ProGAL-VLA(85.5 分)在内的所有主流 VLA 模型。在核心子维度上,Kairos 展现出碾压级的环境鲁棒性:光照(97.7)背景(95.8)噪声(96.8)三大维度均取得接近满分的成绩,相机视角(95.5)语言指令(86.8)维度也位居前列。

Kairos 世界模型能够在光照突变、背景杂乱、存在噪声干扰的复杂环境中稳定执行任务,准确理解多样化的语言指令,并适应不同的相机视角。这意味着搭载 Kairos 世界模型的机器人以极小代价,即可直接部署到家庭、工厂、商场等多样化真实场景中,为具身智能的大规模商业化落地扫清了最后一道核心技术障碍。

登顶 WorldModelBench Robot,物理建模精度达到高水平

在衡量机器人世界建模能力的行业金标准 WorldModelBench 机器人专项测试中,Kairos-4B 以 9.30 分的总成绩登顶全球榜首,仅用 4B 参数便全面超越了包括 28B 参数的 Lingbot、16B 参数的 Cosmos3、14B 参数的 Abot-Physworld、5B 参数的 Wan2.2 在内的主流模型,创造了世界模型领域参数效率的新纪录。

该基准由加州大学伯克利分校、加州大学圣迭戈分校、英伟达和麻省理工学院的联合研究团队提出,核心评估指令遵循和未来帧生成两大能力,直接决定机器人能否理解人类指令并预判动作后果,是具身智能最基础的核心能力。

评测结果显示,Kairos 在多个核心维度实现全面领先。指令遵循得分 2.36,与 16B 参数的 Cosmos3 并列全球第一,参数效率提升 4 倍;在物理遵循维度取得 4.96 分的高分,其中牛顿力学、重力两大核心物理规律维度全部斩获满分 1.00;此外,在时序质量指标上取得满分 1.00,展现出超越竞品的时序一致性与视觉连续性。

这一成绩标志着 Kairos 世界模型已同时具备世界级建模能力和物理级精准的环境交互能力,为具身智能从实验室走向大规模商业化落地奠定了关键技术基础。

斩获 DreamGen 双冠

在专为机器人具身智能设计的 DreamGen Bench 评测中,Kairos 世界模型一举夺得平均物理遵循(AVG_PA 0.538)和总平均分(AVG_Score 0.618)两项全球第一,全面超越 Cosmos3、Lingbot、Wan2.2 等主流世界模型。

DreamGen 由英伟达,联合华盛顿大学、加州大学伯克利分校、加州大学洛杉矶分校等多所顶尖高校的研究团队共同提出,是目前系统性评估世界模型真实场景泛化能力的基准,其得分与下游机器人策略训练性能呈显著正相关,分数越高,模型生成的合成数据训练出的机器人实际表现越好。

在核心三大泛化场景中,Kairos 世界模型在物理遵循(PA)维度上大幅领先,其中新行为执行得分 0.489 和新环境适配得分 0.581 位居全球第一。在指令遵循(IF)维度上,新行为执行得分 0.745 也取得第一名。综合泛化能力大幅超越 Lingbot、Cosmos3、Abot-PhysWorld 等主流世界模型。

这一成绩意味着 Kairos 世界模型生成的合成数据不仅符合真实物理规律,更能有效迁移到从未见过的物体、行为和环境中,将大幅降低机器人在新场景下的训练成本和周期,为具身智能的大规模商业化落地提供了核心数据引擎。

四大权威榜单的全面领先,充分验证了 Kairos 世界模型技术路线的先进性和完整性,从基础的物理规律理解,到未知场景的能力泛化,再到复杂环境的鲁棒性和精细的双臂协同操作。