惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
H
Help Net Security
The Cloudflare Blog
Y
Y Combinator Blog
A
Arctic Wolf
Cyberwarzone
Cyberwarzone
G
Google Developers Blog
Recent Announcements
Recent Announcements
S
SegmentFault 最新的问题
Microsoft Security Blog
Microsoft Security Blog
WordPress大学
WordPress大学
博客园 - Franky
罗磊的独立博客
Martin Fowler
Martin Fowler
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
博客园 - 三生石上(FineUI控件)
N
News and Events Feed by Topic
F
Fortinet All Blogs
N
News | PayPal Newsroom
J
Java Code Geeks
www.infosecurity-magazine.com
www.infosecurity-magazine.com
博客园 - 【当耐特】
M
MIT News - Artificial intelligence
Google Online Security Blog
Google Online Security Blog
Recorded Future
Recorded Future
博客园 - 聂微东
S
Securelist
C
CERT Recently Published Vulnerability Notes
小众软件
小众软件
Cisco Talos Blog
Cisco Talos Blog
S
Security Affairs
NISL@THU
NISL@THU
A
About on SuperTechFans
PCI Perspectives
PCI Perspectives
N
News and Events Feed by Topic
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Jina AI
Jina AI
Microsoft Azure Blog
Microsoft Azure Blog
AWS News Blog
AWS News Blog
GbyAI
GbyAI
C
Cyber Attacks, Cyber Crime and Cyber Security
V
Vulnerabilities – Threatpost
D
Docker
P
Proofpoint News Feed
W
WeLiveSecurity
Help Net Security
Help Net Security
The GitHub Blog
The GitHub Blog
The Last Watchdog
The Last Watchdog
The Hacker News
The Hacker News
博客园 - 叶小钗

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
“零数据”机器人来了,验证两月即可上岗!这群清华博士破局世界模型,靠“本能”让机器人上手就会
四月 · 2026-06-18 · via InfoQ - 促进软件开发领域知识与创新的传播

用一只机械手拾起桌面上的银行卡,需要几个自由度?

三个?五个?多数人的直觉都是越多越稳妥,最好再配上触觉、视觉、力控……毕竟,这活儿连人手也未必一次成功。

但偏偏有一家清华系的机器人公司不信邪,把这套方案砍到了一个自由度。

你看到的模块,甚至都谈不上机械手,更像是产线上最常见的工业夹爪:两块楔形黑色夹片,沿固定导轨运动,像鸟嘴一样咬合。

夹片内侧被银色的触觉传感材料包裹。除此之外,没有外置摄像头,没有云端大脑,也没有学习过任何“示范性的轨迹数据”。一切都发生在端侧的本地。

但它却能夹起那张厚度不到 1 毫米、平贴台面的白色卡片。更准确地说,它不是“夹”起,而是“撬”起:一侧夹片先压住卡片的边缘,以桌面当支点,另一端则被顶起;对应的夹片顺势合拢,两侧同时发力,将卡片整张提起。

正如视频所见,整个过程并不优雅,甚至有点笨:角度偏一些、力度大一点,卡片就会滑落。但它会一次次试、一次次修正,最后总能找到更合适的着力点

对实验结果感到诧异的不只有你。就连橡木果机器人(Acorn Robot)的发起人姜峣(清华机械工程博士、哈佛大学神经科学博士后)都称之为“惊喜”。“它不是一次成功,”他回忆道,“但试了八九次之后,它竟然自己找到了办法。”

谈及此处,姜峣的眼神里仍带着兴奋,像极了第一次在语言模型身上感受到智能涌现。他将机器人这套 “靠自己摸索出来的策略”称之为 “本能驱动下的行为涌现”;驱动它的,是橡木果的端侧自主决策模型 Natus。

该模块是橡木果面向 B 端柔性制造场景的首款产品,目前已走完国内 Top1 化妆品企业的概念验证(POC)阶段,实现了规模化部署。

在橡木果的研发管线里,还有更多形态的执行模块。它们每天孜孜不倦地练习抓取各种物品:从矿泉水瓶到橡胶软球,从香蕉到豆腐,以及异形不规则件。

图注:橡木果冷启动自主探索抓取各类异形物体

这些看似笨拙的试探,都指向了同一个发现:

如果机器人在几乎没有“示范数据模板”的情况下,依然能靠实践摸索出有效策略,那执行层真正缺的,可能并不是更多的轨迹数据,而是一套能 激发它“先动起来、先试起来”的底层机制

这也是姜峣面对当前主流具身路线最犀利的反思:VLA、世界模型、仿真学习并非毫无价值,但它们太容易在操作执行的“最后一厘米”掉链子。

执行侧:具身智能最沉默的困局

无论是试图端到端闭环的 VLA,还是推演物理未来的“世界模型”,本质上都带着语言模型“大力出奇迹”的惯性:以为只要看过的视频够多、数据喂得够足,操作智能就能自然涌现。但一旦涉足真实的物理交互,这套逻辑无疑将撞上两座大山:接触与本体

操作的本质是物理接触,摩擦、阻尼、力传导……这些现在世界里无处不在的变量,在世界模型却难以稳定建模。它或许能精准地生成一段“机器人抓取水杯”的预测视频,但却无法算出指尖与杯壁接触瞬间的相对摩擦,更无法预判玻璃滑落前那微小的形变。

视觉上的“看起来会”,掩盖不了执行层的“做不到”。

此外,操作必须通过具体的本体去执行,而每台机器人的关节磨损、装配松紧都有微小差异。橡木果团队做过对比实验:两台同款夹爪,采用同一套模型参数,仅仅是导轨松紧存在差异,在执行侧的效果也会大相径庭。

接触的不可预测与本体的微小差异,注定了数据驱动的路线是个填不满的无底洞。 行为模式难以穷尽,模型训练必须覆盖所有场景和硬件偏差,但哪怕全球最大的开源机器人数据集已达到百万回合的运动轨迹,依然无法激发出模型在执行层的泛化能力。

图片

图注:Open X-Embodiment (OXE) 目前全球最大的开源机器人数据集,包含来自全球 34 个研究实验室的 22 种不同机器人载体收集的超过一百万个机器人回合。

更要命的是,在按秒计费的产线上,没人等得起大模型数秒才能走完的推理闭环,VLA 动辄数秒的延迟,连进场作业的资格都没有。

这让姜峣坚信:没有绝对通用的最好模型,只有最适配这台机器的模型。VLA 想用数据解决操作问题,但采集成百上千小时的高质量遥操作数据,本身就需要极高的操作门槛。

“操作一定要在实践中学习,但实践的前提是你必须先能够实践起来。” 这是姜峣对于机器人执行的第二个关键判断,它揭示了 VLA 在执行侧的死穴,同时也是橡木果“另起炉灶”的起点。

跨界学科撞出的无人区

这套判断,并非从文献推导来的。

在清华机械工程系读博期间,姜峣天天和阻抗控制、力学建模打交道,这让他对物理交互有着根深蒂固的直觉:操作的本质是力学行为,而非视觉问题

2016 年,他去哈佛做神经科学博士后,研究方向变成了人脑的运动控制。实验室做了大量感知干扰实验:屏蔽视觉、干扰触觉,观察人手操作的变化。他发现,无论怎么干扰,人类最基本的抓取动作始终不变。

图片

“那个永远不变的部分,就是本能,” 姜峣意识到。语言没环境学不会,但没人教过婴儿怎么抓东西,全人类却抓得高度一致。这不是因为见过了足够多的场景,而是因为有一套基于触觉和力学的先天机制。

两套看起来八竿子打不着的学科语言在姜峣身上对齐了:操作的本质不是拟合视觉轨迹,而是力学规律;人类的通用操作能力,源于本能,而非数据。

把“本能”移植给机器人,这在当时是绝对的“无人区”。2018 年回国建实验室时,“具身智能”还没出圈,VLA 尚未大行其道,同行觉得他在讲玄学,投资人听不懂……

姜峣没有急着说服外界,而是极其审慎地培养同路人:实验室会要求大二便进组观察,先看能力,更看“是否理解数据驱动解决不了执行侧死结、是否相信本能”。算法再强但不认同这一点的人,他不要。新成员进组,必须经实验室全体博士生认可。最长的一位,更是跟了他 10 年。

2024 年创业时,组里 8 位博士一致选择加入了橡木果。更罕见的是,这些人私下有个共识:如果公司哪天不坚守“本能驱动”,他们就不继续效力。 这不是创业故事里常见的情怀,而是认知共识在对抗行业惯性前,必须建立的防线。

因为他们要找的,是“操作层面的万有引力”。

是规律,不是规则

这意味着必须放弃拟合轨迹的执念。牛顿没有穷尽每一条运动轨迹,而是用一条不含任何运动参数的万有引力定律,支配了所有运动。姜峣把同样的逻辑搬到了操作上:VLA 在学轨迹,橡木果在找规律。

规则是把操作算法写死,而规律只给约束。基于对物理交互的下探,姜峣将这条规律提炼为三类操作本能:

  • 定向本能解决“去哪”——与视觉协同,指引末端向目标移动,就像婴儿看到移动物体时自然转头追随;

  • 探索本能解决“怎么碰”——这是最复杂、也最体现智能涌现的一环。接触发生后,机器人不依赖预设程序或模仿,而是沿物体表面自主试探,寻找稳定的接触构型;

  • 执行交互本能解决“怎么抓”——以“滑移最小化”为核心,实时调节抓取力度。抓豆腐时轻柔,抓锤子时紧实,装配时自适应阻力。所有调控全凭触觉实时反馈,无需任何训练数据。

没有人告诉开篇的那个夹爪“从侧面撬卡片”,它只有“找到稳定接触”的底层期望,撬的动作便在物理约束下自然涌现

但要让这套本能真正闭环,必须跨过一个关键技术门槛:滑移感知。“就像你站在高铁上,想感知车厢和地面的相对速度,”姜峣解释,“你嵌在其中一方,几乎没有参照物。”

团队花了 7 年,迭代十余版原型机,才把微米级滑移感知做到稳定可用。有了它,机器人遇到任何物体,都能在接触中实时感知“要滑了”并自动修正——不需要提前知道物体是什么。这也是零数据冷启动能够成立的物理基石。

有了这三套“本能规律”,便可激发机器的无穷多行为。

Natus 与 Magis:从本能到技能

被 Natus 模型驱动的“行为涌现”,在端侧可实时控制:200Hz 响应,毫秒级延时,无云端依赖,出厂时针对具体硬件的力学特性单独适配。它的核心使命,就是解开前文那个“没能力就不能实践”的死结:让机器人“第一天上产线就能用”

但一直靠本能探索效率太低,这便是第二层模型 Magis 存在的意义。

Natus 探索产生的数据,不是普通的视频轨迹,而是带有触觉语义的记录:视觉看到“一根香蕉”,触觉同步标注“重 120 克,质心偏左,表皮粗糙”。

这类带力学标注的视觉数据送入 Magis 训练,得到的技能模型对物理世界的理解,远比纯视觉数据深得多——它知道怎么抓,而不只是看起来像在抓。

Magis 成熟后,熟悉场景可直接调用技能,陌生场景则退回 Natus 探索,新数据再沉淀进 Magis。一方面本能持续涌现,可以兜底;另一方面技能越积越厚,不断进化。

“我们颠覆了现在所有数据采集的方式,”姜峣说,“最好的数据来源不是仿真,不是人工遥操,而是产品自己在真实物理世界里跑出来的。”

换产不停线:零数据的真实价码

这套“自己跑出数据、自己长出技能”的能力,最迫切的场景在哪?

橡木果选择了柔性制造,姜峣认为,这是权衡过执行侧门槛和市场痛点后最佳的交叉点。

化妆品 ODM 行业是典型。SKU 超百种,几周一换,每次换产就要停线调参,它的痛点不是机器不够快,是机器认不出新物料。更棘手的是物料本身:粉饼极度易碎,稍用力就留印;香薰灯芯细软不均,力大了拔出,力小了拽不动。这类任务无法用规则覆盖,VLA 训练成本极高,传统自动化束手无策。

但对 Natus 来说,换了 SKU,只需自己探索,不停线、不调参、不叫工程师,这才是“零数据冷启动”对产线的真实价值。

据介绍,橡木果在国内头部化妆品企业完成 POC,从启动到验证不到两个月,随即进入规模化部署,在手订单突破 2000 万元。

图片

图注:具身智能的两条技术路径:自上而下数据拟合 vs 自下而上本能驱动

对于技术路线更长期的判断,姜峣认为,Natus 和大模型从来不是竞争,而是分工:大模型负责理解任务、规划步骤,Natus/Magis 负责毫秒级的物理执行,一个做规划,一个做操作,接口协同,各司其职。

这不是妥协,而是回归操作本质的必然。就像生物进化把操作反射交给了脊髓,而不是每次触觉都等大脑重新决策——这个判断,从他 8 年前在哈佛和清华的跨界碰撞中,就没变过。