惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

阮一峰的网络日志
阮一峰的网络日志
IT之家
IT之家
H
Heimdal Security Blog
Jina AI
Jina AI
宝玉的分享
宝玉的分享
博客园 - 【当耐特】
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
爱范儿
爱范儿
T
Tailwind CSS Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Apple Machine Learning Research
Apple Machine Learning Research
有赞技术团队
有赞技术团队
酷 壳 – CoolShell
酷 壳 – CoolShell
WordPress大学
WordPress大学
AWS News Blog
AWS News Blog
C
Cisco Blogs
Cisco Talos Blog
Cisco Talos Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
D
Darknet – Hacking Tools, Hacker News & Cyber Security
The Hacker News
The Hacker News
The Cloudflare Blog
Hugging Face - Blog
Hugging Face - Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Threatpost
S
Securelist
P
Privacy International News Feed
C
CXSECURITY Database RSS Feed - CXSecurity.com
博客园 - 聂微东
博客园 - 叶小钗
J
Java Code Geeks
V
V2EX
博客园 - Franky
Spread Privacy
Spread Privacy
K
Kaspersky official blog
C
Cyber Attacks, Cyber Crime and Cyber Security
Simon Willison's Weblog
Simon Willison's Weblog
Project Zero
Project Zero
大猫的无限游戏
大猫的无限游戏
S
SegmentFault 最新的问题
C
Cybersecurity and Infrastructure Security Agency CISA
C
CERT Recently Published Vulnerability Notes
Latest news
Latest news
NISL@THU
NISL@THU
罗磊的独立博客
W
WeLiveSecurity
Google DeepMind News
Google DeepMind News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园_首页
V
Visual Studio Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
对话罗剑岚:把机器人“部署”本身变成训练的一部分
华卫 · 2026-05-30 · via InfoQ - 促进软件开发领域知识与创新的传播

作者 | 华卫

具身智能过去两年始终无法回避的核心矛盾:模型越来越强,但机器人仍然很“笨拙”。真实部署不是一个固定测试集,机器人进入商店、家庭和工作空间后,会不断遇到预训练数据没有覆盖的新物体、新摆放、新指令偏好和长尾失败。原因并不复杂,长期以来,机器人的绝大多数能力来自离线训练,而真实世界却从未真正进入训练闭环。

最近,罗剑岚团队拿出了解决方案:把“部署”本身变成训练的一部分。上海创智学院与智元机器人联合发布了这套方法名为 LWD(Learning While Deploying),不试图解决某一个单点技术问题,直接改写整个训练范式:让落地后的机器人在实际工作中回流数据并反哺训练、更新能力,而不是等着它在数据集里一次性“学够”。

发布后不久,上海创智学院副教授,智元机器人首席科学家罗剑岚向我们详细披露了 LWD 这项工作未对外公示的技术设计细节及这套体系接下来的演进方向。

机器人“边干边学”后,成功率达到 95%

在传统路径中,具身模型通常经历大规模预训练、模仿学习、再到有限的强化学习优化,最后进入部署验证阶段。这个流程的问题在于,部署即为结束,真实世界的数据包括环境变化带来的分布偏移、长尾任务中的探索过程,以及失败暴露出的能力边界并没有被系统性地吸收进下一轮训练。最有价值的那部分经验,反而被浪费掉了。

而 LWD 的核心能力,可以打通这一断裂。它将机器人学习过程重构为一个持续运转的数据飞轮:离线强化学习预训练得到初始策略,推送到机器人集群中执行;机器人在真实环境中产生的自主轨迹和人工接管数据实时回流;Learner 在云端进行在线强化学习更新;再将优化后的策略同步回机器人集群,如此循环往复。

在这个框架下,每一台部署中的机器人,既是执行者,也是数据采集节点,真实世界从“测试集”变成了“主训练场”。部署不再是训练的终点,而是机器人智能持续提升的起点。

据介绍,团队在 16 台双臂机器人组成的真实集群上,针对商超补货、泡茶、榨汁、物品收纳等 8 个复杂任务进行了系统测试。这些任务往往需要持续数分钟的多步骤规划和精细物理操作。评测结果显示,搭载新框架的机器人平均成功率达到了 95%,显著优于传统方案。在最棘手的长程任务中,新框架带来了最高 17%的成功率提升,而且单次任务平均操作周期缩短了约 23.75 秒。这意味着机器人变得更聪明,学会了自我纠错和路径优化。

在被问及 LWD 的数据飞轮要真正转起来的瓶颈时,罗剑岚直接指向了一个更底层的现实约束,即大规模真实部署背后的经济问题。“机器人是一个系统工程,数据、基建、算法、机器人数量以及人工干预都重要,但如果只看当前阶段,最核心的问题还是 cost。只有当足够多的机器人在真实场景中持续干活,积累上万小时甚至上万台规模的交互数据,这个飞轮才有机会真正闭环运转。即使现有算法还不完美,其中大量 incremental improvement 依然可以工作。”

这也意味着,部署本身正在成为新的训练资源。“换句话说,谁能部署更多机器人、让更多真实数据持续回流,谁就更有机会把数据飞轮真正转起来。”罗剑岚还表示,在 scale up 过程中,还会继续遇到数据质量、基础设施和算法层面的新问题。但这些问题是随着部署规模扩大逐步暴露、逐步解决,而不是在一开始就能完全预先解决。

部署数据全部回流,人工干预不等同成功示范

罗剑岚提出的这条路径,听起来像是一项顺理成章的演进。但真正的难点在于,这种从离线到在线的统一训练,需要同时解决分布偏移、奖励稀疏和数据来源的高度异构三个问题。

据罗剑岚介绍,围绕这些难点,LWD 在技术设计上做出了一系列关键选择,包括让所有部署数据无筛选回流、通过强化学习框架统一处理不同来源数据、将人工干预数据通过结果自动打标纳入同一奖励体系,以及采用稀疏奖励来避免 reward hacking 问题。

首先,LWD 是强化学习框架,部署后的数据会全部回流使用,没有人工筛选步骤。系统是在线、分布式地把数据拿回来训练。但对于人工干预数据,处理方式也不是简单地一律当成成功示范,而是自动打标的。如果人工干预后任务最终成功,就标记为 1;如果干预后仍然失败,就标记为 0。

更重要的一点是,干预率本身是在下降的。罗剑岚称,随着机器人自主能力提升、数据不断回流,系统会越来越少依赖人工接管。所以在实际形态上,更像是一种混合自治:初期人机协作较多,后期逐步过渡到更高自主性。“这一点其实和自动驾驶的发展路径是类似的。”

其次,LWD 奖励函数使用的是稀疏奖励。核心原因是 dense reward 容易带来 reward hacking。稠密奖励确实可能让模型学得更快,因为它提供了 shaping 信号;但手写 reward function 往往很难和真实物理系统、智能体真正应该完成的行为一一对应。

罗剑岚举的一个典型例子是仿真里用 RL 学走路:如果奖励只写成“重心速度越快越好”,模型可能会找到一种不符合常识的“前进方式”,比如把头放在地上、腿朝上,用奇怪姿态让重心快速移动。为了修正这些问题,又要不断增加脚朝地、头朝上、姿态合理等额外项,最后 reward function 会变得非常复杂,而且仍然不一定和真实目标完全一致。

“机器人操作也是类似的。manipulation 任务里,很难一次性把所有细节奖励都写对;只要没写对,就可能被模型 hack。因此稀疏奖励的好处是,它至少能保证最终行为符合预期:成功就是 1,不成功就是 0。”他也坦言,尽管如此,稀疏奖励的问题也很明显:长程任务中信号很少,backup 不稳定,很难把正确信号传回前面的步骤。LWD 用 distributional value learning 来缓解这个问题,把原本的标量价值信号建模成分布,通过备份这个分布来保留更多统计信息。

对于“边部署边学习”可能带来的安全性与稳定性问题,罗剑岚也明确表示,在真实部署中,一定会有额外的安全层。模型不会每时每刻都在变化,更新是有节奏、有控制的。另外,基础模型本身成功率就比较高,在线学习更多是在这个基础上做提升,而不是完全不稳定的探索。

率先跑通闭环:最适合的是“middle ground”

当“部署也变成训练”这件事成立之后,它改变的就不只是单一算法或系统设计,而是整个具身智能的技术路径与产业逻辑。

在罗剑岚看来,这一过程可以参考自动驾驶的发展。自动驾驶没有办法在真实道路上随意在线试错,所以会发展出世界模型、高保真仿真器和离线评测体系;从产业链看,它也经历了从少量试采车、离线数据采集,逐渐转向部署数据回流、处理回流数据、再训练、再推送模型的迭代过程。

“机器人如果能形成 LWD 这样的部署闭环,数据链路也会从‘先采集、再训练、再部署’的离线管线,转向‘部署中持续回流数据,云端持续训练,再把新模型推回机器人’的过程。区别在于,机器人场景如果允许在线学习和试错,这套在线闭环的效率可能会更快。”

具体落地上,他认为,最适合率先跑通这一闭环的不会是完全开放的家庭场景,也不是高度结构化的工业环境,而是介于两者之间的“middle ground”,例如商超、药店和便利店。“这类半结构化场景的 layout 和物品类别有一定规律,不是完全不可控;但同时又存在丰富变化,对泛化性和性能都有要求。”

“大规模实验中,未来会涌现 scaling 现象”

LWD 的核心是,预训练要和部署结合,形成预训练和后训练共同驱动的部署闭环。谈及 VLA 和世界模型两条预训练路线的未来走向,罗剑岚表示,“如果 VLA 指的是 vision-language-action model,即同时包含视觉、语言和动作,那么它不太可能被世界模型简单取代。机器人要做动作,一定需要 vision,也一定需要 action。”

他指出,真正有争议的更多是 language 是否必要。如果机器人要在开放世界中完成复杂操作、长程任务拆解和类似人的推理,那么 language 是需要的,因为语言模型是目前实现这类推理能力最好的工具之一。

“但现在的 VLA 形式不一定会固定下来。比如是不是一定要把 action 当成若干 token 接到 VLM 后面、对齐到某个 latent space,这些都不一定。”

罗剑岚还透露,LWD 是在预训练模型基础上做后训练,对数据的利用效率很高,即使用的数据量不算特别大,也能看到性能提升。随着后训练时间增加,模型性能会在多个任务上同时提升。“更大规模实验中,未来可能会看到类似 test-time scaling 的现象。”

不过,罗剑岚也强调道,机器人不完全等同于语言模型,语言模型的 scaling 往往可以通过 pretraining loss 和下游 benchmark 建立比较清晰的关系。机器人还需要先把问题定义清楚,包括在哪些部署场景、优化哪些指标,才能进一步讨论 scaling 或涌现。