惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
F
Fortinet All Blogs
J
Java Code Geeks
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
V
Visual Studio Blog
M
MIT News - Artificial intelligence
腾讯CDC
Last Week in AI
Last Week in AI
The Cloudflare Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
Jina AI
Jina AI
Microsoft Security Blog
Microsoft Security Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
P
Proofpoint News Feed
博客园 - 叶小钗
Recent Announcements
Recent Announcements
T
Tailwind CSS Blog
Engineering at Meta
Engineering at Meta
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
人人都是产品经理
人人都是产品经理
L
LangChain Blog
博客园 - 司徒正美
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

Java for You

语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u 智能体上线最难的不是提示词:Agents API开始托管运行时 - Java for You - java4u AI任务一多就堵车:问题可能不在模型速度 - Java for You - java4u AI能写无人机控制代码后,安全边界不能只守提示词 - Java for You - java4u AI代码扫描能批量开了,但它还不能替你挡住合并 - Java for You - java4u 图片一多首字就慢?用EPD拆开多模态推理三段路 - Java for You - java4u 蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转 - Java for You - java4u NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型 - Java for You - java4u 人人都能问公司数据之后,数据分析师反而更重要了 - Java for You - java4u 语音AI开始边听边说,改变的不只是响应速度 - Java for You - java4u Agent到底比一次大模型调用多了什么?小白从这张流程图看懂 - Java for You - java4u ChatGPT服务10亿周用户后,最难扩展的可能不是模型 - Java for You - java4u AI编码助手的日志也会泄密:先划清明文边界 - Java for You - java4u
机器人动作误差降近九成,真正该先看数据切分 - Java for You...
蜗牛 · 2026-09-13 · via Java for You

彩色代码屏

机器人基础模型的进步,不只看参数量,还看它能否适应一台具体机器的动作分布。可引用的核心判断是:机器人微调最值钱的结果不是“误差降了九成”,而是训练回合与评测回合彻底隔离后,这个数字还站得住。对准备做具身智能的团队,这比再换一个更大的模型更接近工程起点。

发生了什么

AWS在9月10日公开了一套π0(Pi-Zero)微调流程。π0是约30亿参数的视觉语言动作模型,输入多视角图像、机器人自身状态和语言指令,输出未来50个时间步的连续动作。案例使用DROID的100个真实机械臂回合和LIBERO-10的379个仿真回合,在一台包含8张H100 80GB GPU的节点上训练2万步。

官方报告称,微调后DROID的均方误差(MSE)从0.5478降至0.05664,下降89.7%;LIBERO从0.7677降至0.08548,下降88.9%。但真正重要的补充是:早期版本曾因评测回合混入训练而得到约96%的更高提升,修正切分后才回落到约89%。这不是“数字变差”,而是结果终于可讨论。

关键事实与证据

训练配置、修正记录和结果均来自AWS Physical AI技术文章,可复用清单在awslabs公开仓库。DROID使用0—79回合训练、80—99回合留出;LIBERO使用0—303训练、304—378留出。

还要注意两个限定。第一,最终报告只取各数据集前5个留出回合求平均,样本很小。第二,指标是动作预测误差,不是机械臂拿起物体、放对位置的闭环任务成功率。官方也把“跑完整留出集”和“在LIBERO闭环测成功率”列为下一步。因此,89%只能表述为特定离线评测中的误差下降。

技术原理:模型怎样从图像走到动作

π0先用视觉语言主干理解画面与指令,再由动作专家用流匹配生成连续控制量。流匹配可以理解为学习一个速度场,把随机噪声沿常微分方程路径推向合理动作。它一次生成50步动作块,减少逐步生成带来的等待。

这个案例中,一次欧拉积分在H100上约197—199毫秒;在小样本扫描里,1步与10步的离线误差相当甚至略好。不过这不证明“一步永远最好”,只说明针对已微调模型和这5个回合,更多积分步没有显出收益。

mermaid diagram

一个具体场景

假设要让Franka机械臂把陌生颜色的杯子放进托盘。预训练模型知道“杯子”和“托盘”的语义,却未必知道这台机械臂七个自由度的数值范围、相机位置和夹爪时序。少量本机数据的作用,是把通用视觉语义对齐到具体动作坐标。

如果同一个抓取回合的相邻片段同时出现在训练和测试中,背景、光照、物体位置都高度相似,模型可能只是记住轨迹。严格按完整回合切分,才更接近它面对新轨迹时的表现。

对开发者和普通人的影响

对开发者,具身模型的竞争正在从“有没有通用模型”转向“能否低成本适配不同本体”。数据格式、相机键映射、动作归一化、回合切分和存储管理,都会比一句提示词更影响结果。对普通人,这意味着机器人学会新任务仍需真实示范和安全验证,并非下载权重就能在任意家庭环境可靠工作。

我的判断及依据

我的判断是,未来一年机器人基础模型最有价值的公开成果,会是可复现的适配与评测协议,而不只是更大的预训练模型。依据一是此次约96%到89%的变化完全来自评测纪律;依据二是微调后峰值显存约15.7GB,推理并不要求80GB卡,真正昂贵的是数据采集、训练迭代和闭环验证。

适用边界与风险

动作误差下降不保证任务成功,也不能覆盖碰撞、急停、遮挡和未知物体。LIBERO数据可能已进入π0预训练混合,不能当作完全陌生分布;DROID子集也只有100回合。厂商在自家云硬件上的结果需要其他机器本体和算力复现。任何真机部署都应加动作范围限制、速度限制、碰撞检测和人工急停。

今天就能执行的检查表

  • 按完整任务回合切分,禁止相邻帧跨越训练集与测试集。
  • 同时报MSE、平均绝对误差、任务成功率和安全事件,别用一个指标代替全部。
  • 在训练前记录数据集版本、回合总数、相机键、动作单位与归一化方式。
  • 先用仿真闭环回放,再上低速、限力真机;失败样本要保留传感器与动作日志。
  • 对不同积分步数、延迟和成功率做联合曲线,避免只追离线误差。

如果只能先补一项机器人评测,你会选择扩大离线样本,还是直接做成本更高的闭环任务成功率?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。