




























AI正在经历从‘数字大脑’到‘具身智能’的历史性跃迁,从特斯拉Optimus到Figure 01,机器人不再只是生成文本和图片,而是具备物理行动能力。本文深度剖析具身智能产品的核心指标、技术路径与商业逻辑,揭示这场变革如何重新定义产品边界与人机关系。

过去的一年里,我最大的感触是:虽然ChatGPT已经通过了图灵测试,但它依然无法帮我倒一杯咖啡。
这听起来像是一个笑话,但这正是目前AI产业面临的最大痛点——“大脑”过载,而“肢体”缺失。
在过去的大模型浪潮中,我们通过Transformer架构成功地将人类互联网上所有的文本数据压缩进了一个神经网络里,创造出了一个全知全能的“数字大脑”。然而,这个大脑是被困在服务器里的,它没有眼睛,没有手,也没有脚。
但2024年以来,风向变了。从特斯拉的Optimus二代叠衣服,到Figure 01与OpenAI合作后的惊艳对话,再到1X发布的基于世界模型的NEO,我们正处于一个历史性的转折点:AI正在长出身体。
这不仅仅是硬件的升级,更是智能形态的根本跃迁。我们正在从“以数据为中心”的生成式AI,转向“以行动为中心”的Embodied AI。
作为产品经理,我们需要重新思考:当大模型不仅仅能生成文本和图片,而是能生成“动作”和“物理影响”时,产品的边界在哪里?自动化的终局,难道仅仅是让机器动起来吗?
在互联网产品时代,我们关注DAU、Retention)、CTR。在SaaS时代,我们关注LTV和CAC。
但是,当我们面对一个能在物理世界中移动、操作物体的“具身智能”产品时,传统的指标失效了。作为产品经理,我们必须重新定义什么是“可用性”。
在文本生成中,如果ChatGPT胡说八道了一句,用户可能只是笑一笑,重新生成一次。这是“软错误”。
但在具身智能中,如果机器人端咖啡时手抖了,或者把猫当成了足球踢开,这是“硬错误”,不仅是体验问题,更是安全事故。
因此,具身智能的核心指标不再是单一动作的准确率,而是端到端长程任务的成功率。
PM洞察: 具身智能产品的护城河,不在于机器人能翻几个跟头,而在于在非结构化环境中,连续执行复杂任务的稳定性。
传统的自动化是“特化”的。汽车工厂里的机械臂,这一秒在拧螺丝,下一秒还是拧螺丝,位置偏差不能超过毫米级。一旦环境变了,由于“熵增”,由于不可预测性,传统自动化就瘫痪了。
具身智能的“智能”,体现在泛化能力上。
作为产品经理,我们在验收产品时,不能只看Demo视频,必须引入“扰动测试”:在机器人工作时,故意扔一个球过去,或者推它一下,看它是否能动态调整策略。
具身智能不仅仅是工具,它是一个“Agent”。
在这个阶段,产品指标包括:
这部分稍微硬核一点,但对于理解产品迭代逻辑至关重要。目前的具身智能,正在经历类似自动驾驶从“规则驱动”到“端到端大模型”的变革。
早期的机器人学习主要依赖模仿学习。
逻辑很简单:人戴着遥控VR设备操作机器人做一千次倒水的动作,记录下数据,然后训练一个模型去预测在这个状态下应该怎么动。
缺点: 极其昂贵,且极度依赖数据。如果数据里没有“杯子把手断了”的情况,机器人遇到这种情况就会死机。这种基于“状态->动作”的映射,缺乏对物理世界的真正理解。
这里的明星技术是 1X Technologies提出的 World Model 路径,以及类似Sora在机器人领域的应用。
为什么视频模型是具身智能的解药?
人类婴儿通过观察世界学习物理规律。现在,AI通过观看互联网规模的视频(比如人很难观看视频的数亿小时视频,但AI可以),学习到了:
这种学习不需要人工标注,我们只需扩展**。当模型“看”过足够多的视频,它就建立了一个通用物理世界模型**。
这是一个非常科幻但正在变成现实的产品逻辑:
这意味着,机器人不再是僵硬地执行代码,而是像人一样,“先想象动作,再控制身体”。这种机制让机器人具备了处理突发情况的能力。
为什么现在的具身智能公司都在疯狂采集数据?
因为互联网上的视频大多是第三人称视角,而机器人操作需要第一人称视角。
利用人类第一人称视角的视频数据训练,能显著提升机器人的操作成功率。这就像我们看别人打篮球很难学会投篮,但戴着GoPro看自己投篮能更好地修正动作。
目前,Tesla Optimus通过人类操作员穿戴VR设备采集数据,正是为了弥补这个“数据鸿沟”。
作为产品经理,我们在定义硬件形态时,往往会问:为什么非要是人形?轮式不好吗?四足狗不好吗?
这是一个最底层的第一性原理:我们的物理环境是“人类中心主义”的。
如果设计一个轮式机器人,它在平地效率最高,但遇到楼梯就废了。如果设计一个机械臂底盘,它无法钻进狭窄的缝隙。(这块我体验过失败了,欢迎和大家交流)
人形结构在运动学上与人类一致,这意味着它可以直接继承人类在日常视频中表现出的行为先驗与环境适应性。它不需要改造环境,就能直接通过“模仿人”来适应环境。
具身智能正在经历从Demo到PMF的关键期。
PM洞察: 目前的产品策略是“降维打击”。先在结构化程度高的工厂里把硬件成本打下来,把模型练聪明,然后再进入非结构化的家庭场景。
具身智能的终局,绝对不是写死代码的自动化,而是自主进化。
现在的机器人大多是“指令-执行”模式。未来的具身智能将具备上下文记忆和闭环重规划能力。
这需要突破3D空间感知的局限,结合时序记忆,形成真正的情境感知。
机器人将不再完全依赖专家演示,而是通过仿真到现实和自我对弈来进化。
写到最后,我想跳出技术细节,谈谈这一切对我们意味着什么。
我们正在见证人类历史上第三次生产力革命的开端。
第一次是蒸汽机,用机械力替代了动物。
第二次是电力与计算机,用算力辅助了脑力。
第三次是具身智能,它将通用的智能注入到通用的机械躯体中。
对于AI产品经理来说,这不仅仅是一个新的风口,更是一次关于“人机关系”的重新定义。
自动化的终局,不是机器取代人,而是机器让人类从重复的物理束缚中解脱,去探索更广阔的精神宇宙。(当然这现阶段知识我的美好畅想,但我相信也就十年时间了)
而在那一天到来之前,我们这些产品经理,还有很长的路要走——去定义场景,去打磨体验,去确保那只伸向咖啡杯的机械手,既稳健,又温柔。
本文由 @兔主任观测员 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。