惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
IT之家
IT之家
博客园 - Franky
Stack Overflow Blog
Stack Overflow Blog
宝玉的分享
宝玉的分享
Recent Announcements
Recent Announcements
Engineering at Meta
Engineering at Meta
S
SegmentFault 最新的问题
V
Visual Studio Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
H
Help Net Security
V
V2EX
H
Hackread – Cybersecurity News, Data Breaches, AI and More
量子位
博客园 - 叶小钗
J
Java Code Geeks
博客园 - 【当耐特】
月光博客
月光博客
爱范儿
爱范儿
人人都是产品经理
人人都是产品经理
酷 壳 – CoolShell
酷 壳 – CoolShell
小众软件
小众软件

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
为什么Sora不能成为世界模型?
王智远 · 2025-03-07 · via 人人都是产品经理

尽管Sora能够生成逼真的视频画面,它是否真的能够成为理解世界、模拟物理规则的“世界模型”?本文将深入探讨Sora的技术原理、其在物理规则理解和因果关系推理上的局限性,供大家参考。

写完一篇空间智能文章,发到群里,聊它如何用虚拟空间数据训练机器人,帮人类理解世界。

结果有朋友提出个问题:

文生视频算不算空间智能?它也能生成虚拟场景,为什么不是最佳途径?

这问题挺有意思,我第一反应就想到了Sora。

文生视频“新星”崛起速度太快,几句话能生成一个视频,两年内字节、腾讯、甚至其他模型厂商纷纷压住该赛道。

不过,两年过去,有人发现它没那么完美,生成人像总带着“恐怖谷”的诡异,连Facebook首席人工智能科学家Yann LeCun也点评说:Sora不过是画得好看,压根不懂物理规律。

于是,我带着疑问研究了一下:看似强大的Sora,为什么不能成为真正的世界模拟器?它和空间智能的差距到底在哪?

01

爱因斯坦有句经典的名言:

“如果不能简单地解释一件事,那就说明还没有真正理解它。”(If you can’t explain it simply, you don’t understand it well enough.)

所以,想深入探究,就必须从深层次技术原理出发。

Sora的核心是“扩散模型”(Diffusion Model);从一堆随机噪点开始,通过AI一步步去掉杂乱,最终生成清晰的画面,再将这些画面串联成视频,听起来像魔法,其实背后是数学原理在支撑。

另外,它还有个帮手是“Transformer”,这个词不少人听说过。什么意思呢?它擅长处理序列数据,把零散的信息连成一条线。在Sora中,它将文字指令拆解,再把一帧帧画面串联成流畅的动作。

举个例子:

如果你输入“船在咖啡杯里航行”,Sora会先理解“船”和“咖啡杯”,然后,把船、水波荡漾、船身倾斜这些相关的词汇、场景串联起来。

这背后依赖海量视频数据和强大的算力,才能在几秒钟内生成几十秒的画面。

可是,你有没想过,仅仅依赖数据堆砌出来的结果,真的能理解物理世界吗?答案是不会。问题就出在架构上。

扩散模型擅长从数据中学习像素规律,预测下一步画面应该是什么样子;Transformer则能让帧与帧衔接得天衣无缝。所以从视觉上看,Sora很“聪明”,能够模仿真实视频的连续感,但仔细一想,问题就来了。

船怎么可能塞进杯子?我试过输入「猫跳到桌上」,画面流畅得没话说,结果猫腿直接穿过了桌面,就像游戏里的穿模。为什么会这样?

因为Sora的生成逻辑是“画得好看”,而不是“画得对”。

它不懂重力如何让脚落地,也不懂桌子为何会挡住猫腿,生成“恐怖谷”人像时,更一目了然,脸部细节一放大就崩了,它只知道靠像素预测,却没有考虑现实规则。

所以,Sora的强项和弱点是一枚硬币的两面。

视觉流畅是它的本事,不合理也是它的命门。正如Yann LeCun所说,它“不懂苹果为何落地”,我觉得这个观点很对:Sora的架构根本就没想去理解物理世界,只是想把画面糊弄得像真的。

既然Sora不懂物理世界,那它能否成为世界模拟器呢?

我认为有点悬。为什么?

世界模拟器是一个能够运行物理规则的虚拟环境,帮助机器人学习现实中的因果关系,但Sora生成的视频虽然看起来像回事,却毫无真实性。

你想想看,“船在杯子里”这样的视频去怎么去教机器人,机器人可能会以为杯子能装下万吨巨轮,这根本没好用。

因此,扩散模型和Transformer的目标是视觉生成,而不是物理模拟,Sora更像一个艺术工具,追求“好看”的画面,而不是“对”的世界,这让我觉得Sora局限性在于其架构没有对准目标。

02

既然这样问题来了:世界模拟器要具备哪些关键特性?

我觉得最基础的有三点:

  1. 得知道现实物品规则是什么样,搬到虚拟场景中,不能差太多;
  2. 理解物品与物品之间怎么相互影响的;
  3. 还得能把不同物品整合到一起,相互推理。

这么说,有点抽象,我举个例子:

你在教一个机器人怎么拿东西,世界模拟器里面的“虚拟杯子”,得模仿出真实杯子的重量、材质、形状,这样机器人才知道该用多大的力气去抓。

模拟器把重力以各指标模仿的不准确,机器人就会抓得太紧或者太松,东西就会掉下来,甚至还会被弄坏。

再聊聊智能交通。

现实中,堵车是个大难题。要解决它,得靠算法、数据分析,比如错峰出行。

假设有个世界模拟器,如果它没法模拟红绿灯时长、车辆速度,就无法预测哪里会堵车、什么时候堵,也做不了错峰规划。

同样,如果模拟器不清楚车辆摩擦力,就判断不了车子能不能在绿灯时顺利起步或红灯时及时停下;如果搞不清车辆之间的相互影响,交通就会乱套,甚至可能出事故。

所以,世界模拟器的作用,是把复杂的物理规则和物体之间的关系都搞清楚,这样才能让机器人、智能交通这些高科技的东西更好地工作。

对比来看,Sora在关键特性上明显不足。它在视觉生成方面做得很棒,但没办法满足世界模拟器对物理规则和因果关系推理的要求。

这种问题不只出现在Sora上,一些国产大模型也有类似架构缺陷。我刷抖音时经常看到有人用图生视频模型,结果人突然变成狗,看起来很搞笑,但明显不符合现实逻辑。

原因很简单,架构无法为世界模拟器提供真实的物理理解能力,因此,在具身智能或其他领域的应用就会受到很大限制。

可以得出一个结论:世界模型和文生视频的架构完全不一样。世界模型要模拟真实世界,必须懂物理规律和现实逻辑;文生视频主要生成画面,在逻辑和真实性上没那么严格。

03

我认为,相比之下,真正值得关注的,是更注重物理规则建模和具备因果关系推理方向的模型。比如:李飞飞的World Labs、黄仁勋的世界模型(Cosmos WFMs),以及群核科技的空间智能。

为什么拿他们举例呢?有三点:

先看目标,黄仁勋提出的 Cosmos WFMs(世界模型)是希望打造一个能模拟真实世界的「虚拟大脑」。这个大脑要懂物理规则,要知道物体怎么动、力怎么作用,还要明白事情的前因后果。

李飞飞的 World Labs 目标是让人工智能真正理解世界。它通过模拟物理规则、因果关系和复杂场景,让AI不仅能“看到”,还能“理解”世界。

比如:一个AI产品可以在虚拟场景中预测事情的发展,或根据不同情况做出合理决策。这种能力对提升机器人、自动驾驶等领域的智能化至关重要。

群核科技的空间智能,目标是希望把真实世界搬到数字世界里,让AI能看懂、能用,然后用数据帮助家居设计、建筑规划、以及AR、VR这些领域,帮行业更高效的干活。

说得直白点,是希望打造一个“数字孪生”的世界,让人、AI、空间里面思考和行动,解决实际问题。

既然有了目标,再看看三家技术实现路径。

Cosmos WFMs 的技术实现路径是通过构建生成式世界基础模型(WFMs),结合高级分词器、安全护栏和加速视频处理管道等关键技术,为开发者提供高效的开发工具。

具体来说,它利用NVIDIA NeMo对基础模型进行调优,并通过 GitHub 和 Hugging Face 提供开源支持,帮助开发者生成高仿真的物理数据。

此外,Cosmos 还专注于多视角视频生成、路径规划、避障等任务,进一步提升物理AI在机器人、自动驾驶等领域的应用能力。

报告里面的东西是不是很难懂?

通俗的说:他们做的这套系统,能让AI学会像人一样看路、规划路线、避开障碍物,还能生成各种角度的视频,特别适合用在机器人和自动驾驶这些领域。

李飞飞的World Labs的技术实现路径是,开发一种从2D到3D的智能转化技术,让AI不仅能看懂平面图片,还能生成完整的三维空间。

他们的系统从一张普通照片出发,估算出场景的3D结构,然后补全图片中看不到的部分,最终生成一个用户可以自由探索和互动的虚拟世界。

简单讲,用AI把平面图像变成立体空间,让人像在真实世界一样能走进去、四处看看。这种技术对机器人导航、虚拟现实等领域特别有用,因为它们都要“空间智能”来理解和应对复杂的3D环境。

群核科技搞空间智能,简单来说:  

1万台GPU服务器,用计算能力帮家居和建筑行业快速做出大量3D模型,顺便攒了一堆2D和3D的设计数据;把数据整合到一个平台上,能生成特别逼真的虚拟场景。

最后,企业可以用这个平台来训练机器人,比如:扫地机器人或者自动驾驶设备,让它们在虚拟世界里模拟真实环境,学会怎么动、怎么避障,变得更聪明。

因此,无论黄仁勋的Cosmos WFMs、李飞飞的World Labs,还是群核科技的空间智能,技术核心目标是通过模拟真实世界的物理规则和因果关系,让AI在空间内训练更聪明、更能解决实际问题。

04

我认为,要实现这一目标,离不开一个关键因素:高质量数据。数据是构建世界模型和空间智能的基础,可它也是发展里最大的「拦路虎」。

为什么?

我们说具身智能有点抽象,换一个更具体的词:“虚拟训练”。虚拟训练有两个重要方面:

一个是生成式的海量数据。就像GPT这样的文字模型,靠超大规模的数据和强大的算力来学习和推理;另一个是真实数据。枕头的大小、重量、材质,或者光线怎么反射、物体怎么碰撞,这些是物理交互场景。

这种真实数据来源于现实世界,直接决定虚拟训练能否模拟出符合实际逻辑的行为和反应;

换句话说,虚拟训练要两种数据:一种是“虚拟生成”的大数据,另一种是“真实场景”的物理数据,而后者,往往成为发展的瓶颈。

原因很简单:文生视频、文生图等生成式技术虽然能生成丰富的内容,但很难直接获取真实的物理规则和精确的交互细节。

比如,文生视频可以生成一个“滚动的球”,但它可能无法准确模拟球在不同材质地面上的摩擦力、弹跳高度或碰撞反应。

那真实场景的数据从哪儿来呢?只能从真实世界里来。

通过传感器、摄像头、激光雷达等设备,从现实环境中采集;你开车时,传感器会记录车辆的运动轨迹、力度变化、光线反射,还有车辆间距、行人行为,甚至天气对路况的影响。这些信息会被上传到平台,用来分析和训练。

但有了数据还不够。

平台的数据不能保证下一次操作一定精准,还得在虚拟环境里进行大量训练;自动驾驶汽车,要在虚拟环境里反复模拟行驶,可能要跑成千上万次,直到能应对各种复杂场景,才能用到现实世界里。

明白这些,你也就明白了,这不仅是自动驾驶、机器人领域的问题,其他行业也一样。

不管医疗、制造还是农业,世界模型和空间智能都需要海量的真实数据来支撑,并且要通过虚拟环境的反复训练来验证和优化能力。

换句话说,无论是自动驾驶、机器人导航,还是其他行业的具身智能应用,核心挑战都在于如何获取高质量的真实数据,再通过虚拟和现实的结合,让AI真正能解决实际问题;这才是未来技术落地的关键。

谁有底层架构、谁有数据,谁才有上牌桌的机会。

本文由人人都是产品经理作者【王智远】,微信公众号:【王智远】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Sora生成视频截图