惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
有赞技术团队
有赞技术团队
博客园 - 【当耐特】
云风的 BLOG
云风的 BLOG
Martin Fowler
Martin Fowler
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
量子位
Engineering at Meta
Engineering at Meta
博客园 - 叶小钗
T
The Blog of Author Tim Ferriss
Recent Announcements
Recent Announcements
罗磊的独立博客
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
U
Unit 42
Microsoft Azure Blog
Microsoft Azure Blog
D
Docker
N
Netflix TechBlog - Medium
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog RSS Feed
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
V2EX

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
世界模型的门槛,谷歌可能迈过去了
世界模型工场 · 2026-05-19 · via 人人都是产品经理

Google 即将发布的 Gemini Omni 视频模型正在颠覆行业认知。两条泄露视频展示出惊人的多模态协调能力:数学推导过程的符号推理、手部动作的空间关系、语音与板书的时序同步完美融合,更在刚体与柔性体交互上突破物理模拟瓶颈。这可能是首个逼近'世界模型'的AI产品,或将重构内容创作链路与生态竞争格局。

Google可能要放大招了。

就在Google I/O 2026开幕前夕,两条由Google尚未发布的新视频模型Gemini Omni生成的视频悄悄流出。

没有任何官方预告,没有任何发布会造势,整个社交媒体都炸翻了。

一条视频是一位教授站在黑板前,手持粉笔,一步步推导三角恒等式;

另一条是两名男士坐在海边高档餐厅,安静地吃意大利面。

Reddit和X的评论区,铺天盖地的都是同一句话:”这不可能是现有的技术水平。”

两个看似普通的日常场景,为什么让见惯了AI生成内容的技术圈集体侧目?

01 令人震惊的视频

先说“教授黑板讲课”视频,生成它只用了一条prompt:

“一位教授在传统黑板上写出三角恒等式的数学证明,同时用语言解释他当前正在推导的步骤。”

一条指令,没有多轮对话,没有分步骤控制。

出来的结果是,教授手持粉笔,逐步写下公式,同时开口讲解,画面流畅,板书工整。

听起来好像平平无奇。

但如果你了解当前视频生成模型的技术边界在哪里,就会明白Gemini Omni同时做到了三件事,而这三件事,以前从来不会同时出现。

第一,推理对了。

黑板上的证明过程在数学上是成立的,不是视觉上长得像公式的符号堆砌,而是数学意义上真实有效的推导。

要做到这一点,模型至少要在token预测之外,具备一定的符号推理能力(symbolic reasoning)。

即知道下一步应该出现什么公式,而不是随机采样一个看起来像数学的图案。

语义准确性叠加在视觉生成之上,正是大多数视频模型会在这类测试中失败的原因。

第二,空间关系对了。

评测者描述,粉笔书写时的手部和手臂动作”读起来是自然的”,黑板上的方程式清晰可辨。

手部,是AI视频生成里公认最容易穿帮的地方。

手指数量错误、关节扭曲、与物体的空间关系失真,这是行业里几乎每一代视频模型都栽过的坑。

一支粉笔被正确握持,在黑板上留下有意义的笔迹,手腕的力道、落笔的角度,都在合理的范围内。

这一关,比画一只正常的手还要难,因为手在这里还要和黑板、粉笔、书写行为,形成完整的空间逻辑。

第三,时序对了。

这是最被低估的一件事。

教授写下某个推导步骤的同时,口头讲解的正是这个步骤,板书进度与语音内容保持同步。

这不只是音视频的帧级对齐(frame-level alignment),而是视觉事件、语义事件、时间事件三者之间的跨模态协调。

任何一个维度的理解出现偏差,结果就会是”手在写A,嘴在讲C”。

这种错位,人类观众一眼就能感知到。

如果这三件事只是分别做到,我们可以认为是三个专项模块拼在一起的结果。

但三者同时成立、彼此协调,更可能是模型在某个表征层面上,已经对”教授在黑板上讲课”这件事形成了整体性的语义理解。

换句话说,它知道这件事在现实世界里是什么样子,知道其中各个元素之间的约束关系。

这也是为什么”世界模型”这个词,会在这条视频流出后开始被频繁提及。

在黑板视频流出的同时,还有另一条视频一起曝光:两名男士在海边高档餐厅吃意大利面。

这个场景的选择,不是随机的。

2024年,一段AI生成的”Will Smith吃意大利面”视频在网上疯传。

画面里的手指数量不对,面条像活物一样扭动,叉子和嘴的空间关系完全失控。

那段视频成了早期AI视频生成能力的耻辱柱。

图为”Will Smith吃意大利面”视频截图

而这一次,Gemini Omni生成的结果,有用户评论是”令人难以置信地真实”。

这背后考验的,是模型对刚体与柔性体之间动态交互的建模能力:

叉子是硬的,面条是软的,两者在接触时会产生形变,而形变的方式必须符合现实世界里的物理直觉。

这正是早期生成模型在隐式物理模拟(implicit physics simulation)上的致命短板。

一个模型,在两条视频里,分别碰到了视频生成最难的两类问题:

一类是符号、语音与画面的同步,另一类是人与物体、刚体与柔性体的交互,并把这些问题推进到一个更可用的状态。

Gemini Omni展示的,更像是一个对世界有着更深理解的基座模型。

02 Gemini Omni的冲击

截至目前,Google还没有发布Gemini Omni的任何技术文档,也没有公开任何模型参数或基准测试数据。

但关于Gemini Omni的架构,目前外界存在三种解读。

最保守的说法是,Omni只是Veo的品牌重命名,底层推理引擎没有根本变化;

第二种说法是,Omni是在Gemini架构下重新训练的全新视频模型,与Veo并行但独立;

第三种说法最激进,认为Omni是一个真正意义上的原生多模态统一模型,在单一架构里原生处理文字、图像、视频和音频。

基于以上两段视频的表现,第三种解读反而像是”Omni”这个命名最合理的指向,毕竟在拉丁语中,”omnis”意味着所有。

如果Omni真正打通了多模态链路,模型竞争的焦点就会发生根本性的转变。

不再是谁能拍出更像电影的画面,而是谁是内容创作者的唯一目的地。

虽然现在还不能说Gemini Omni已经是世界模型,但它至少说明,视频生成正在逼近世界模型要解决的问题:

如何在时间中维持一个可解释、可编辑、可连续推演的场景。

产品层面的冲击同样不容忽视。

今天一条AI视频的生产链路,通常需要串联语言模型写脚本、图像模型做故事板、视频模型做动画渲染、再加外部剪辑软件做后期处理。

每一次跨工具切换,都意味着信息损耗和风格漂移。

一旦Gemini Omni对话式视频编辑成立,这条链路就可能被一个对话窗口替代了。

更关键的是,如果Omni被放入Gemini入口,并与Gmail、Google Docs、YouTube、Android深度打通,这是字节Seedance、快手Kling在分发层面根本无法复制的生态优势。

技术能力决定上限,生态决定规模。

Gemini Omni真正的威胁,或许不在于它今天生成的视频有多好,而在于它把视频生成能力放在了一个竞争对手根本进不去的地方,后者对前者几乎构成降维打击。

03 世界模型时刻或许来临

过去几年,生成式AI的进化路径相对清晰。

语言模型学会了读和写,图像模型学会了看和画,视频模型学会了动。

每一个模态都在自己的赛道上快速迭代,但它们之间始终存在一道隐形的墙。

模型知道文字,也知道图像,但它不理解文字和图像之间、声音和动作之间、逻辑和画面之间的约束关系。

如果说ChatGPT时刻定义了语言的边界,Sora时刻定义了视频的边界,那Gemini Omni指向的,很可能是第一个真正意义上的”世界模型时刻”。

模型第一次开始理解,模态与模态之间在现实世界里的约束关系,而不只是分别生成它们。

这是一次质的飞跃。

当然,Gemini Omni是否真正实现了这一点,在5月19日Google I/O 2026大会之前,没有人能给出确定的答案。

但泄露出来的视频,给出的信号已经足够有力。

接下来Google会在台上说什么,我们很快就会知道。

本文由人人都是产品经理作者【世界模型工场】,微信公众号:【世界模型工场】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。