惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
H
Help Net Security
云风的 BLOG
云风的 BLOG
Apple Machine Learning Research
Apple Machine Learning Research
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Hugging Face - Blog
Hugging Face - Blog
博客园_首页
D
Docker
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Blog — PlanetScale
Blog — PlanetScale
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
GbyAI
GbyAI
博客园 - Franky
B
Blog RSS Feed
Stack Overflow Blog
Stack Overflow Blog
L
LangChain Blog
量子位
V
Visual Studio Blog
Y
Y Combinator Blog
小众软件
小众软件
N
Netflix TechBlog - Medium
博客园 - 三生石上(FineUI控件)
Microsoft Security Blog
Microsoft Security Blog
雷峰网
雷峰网

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
李飞飞的下一个十年:从 ImageNet 到 World Labs,AI 的空间...
张艾拉 · 2025-10-27 · via 人人都是产品经理

从 ImageNet 到 World Labs,李飞飞的轨迹不仅是技术演进的缩影,更是 AI 认知范式的跃迁。本文聚焦她提出的“空间智能”理念,剖析其如何重塑人机交互、环境理解与未来的智能系统架构。一次人物回顾,也是一场认知革新。

2025 年 6 月 16 日,斯坦福教授李飞飞在旧金山的 AI Startup School 举行了一场炉边对谈,主题为《Spatial Intelligence is the Next Frontier in AI》。这场演讲标志着她的研究和创业方向从“视觉识别”正式迈向“空间智能”,并介绍了她最新创立的公司——World Labs

分享给大家。

一、从 ImageNet 到生成式 AI:AI 视觉的第一阶段

李飞飞是全球人工智能领域最具影响力的研究者之一。她曾担任谷歌云 AI 首席科学家、现任斯坦福大学计算机科学教授。她的工作在很大程度上定义了现代计算机视觉的发展路径。

她在演讲中首先回顾了2009年创建ImageNet的过程——这是一个包含上千万张标注图片的数据集,成为后来深度学习时代的基础性里程碑。

“2007 年,我们意识到机器学习的瓶颈不在算法,而在数据。”

在当时,神经网络在视觉领域并不流行。李飞飞与学生决定从互联网收集上亿张图片,建立全球视觉分类体系,并开放给整个研究界。

2012 年,AlexNet在 ImageNet 比赛中以前所未有的准确率胜出,开启了深度学习革命。

她强调,那一刻是“数据、算力和算法”三者首次融合:

  1. 数据:ImageNet提供了大规模训练样本;
  2. 算力:GPU计算被首次应用于深度学习训练;
  3. 算法:卷积神经网络(CNN)在视觉任务中展现出突破性性能。

这为后续的图像识别、自动驾驶、医疗影像、生成式模型奠定了基础。

二、从“识别物体”到“理解世界”:AI 视觉的第二阶段

在 ImageNet 之后,李飞飞的研究继续推进视觉智能的边界。

她与学生(包括后来的 OpenAI 联合创始人Andrej Karpathy)合作,探索了“图像描述”问题——让模型不仅识别物体,还能用自然语言描述场景。

“当人类看一张图时,不只是看到猫或椅子,而是理解‘这是一间会议室’,‘这里有人在讲话’。那是视觉理解的真正意义。”

2015 年,李飞飞团队发表了早期的“图像自动生成文字描述”论文,这成为“多模态学习”的重要起点。

她在演讲中提到,当时她曾半开玩笑地对学生说:

“我们能不能反过来,让模型从一句话生成图像?”

十年后,这个笑谈成为现实。

如今的扩散模型与生成式 AI(如 Midjourney、Sora)都在执行这一任务。

三、空间智能:AI 的下一个前沿

李飞飞认为,当前的大模型在语言领域已经进入平台期,而人工智能要想进一步接近通用智能,必须跨过一个新的门槛——空间智能

她在演讲中指出:

“语言是 1D 的,基于符号与序列;世界是 3D 的,甚至加上时间,是 4D 的。

AGI 如果不能理解三维世界,它就不完整。”

空间智能指 AI 理解、推理和生成三维世界的能力。这不仅包括识别和生成三维场景,还涉及物理约束、空间关系、物体交互与行为规划

李飞飞从生物进化的角度解释这一点:

  • 人类语言的演化大约花了几十万年;
  • 视觉系统的发展则经历了超过5亿年,从最早的三叶虫开始。

她认为视觉与空间感知才是智能的根本驱动力。

而相比语言模型的“文本自监督学习”,空间智能要面对更复杂的数据获取、物理一致性与多模态融合问题。

四、World Labs:面向世界模型的基础研究公司

为了探索空间智能的落地路径,李飞飞创立了World Labs

她在演讲中透露,公司聚焦于“世界模型”的构建——这类模型不仅能生成视觉图像,更能推理三维结构、重建真实场景并进行空间推断

联合创始团队由三位顶尖研究者组成:

  1. JustinJohnson:李飞飞在斯坦福的博士生,早期提出“神经风格迁移(NeuralStyleTransfer)”;
  2. BenMildenhall:NeRF(NeuralRadianceFields)第一作者,是三维重建技术的关键人物;
  3. ChristophLassner:Pulsar创始人,差分渲染(DifferentiableRendering)领域专家。

这些研究者代表了当下计算机视觉中最前沿的方向——从像素建模到场景重建,从图像理解到空间推理

World Labs 的目标,是开发一类全新的基础模型,使 AI 能在“生成”与“重建”之间自由切换,既能用于虚拟世界(如内容创作、游戏、数字孪生),也能延伸到现实世界(如机器人感知、自动驾驶、工业仿真)。

“语言大模型重塑了文字世界,而世界模型将重塑物理世界。”

她强调,空间智能模型将成为连接物理世界与数字世界的关键基础层。

五、空间智能的技术与产业意义

1. 技术层面:从 2D 到 3D 的模型重构

当前的生成模型(如扩散模型)主要处理二维像素,而空间智能需要在三维空间中理解几何、光照、运动和物理规律。

这意味着模型架构、数据采集、算力组织都要重构。

李飞飞指出,3D 感知是一个“病态问题”——三维到二维的投影存在信息丢失,需要融合多传感器和多模态信号才能解决。

2. 应用层面:从虚拟世界到现实世界

空间智能的应用范围远超图像识别。李飞飞提到三个主要方向:

  • 内容生成与设计:为建筑、游戏、影视提供可编辑的三维场景;
  • 机器人与自动化:让机器具备空间推理与操作能力;
  • 人机交互与沉浸体验:结合XR、AR硬件,实现更自然的交互方式。

她也认为,这将为“元宇宙”“数字孪生”等尚未成熟的领域带来新的技术基础。

六、从学术到创业:延续探索式的路径

李飞飞在演讲最后谈到自己的人生轨迹。

她早年移民美国时,在加州经营过一家自助洗衣店以资助学业;后来在普林斯顿任教,进入斯坦福与谷歌;2020 年在斯坦福创立“人本智能研究院”,推动人工智能与社会伦理结合。

她强调,无论在学术还是产业中,AI 的最终目标应当是“以人为中心的智能系统”:即在推动技术极限的同时,保持人类价值与社会责任的约束。

最后,过去十年,AI 的进步主要集中在“语言”这一维度:

从 GPT 到 Claude,再到 Gemini,机器已经可以理解和生成文字、代码与图像。

李飞飞所提出的“空间智能”,则代表着下一阶段的跃迁——让 AI 不仅能描述世界,更能在世界中行动、感知和推理。

以上,祝你今天开心。

作者:张艾拉 公众号:Fun AI Everyday

本文由 @张艾拉 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议