惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

宝玉的分享
宝玉的分享
I
InfoQ
B
Blog
Engineering at Meta
Engineering at Meta
Y
Y Combinator Blog
GbyAI
GbyAI
T
The Blog of Author Tim Ferriss
G
Google Developers Blog
量子位
The Cloudflare Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
小众软件
小众软件
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 司徒正美
美团技术团队
人人都是产品经理
人人都是产品经理
博客园 - 三生石上(FineUI控件)
酷 壳 – CoolShell
酷 壳 – CoolShell
大猫的无限游戏
大猫的无限游戏
罗磊的独立博客
博客园 - 聂微东
IT之家
IT之家

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
V-JEPA 2开源:Meta AI世界大模型如何让机器人零样本理解物理...
站外新闻 · 2026-06-28 · via Prompt 语宙

💡 站外导读:当前AI在物理世界的交互能力仍是瓶颈,机器人往往依赖大量标注数据才能执行新任务。Meta AI最新开源的V-JEPA 2世界大模型,旨在突破这一限制。该模型通过自监督学习从海量视频中掌握物理规律,具备理解、预测和规划能力,使机器人能在全新环境中零样本完成抓取等操作。这不仅降低了机器人应用门槛,更标志着AI向通用机器智能迈出坚实一步,为具身智能发展开辟新路径。

V-JEPA 2 是 Meta AI 推出的世界大模型,基于视频数据实现对物理世界的理解、预测和规划。V-JEPA 2 用于 12 亿参数的联合嵌入预测架构(JEPA),基于自监督学习从超过 100 万小时的视频和 100 万张图像中训练而成。V-JEPA 2 在动作识别、动作预测和视频问答等任务上达到新的性能高度,能用在零样本机器人规划,让机器人在新环境中与不熟悉的物体进行交互。V-JEPA 2 是迈向高级机器智能的重要一步,为未来 AI 在物理世界中的应用奠定基础。

  • V-JEPA 2是什么
  • V-JEPA 2的主要功能
  • V-JEPA 2的技术原理
  • V-JEPA 2的项目地址
  • V-JEPA 2的应用场景
      • 📝 站长洞察 (Editor’s Insight)

V-JEPA 2

V-JEPA 2的主要功能

  • 理解物理世界:基于视频输入理解物体、动作和运动,捕捉场景中的语义信息。
  • 预测未来状态:基于当前状态和动作,预测未来视频帧或动作的结果,支持短期和长期预测。
  • 规划和控制:用预测能力进行零样本机器人规划,让机器人在新环境中完成任务,如抓取、放置和操作物体。
  • 视频问答:与语言模型结合,回答与视频内容相关的问题,涉及物理因果关系、动作预测和场景理解等。
  • 泛化能力:在未见过的环境和物体上表现出良好的泛化能力,支持在新场景中的零样本学习和适应。

V-JEPA 2的技术原理

  • 自监督学习:基于自监督学习从大规模视频数据中学习通用视觉表示,无需人工标注数据。
  • 编码器-预测器架构
    • 编码器:将原始视频输入转换为语义嵌入,捕捉视频中的关键信息。
    • 预测器:基于编码器的输出和额外的上下文(如动作信息),预测未来的视频帧或状态。
  • 多阶段训练
    • 预训练阶段:用大规模视频数据训练编码器,学习通用的视觉表示。
    • 后训练阶段:在预训练的编码器基础上,用少量机器人交互数据训练动作条件预测器,让模型能规划和控制。
  • 动作条件预测:引入动作信息,让模型能预测特定动作对世界状态的影响,支持基于模型的预测控制。
  • 零样本规划:用预测器在新环境中进行零样本规划,基于优化动作序列来实现目标,无需额外的训练数据。

V-JEPA 2的项目地址

V-JEPA 2的应用场景

  • 机器人控制与规划:支持零样本机器人规划,让机器人能在新环境中完成抓取、放置等任务,无需额外训练数据。
  • 视频理解与问答:结合语言模型,回答与视频内容相关的问题,支持动作识别、预测和视频内容生成。
  • 智能监控与安全:检测异常行为和环境变化,用在视频监控、工业设备监测和交通管理。
  • 教育与培训:用在虚拟现实和增强现实环境,提供沉浸式体验和技能培训。
  • 医疗与健康:辅助康复训练和手术操作,基于预测和分析动作提供实时反馈和指导。

📝 站长洞察 (Editor’s Insight)

V-JEPA 2的发布,清晰地指向了AI的下一个前沿:具身智能与世界模型。它不再是单纯的视觉识别,而是构建一个能“理解因果、预测未来”的内部世界模型,这是实现AGI的基石之一。其零样本规划能力尤为关键,意味着AI开始摆脱对特定任务数据的依赖,向真正的泛化智能演进。从产业角度看,这为工业自动化、服务机器人等领域带来了即插即用的可能性,极大缩短了部署周期。但挑战同样存在,模型在复杂动态环境中的可靠性、安全性及伦理问题仍需深入探索。Meta此举不仅巩固了其在基础AI研究上的领导地位,更将推动整个行业从‘感知AI’向‘行动AI’加速迁移。