惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
爱范儿
爱范儿
博客园_首页
博客园 - 【当耐特】
V
Visual Studio Blog
博客园 - 叶小钗
月光博客
月光博客
美团技术团队
J
Java Code Geeks
小众软件
小众软件
Y
Y Combinator Blog
博客园 - Franky
Martin Fowler
Martin Fowler
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
IT之家
IT之家
MyScale Blog
MyScale Blog
人人都是产品经理
人人都是产品经理
Microsoft Security Blog
Microsoft Security Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
阮一峰的网络日志
阮一峰的网络日志
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
智元Genie Envisioner开源:首个机器人世界模型平台,视频生...
站外新闻 · 2026-06-24 · via Prompt 语宙

💡 站外导读:机器人从单一任务迈向通用操作,面临策略泛化难、仿真-现实差距大、评估标准缺失三大痛点。随着具身智能成为AI下一个主战场,业界急需一个能统一学习、仿真与评估的底层平台。智元机器人开源的Genie Envisioner,正是瞄准这一空白,试图用世界模型的技术范式,为机器人提供从“看视频”到“会操作”的通用能力基座。

Genie Envisioner 是智元推出的首个机器人世界模型开源平台。平台通过一个统一的视频生成框架,集成策略学习、评估和仿真功能。核心组件包括 GE-Base(大规模指令条件视频扩散模型)、GE-Act(动作轨迹解码器)、GE-Sim(神经仿真器)和 EWMBench(标准化基准测试套件)。平台支持跨机器人形态的策略泛化,助力机器人在复杂任务中实现精准操作,推动具身智能的发展,为机器人技术研究和应用提供强大支持。

  • Genie Envisioner是什么
  • Genie Envisioner的主要功能
  • Genie Envisioner的技术原理
  • Genie Envisioner的项目地址
  • Genie Envisioner的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Genie Envisioner

Genie Envisioner的主要功能

  • 策略学习:基于 GE-Base 捕捉机器人与环境交互的动态,生成用在动作决策的策略。
  • 动作生成:将潜在空间的表示映射为可执行的动作轨迹,支持多种机器人形态。
  • 仿真支持:提供高保真度的仿真环境,用于策略的闭环测试和优化。
  • 性能评估:提供标准化的基准测试,衡量视觉保真度、物理一致性和指令-动作对齐。

Genie Envisioner的技术原理

  • GE-Base:GE-Base 是大规模的指令条件视频扩散模型,能捕捉机器人交互的空间、时间和语义动态。将复杂的机器人交互表示在结构化的潜在空间中,便于后续处理。
  • GE-Act:GE-Act 用轻量级的流匹配解码器,将潜在空间的表示映射到可执行的动作轨迹。支持在多种机器人形态之间进行策略迁移,仅需少量监督信号。
  • GE-Sim:GE-Sim 是基于动作条件的神经仿真器,用在生成高保真度的回放。支持在虚拟环境中进行策略开发和优化,减少物理实验的需求。
  • EWMBench:EWMBench 提供一套标准化的测试套件,用在衡量模型的视觉保真度、物理一致性和指令-动作对齐程度。帮助研究人员和开发者评估和优化模型性能。

Genie Envisioner的项目地址

  • 项目官网:https://genie-envisioner.github.io/
  • GitHub仓库:https://github.com/AgibotTech/Genie-Envisioner
  • arXiv技术论文:https://arxiv.org/pdf/2508.05635

Genie Envisioner的应用场景

  • 工业自动化:在工厂生产线上,帮助机器人更精准地完成复杂的装配、搬运和质量检测任务,提高生产效率和产品质量。
  • 物流与仓储:用在物流中心的货物分拣和搬运,机器人根据指令快速识别和处理不同形状和大小的物品,优化物流流程。
  • 服务机器人:在餐厅、酒店或家庭环境中,赋予机器人理解和执行人类指令的能力,提供更智能的服务,如送餐、清洁和物品递送。
  • 医疗辅助:在医疗场景中,机器人进行手术辅助、康复训练或药品配送,提升医疗服务的精准度和效率。
  • 教育与研究:为高校和研究机构提供强大的实验平台,支持机器人学习、人工智能和具身智能的研究,推动相关技术的发展。

📝 站长洞察 (Editor’s Insight)

Genie Envisioner的发布,标志着具身智能研发从“模型+数据”的碎片化阶段,正式迈入“世界模型驱动”的系统化时代。其核心突破在于将视频生成模型(GE-Base)作为统一的动态表征,这与Sora等视频生成模型的技术路径一脉相承,但目标从“生成内容”升级为“生成并验证策略”。这解决了机器人领域长期存在的“仿真到现实”迁移难题。更关键的是,平台通过GE-Act解码器实现跨机器人形态策略迁移,意味着一套训练好的“世界经验”可快速适配不同硬件,极大降低研发成本。结合标准化的EWMBench,平台实质上在构建机器人领域的“ImageNet”和“PyTorch”,有望形成生态引力。智元此举不仅是技术输出,更是生态卡位——谁掌握了世界模型的标准与开源社区,谁就拥有了下一代机器人操作系统的底层话语权。这是从算法创新到平台竞争的战略升维。