惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MongoDB | Blog
MongoDB | Blog
V
V2EX
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
有赞技术团队
有赞技术团队
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
罗磊的独立博客
月光博客
月光博客
爱范儿
爱范儿
D
Docker
U
Unit 42
P
Proofpoint News Feed
I
InfoQ
腾讯CDC
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
L
LangChain Blog
V
Visual Studio Blog
IT之家
IT之家
Vercel News
Vercel News
G
Google Developers Blog
M
MIT News - Artificial intelligence
美团技术团队
The GitHub Blog
The GitHub Blog
阮一峰的网络日志
阮一峰的网络日志
MyScale Blog
MyScale Blog

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
谷歌DeepMind发布Genie 3:可实时生成动态虚拟世界,AI世界模...
站外新闻 · 2026-06-24 · via Prompt 语宙

💡 站外导读:当前AI智能体训练正面临“环境瓶颈”——缺乏真实、动态且可无限生成的虚拟训练场。传统方法依赖静态数据或人工构建场景,成本高昂且难以规模化。与此同时,AIGC技术正从生成静态内容(文本、图像)向生成动态、可交互的复杂系统演进。谷歌DeepMind最新发布的Genie 3,正是瞄准这一核心痛点,通过实时生成高度连贯的虚拟世界,为AI研究开辟了全新路径,标志着世界模型技术进入新阶段。

Genie 3是谷歌DeepMind推出的新一代通用世界模型,能实时生成高度动态且连贯的虚拟世界。模型具备模拟物理现象、自然生态系统、奇幻场景和历史场景的能力,支持用文本提示改变世界状态,如天气变化或引入新物体。Genie 3实现了长达数分钟的视觉一致性,视觉记忆能追溯到一分钟前。模型为AI智能体提供训练环境,支持复杂目标的实现,其技术突破为AI研究和应用带来新的可能性。Genie 3现已通过实验性原型Project Genie开放试用,美国18岁以上Google AI Ultra订阅用户可率先体验。

  • Genie 3是什么
  • Genie 3的主要功能
  • Genie 3的技术原理
  • Genie 3的项目地址
  • Genie 3的局限性
  • Genie 3的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Genie 3

Genie 3的主要功能

  • 模拟物理世界:能生成水流、光照等自然现象,并与复杂环境进行交互。
  • 模拟自然世界:支持生成充满生命力的生态系统,包括动物行为和复杂植物。
  • 创建动画和奇幻世界:能生成富有想象力的奇幻场景和动画角色,例如彩虹桥上的卡通狐狸。
  • 探索地点和历史场景:支持跨越时空,重现历史场景或探索不同地点。
  • 实时交互能力:支持实时交互,每秒生成 20-24 帧画面,保持数分钟的一致性。
  • 长时程一致性:生成的环境在数分钟内保持物理一致性,视觉记忆可追溯到一分钟前。
  • 由提示词驱动的世界事件:支持用文本输入改变世界状态,如天气变化或引入新物体。
  • 智能体训练:为 AI 智能体提供训练环境,支持复杂目标的实现。

Genie 3的技术原理

  • 自回归生成:Genie 3 用自回归生成技术,逐帧生成画面。在生成每一帧时,模型需要考虑之前生成的轨迹,保持环境的一致性。
  • 长时程一致性:基于复杂的记忆机制,Genie 3 能在数分钟内保持环境的物理一致性,让用户在一分钟后重新访问某个地点,模型也能调取之前的相关信息。
  • 动态世界生成:与依赖显式 3D 表征的方法(如 NeRFs 和高斯溅射)不同,Genie 3 根据世界描述和用户行为逐帧生成世界,让生成的环境更加动态和丰富。
  • 文本驱动的世界事件:通过文本输入,用户可以改变世界的状态,例如改变天气或引入新物体。增强了交互性,为 AI 智能体的训练提供了更广泛的应用场景。

Genie 3的项目地址

  • 项目官网:https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
  • 在线体验https://labs.google/projectgenie

Genie 3的局限性

  • 有限的动作空间:支持的智能体直接执行的动作范围有限,影响其在复杂任务中的自主性。
  • 多智能体交互的复杂性:精确模拟多个独立智能体之间的复杂互动仍具挑战,限制了在多智能体系统中的应用。
  • 真实世界位置的准确表征:无法用完美的地理精度模拟真实世界的地点,限制了在地理信息系统中的应用。
  • 文本渲染能力有限:只有在输入描述中提供文本信息时,Genie 3 才能生成清晰易读的文字,限制了在需要精确文本显示的场景中的应用。
  • 有限的交互时长:目前仅支持数分钟的连续交互,限制了在需要长时间交互的应用中的使用。

Genie 3的应用场景

  • 教育与培训:创建虚拟实验室和历史场景,帮助学生通过沉浸式体验加深对科学和历史知识的理解。

  • 娱乐与游戏开发:作为下一代游戏引擎的核心技术,能实时生成丰富多变的游戏世界,提供更沉浸式的娱乐体验。

  • AI 研究与开发:为 AI 智能体提供复杂的虚拟环境,用在训练和测试其导航、决策和学习能力,助力人工智能研究。

  • 建筑设计与城市规划:模拟城市环境,帮助建筑师和规划师评估不同设计方案对交通、环境和居民生活的影响。

  • 心理健康与治疗:生成的虚拟环境用在心理治疗,帮助患者应对创伤后应激障碍(PTSD)和恐惧症等心理问题。

📝 站长洞察 (Editor’s Insight)

Genie 3的发布,标志着AI从“内容生成”正式迈入“世界生成”时代。它不仅仅是一个更强大的生成工具,而是构建了一个可与之交互的、具有物理规则和记忆的完整模拟环境。这精准切中了通用人工智能(AGI)发展的关键路径——在无限多样的虚拟世界中进行大规模、低成本、高安全性的智能体训练。其技术核心在于解决了长时程一致性和实时动态生成的平衡,这是之前NeRF等技术难以企及的。从产业角度看,它将成为游戏、模拟训练、自动驾驶测试的“世界基底”。其局限性,如交互时长和动作空间,恰恰指明了下一代迭代的方向。DeepMind此举再次巩固了其在基础模型前沿的领先地位,同时为整个AIGC生态打开了想象空间:未来的竞争,可能不在于生成一张图或一段视频,而在于谁能生成并运行一个更复杂、更智能的世界。