惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Blog — PlanetScale
Blog — PlanetScale
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Vercel News
Vercel News
B
Blog
腾讯CDC
P
Proofpoint News Feed
Google DeepMind News
Google DeepMind News
N
Netflix TechBlog - Medium
L
LangChain Blog
F
Fortinet All Blogs
T
The Blog of Author Tim Ferriss
人人都是产品经理
人人都是产品经理
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
I
InfoQ
IT之家
IT之家
酷 壳 – CoolShell
酷 壳 – CoolShell
aimingoo的专栏
aimingoo的专栏
D
DataBreaches.Net
Stack Overflow Blog
Stack Overflow Blog
The Cloudflare Blog
Last Week in AI
Last Week in AI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 三生石上(FineUI控件)
T
Tailwind CSS Blog

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
SceneGen:上海交大发布革命性单图生成3D场景框架,一次推理...
站外新闻 · 2026-06-18 · via Prompt 语宙

💡 站外导读:在游戏、影视、VR/AR及具身智能等领域,构建高保真3D场景是核心需求,但传统方法严重依赖人工建模、耗时的优化迭代或庞大的资产库检索,成为制约内容生产与技术创新的效率瓶颈。业界急需一种能从极简输入(如单张图片)直接、快速生成可用3D场景的自动化方案,以加速虚拟环境的开发与迭代。

SceneGen是上海交通大学研究团队开发的高效开源3D场景生成框架。能从单张场景图像及其对应的物体分割掩码出发,通过一次前向传播,直接生成包含完整几何结构、纹理和空间布局的3D场景。创新之处在于端到端的生成流程,无需依赖耗时的优化过程或从资产库中检索组装,显著提升了生成效率。技术核心包括局部与全局场景信息的聚合模块,以及能同时预测3D资产及其相对空间位置的位置预测头,确保了生成场景的物理合理性和视觉一致性。工具主要面向VR/AR、具身智能(Embodied AI)、游戏开发及室内设计等领域,为快速构建逼真的虚拟环境提供了强有力的解决方案。

  • SceneGen是什么
  • SceneGen的主要功能
  • SceneGen的技术原理
  • SceneGen的项目地址
  • SceneGen的应用场景
      • 📝 站长洞察 (Editor’s Insight)

SceneGen

SceneGen的主要功能

  • 单图像到3D场景生成:能从单张场景图像及其对应的物体分割掩码出发,直接生成包含完整几何结构、纹理和空间布局的3D场景。
  • 高效端到端生成:通过一次前向传播即可完成场景生成,无需依赖耗时的优化过程或从资产库中检索组装,显著提升了生成效率。
  • 局部与全局信息聚合:在特征提取过程中引入了聚合模块,有效结合局部细节与全局场景信息,确保生成场景的合理性和一致性。
  • 联合预测资产与位置:通过独特的位置预测头(position head),能同时预测场景中的3D资产(物体)及其精确的相对空间位置。
  • 高精度与真实性:在合成和真实数据集上,其生成的场景在几何精度、纹理细节和视觉质量方面均表现出优于先前方法的性能。

SceneGen的技术原理

  • 输入处理与特征提取:以单张场景图像及其对应的物体分割掩码作为输入,通过视觉编码器和几何编码器分别提取资产级(物体)特征和场景级全局特征。
  • 局部纹理细化:利用预训练的局部注意力模块对每个独立物体的纹理细节进行优化和增强,确保生成资产的视觉质量。
  • 全局特征融合:通过设计的全局注意力模块(聚合模块)整合局部物体特征与场景级布局信息,捕获物体间的空间关系和上下文依赖,保证场景合理性和一致性。
  • 联合解码与生成:使用现成的结构解码器处理融合后的特征,同时通过独特的位置预测头(position head)预测物体的精确相对空间位置,实现几何结构、纹理和位置的一次性生成。
  • 端到端优化:整个流程通过一次前向传播完成,无需迭代优化或外部资产检索,显著提升了生成效率,并在合成与真实数据集上实现了高精度和真实感。

SceneGen的项目地址

  • 项目官网:https://mengmouxu.github.io/SceneGen/
  • Github仓库:https://github.com/mengmouxu/scenegen
  • HuggingFace模型库:https://huggingface.co/haoningwu/scenegen
  • arXiv技术论文:https://arxiv.org/pdf/2508.15769

SceneGen的应用场景

  • 游戏与影视制作:能根据概念图或参考照片快速生成可直接使用的三维场景资源,显著缩短场景建模的时间成本,特别有利于独立游戏开发者等资源有限的团队。
  • 虚拟现实(VR)与增强现实(AR)‍:为VR/AR应用高效生成逼真且可交互的3D环境,满足具身智能(Embodied AI)等领域对高质量虚拟场景的迫切需求。
  • 房地产与室内设计:可将平面户型图或实景照片快速转换为可交互的三维展示,帮助中介、开发商或客户更直观地了解房屋的空间布局与设计效果。
  • 仿真与训练环境构建:为自动驾驶、机器人导航等需要大量高保真虚拟环境进行测试和训练的任务,提供高效的场景生成解决方案。

📝 站长洞察 (Editor’s Insight)

SceneGen的发布,标志着AIGC在3D内容生成领域迈入了‘端到端、零优化’的新阶段。其核心价值在于将复杂场景的生成流程简化为一次前向传播,这不仅是技术上的突破,更是对生产范式的重塑。它精准切中了当前数字孪生、元宇宙和具身智能发展中对海量、多样化3D环境的渴求。从主编视角看,此类工具正在从‘辅助建模’转向‘创造世界’,其意义堪比从胶片摄影到数码相机的跃迁。未来,结合大模型的理解与生成能力,我们或许将见证‘一句话生成可交互3D世界’成为现实,彻底降低虚拟内容创作的门槛,释放巨大的产业与创意潜力。