惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
有赞技术团队
有赞技术团队
博客园 - 【当耐特】
云风的 BLOG
云风的 BLOG
Martin Fowler
Martin Fowler
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
量子位
Engineering at Meta
Engineering at Meta
博客园 - 叶小钗
T
The Blog of Author Tim Ferriss
Recent Announcements
Recent Announcements
罗磊的独立博客
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
U
Unit 42
Microsoft Azure Blog
Microsoft Azure Blog
D
Docker
N
Netflix TechBlog - Medium
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog RSS Feed
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
V2EX

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
谷歌DeepMind发布BlenderFusion:AI+Blender融合,实现精准3D...
站外新闻 · 2026-06-26 · via Prompt 语宙

💡 站外导读:当前,高质量3D内容创作面临两大挑战:一是传统软件如Blender学习曲线陡峭、效率较低;二是AI生成工具虽快,却缺乏对场景几何与视角的精确控制。创作者常陷入‘要效率还是要精度’的两难。谷歌DeepMind推出的BlenderFusion框架,旨在破解这一困局。它通过‘对象中心化分层-基于Blender的编辑-生成合成’三步流程,将Blender的精确3D操控能力与生成模型的强大视觉合成能力深度融合,让设计师能像搭积木一样直观地编辑3D元素,并一键生成逼真合成图像,为影视、游戏、设计等领域带来效率与创意的新平衡。

BlenderFusion是Google DeepMind推出的生成式视觉合成框架,将传统的 3D 编辑软件(Blender)与AI 模型相结合,实现精准的几何编辑和多样的视觉合成。框架基于三个步骤实现,首先从源图像中提取感兴趣的对象并将其转换为可编辑的3D元素(对象中心化分层),在Blender中对对象进行多样化的编辑(基于Blender的编辑),最后用生成合成器将编辑后的元素无缝融合,生成最终的逼真图像(生成合成)。BlenderFusion在复杂视觉合成任务中表现出色,能实现对象、相机和背景的灵活、解耦且具有3D感知的操控。

  • BlenderFusion是什么
  • BlenderFusion的主要功能
  • BlenderFusion的技术原理
  • BlenderFusion的项目地址
  • BlenderFusion的应用场景
      • 📝 站长洞察 (Editor’s Insight)

BlenderFusion

BlenderFusion的主要功能

  • 精确的3D几何控制:基于Blender实现对对象的精确3D编辑,包括位置、旋转、缩放等变换,以及颜色、材质、形状等属性的修改。
  • 灵活的相机控制:支持独立于对象操作调整相机视角,实现复杂的视角变化。
  • 复杂的场景合成:将编辑后的对象和背景无缝融合,生成逼真的最终图像,支持多对象操作和复杂的场景编辑。
  • 解耦的对象和相机控制:在保持相机固定的情况下操作对象,或在保持对象固定的情况下调整相机,实现高度解耦的控制。
  • 泛化能力:支持应用在未见过的场景和对象,支持从简单到复杂的编辑任务,包括渐进式多步编辑。

BlenderFusion的技术原理

  • 对象中心化分层(Object-centric Layering):用视觉基础模型(如SAM2进行分割,Depth Pro进行深度估计)从输入图像中提取对象,转换为可编辑的3D元素。可选地使用图像到3D模型(如Rodin、Hunyuan3D)生成完整的3D网格,与2.5D表面网格对齐,以便在测试时进行更灵活的编辑。
  • 基于Blender的编辑(Blender-grounded Editing):将分层步骤得到的3D对象导入Blender,基于Blender的强大功能进行多样化的编辑操作,包括对象的基本变换、属性修改、非刚性变形等。支持相机控制和背景替换,为生成合成步骤提供精确的3D控制信号。
  • 生成合成(Generative Compositing):基于扩散模型的生成合成器将Blender的渲染结果与背景融合,生成最终的逼真图像。生成合成器基于双流架构,同时处理原始场景(编辑前)和目标场景(编辑后)的信息,基于交叉视图注意力机制将两者的信息进行融合。基于源遮罩(source masking)和模拟对象抖动(simulated object jittering)两种训练策略,提高模型在复杂编辑任务中的灵活性和解耦能力。

BlenderFusion的项目地址

  • 项目官网:https://blenderfusion.github.io/
  • arXiv技术论文:https://arxiv.org/pdf/2506.17450

BlenderFusion的应用场景

  • 影视制作:用在电影、电视剧的视觉效果(VFX)制作,添加虚拟对象、调整场景布局、改变背景等,创建逼真的合成场景。
  • 游戏开发:助力游戏开发者快速设计和编辑游戏场景,添加和调整游戏中的对象、改变相机视角等,创造逼真的游戏环境。
  • 广告:帮助广告设计师制作高质量的产品展示图,突出产品特点。
  • 建筑设计:建筑师和室内设计师、进行室内设计可视化,添加和调整家具、装饰品等,生成逼真的室内效果图。
  • 艺术创作:艺术家借助3D编辑和生成合成能力创作独特数字艺术作品,实现创意可视化。

📝 站长洞察 (Editor’s Insight)

BlenderFusion的意义远超一个工具升级,它标志着‘精确控制’与‘生成式AI’这对长期博弈的技术范式开始走向融合。过去,我们总在‘用AI换脸的快速但不可控’和‘用Maya/Blender精细但耗时’之间抉择。BlenderFusion给出的答案是:让AI担任‘高级合成师’,而人类继续用熟悉的3D工作流(如Blender)担任‘导演’。这背后是行业趋势的深刻转变——从追求‘全自动生成’转向构建‘人机协同’的精确创意流水线。尤其值得注意的是其‘解耦控制’能力,这为构建模块化、可复用的3D资产库提供了技术基础。随着3D内容需求在元宇宙、游戏、影视中的爆发,这类能弥合传统数字内容创作(DCC)工具与生成式AI鸿沟的框架,将成为下一代创意工具链的关键拼图。DeepMind此举,也是在AIGC领域布下了一颗面向专业应用的战略棋子。