惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
H
Help Net Security
腾讯CDC
宝玉的分享
宝玉的分享
H
Hackread – Cybersecurity News, Data Breaches, AI and More
L
LangChain Blog
爱范儿
爱范儿
T
The Blog of Author Tim Ferriss
J
Java Code Geeks
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MyScale Blog
MyScale Blog
Engineering at Meta
Engineering at Meta
N
Netflix TechBlog - Medium
D
Docker
V
V2EX
Last Week in AI
Last Week in AI
G
Google Developers Blog
IT之家
IT之家
C
Check Point Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
人人都是产品经理
人人都是产品经理
博客园 - 叶小钗
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 聂微东

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
Dive3D重磅发布:北大x小红书联手破解文本生成3D多样性难题,...
站外新闻 · 2026-06-27 · via Prompt 语宙

💡 站外导读:文本到3D生成长期面临一个核心矛盾:如何在保证生成质量的同时,避免输出结果千篇一律——即所谓的“模式坍塌”。传统方法依赖KL散度,倾向于生成最“安全”的单一结果,严重限制了创意多样性和实际应用价值。随着AIGC浪潮席卷游戏、影视、建筑等行业,市场对高质量、多样化3D资产的需求正呈指数级增长,技术突破迫在眉睫。

Dive3D是北京大学和小红书公司合作推出的文本到3D生成框架。框架基于分数的匹配(Score Implicit Matching,SIM)损失替代传统的KL散度目标,有效避免模式坍塌问题,显著提升3D生成内容的多样性。Dive3D在文本对齐、人类偏好和视觉保真度方面表现出色,在GPTEval3D基准测试中取得优异的定量结果,证明了在生成高质量、多样化3D资产方面的强大能力。

  • Dive3D是什么
  • Dive3D的主要功能
  • Dive3D的技术原理
  • Dive3D的项目地址
  • Dive3D的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Dive3D

Dive3D的主要功能

  • 多样化3D内容生成:根据文本提示生成多种风格和细节的3D模型,避免传统方法中常见的模式坍塌问题,即生成结果过于单一和相似。
  • 高质量3D模型生成:支持生成的3D模型具有较高的视觉保真度,包括精细的纹理细节、逼真的几何形状和合理的光照效果等。
  • 良好的文本对齐能力:支持生成的3D模型与输入的文本描述高度匹配,准确地反映文本中提到的各种元素和特征。
  • 支持多种3D表示形式:支持生成不同类型的3D表示,如神经辐射场(NeRF)、高斯点云(Gaussian Splatting)和网格(Mesh)等,满足不同应用场景和用户的需求。

Dive3D的技术原理

  • 分数隐式匹配(Score Implicit Matching,SIM)损失:Dive3D的核心技术之一。传统的基于KL散度的损失函数(如在Score Distillation Sampling,SDS中使用)会导致模式寻求行为,让生成模型倾向于生成高密度区域的样本,限制生成的多样性。SIM损失直接匹配生成内容的概率密度梯度场(分数)和扩散先验的分数,避免KL散度的问题,鼓励模型探索多个高概率区域,在保持保真度的同时提高生成的多样性。
  • 统一的散度视角框架:Dive3D将扩散蒸馏和奖励引导优化整合到一个基于散度的框架中。框架包括三个核心的散度损失,条件扩散先验损失(CDP)、无条件扩散先验损失(UDP)和奖励损失(ER)。基于合理地组合和调整损失的权重,在生成的多样性、文本对齐和视觉质量之间取得平衡。
  • 基于扩散模型的优化:Dive3D用预训练的2D扩散模型(如Stable Diffusion)作为先验知识,基于多视图渲染将3D表示优化为与文本提示相匹配的2D图像。在优化过程中,迭代地对3D模型进行渲染、计算损失并更新模型参数,让生成的3D模型的渲染图像逐渐接近预训练扩散模型所期望的图像分布。
  • 高效的优化算法:为提高优化效率,Dive3D用高效的优化算法和策略。例如,引入分类器自由引导(Classifier-Free Guidance,CFG)技术,在优化过程中更好地平衡文本条件和无条件的生成效果;基于合理设置噪声时间表和优化步长等参数,加快优化收敛速度,减少生成时间。

Dive3D的项目地址

  • 项目官网:https://ai4scientificimaging.org/dive3d/
  • GitHub仓库:https://github.com/ai4imaging/dive3d
  • arXiv技术论文:https://arxiv.org/pdf/2506.13594

Dive3D的应用场景

  • 游戏开发:快速生成游戏中的角色、道具和场景。根据游戏剧本中的描述,自动生成具有不同风格和细节的游戏角色模型,减少美术设计的工作量。
  • 影视制作:为电影、电视剧和动画制作提供创意原型和概念设计。根据剧本描述生成场景和角色的3D模型,帮助导演和美术师更好地进行创意构思。
  • 建筑设计:根据文本描述生成建筑模型,帮助建筑师快速展示设计概念,进行方案比较和优化。
  • 虚拟场景构建:为VR和AR应用生成逼真的虚拟场景和物体。在虚拟旅游应用中,根据用户输入的地点描述生成相应的3D场景,让用户身临其境地体验虚拟环境。
  • 科学教育:生成复杂的科学模型,如生物细胞、分子结构等,帮助学生更好地理解抽象的科学概念。

📝 站长洞察 (Editor’s Insight)

Dive3D的发布标志着文本到3D生成进入了“多样性驱动”的新阶段。其核心创新——分数隐式匹配(SIM)损失——从底层优化目标上根治了模式坍塌,这比单纯堆叠数据或算力更具范式意义。北大与小红书的产学研结合,也揭示了中国AI产业的一个新动向:头部内容平台正从应用层深入到基础模型研发,试图构建自己的内容生成技术护城河。未来,谁能更好地平衡多样性、保真度与生成效率,谁就能在AIGC内容供给端占据主导。Dive3D对多表示形式(NeRF、高斯点云、网格)的支持,也体现了工程化落地的前瞻性,有望成为下一代3D内容生产线的核心组件。