惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿
aimingoo的专栏
aimingoo的专栏
博客园 - 叶小钗
H
Help Net Security
Microsoft Security Blog
Microsoft Security Blog
The Cloudflare Blog
S
SegmentFault 最新的问题
小众软件
小众软件
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 司徒正美
The GitHub Blog
The GitHub Blog
量子位
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
V2EX
Martin Fowler
Martin Fowler
博客园 - 【当耐特】
J
Java Code Geeks
D
DataBreaches.Net
云风的 BLOG
云风的 BLOG
F
Fortinet All Blogs
Blog — PlanetScale
Blog — PlanetScale
Last Week in AI
Last Week in AI

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
苹果开源SHARP模型:1秒内将单张2D照片转为逼真3D场景,速度...
站外新闻 · 2026-06-14 · via Prompt 语宙

💡 站外导读:在AI快速渗透各行业的今天,从单张2D图像快速生成高质量3D场景的需求日益迫切,无论是VR/AR内容创作、影视特效,还是自动驾驶的环境感知,都面临传统3D建模速度慢、成本高的瓶颈。苹果开源的SHARP模型直击这一痛点,它能在不到1秒内将单张照片转换为逼真的3D场景,合成速度提升三个数量级,同时图像质量显著优于现有技术,为行业带来了革命性的效率突破。

SHARP 是苹果开源的 AI 模型,能在不到 1 秒内将单张 2D 照片转换为逼真的 3D 场景。模型通过 3D 高斯表示技术,用神经网络单次前馈传递,快速预测出场景的 3D 结构和细节。与传统方法相比,SHARP 将合成速度提升三个数量级,同时在多个基准测试中表现出色,将 LPIPS 降低 25% – 34%,DISTS 降低 21% – 43%,生成的 3D 视图在细节和结构上更接近真实世界。

  • SHARP是什么
  • SHARP的主要功能
  • SHARP的技术原理
  • SHARP的项目地址
  • SHARP的应用场景
      • 📝 站长洞察 (Editor’s Insight)

SHARP

SHARP的主要功能

  • 快速视图合成:在不到 1 秒的时间内,通过单次神经网络前馈传递完成 3D 场景的生成。

  • 高分辨率渲染:支持实时渲染高分辨率的 3D 视图,细节丰富且结构逼真。

  • 绝对尺度支持:模型生成的 3D 场景具有绝对尺度,支持真实的相机运动模拟。

  • 零样本泛化:在多个数据集上表现出色,能泛化到未见过的场景,具有良好的鲁棒性。

  • 高效性与高质量:相比传统方法,合成速度提升三个数量级,同时在图像质量上显著优于现有技术。

SHARP的技术原理

  • 3D 高斯表示将场景中的物体和结构表示为带有颜色、位置和形状信息的高斯分布(高斯球)。这种表示方式能高效地捕捉场景的几何和外观信息,同时支持高效的渲染。

  • 神经网络回归使用深度神经网络从单张 2D 照片中回归出场景的 3D 高斯表示的参数。网络通过海量的合成数据和真实世界数据进行训练,学习到通用的深度和几何规律。

  • 快速建模与渲染在处理新照片时,模型通过单次前馈传递快速预测出数百万个高斯分布的位置、大小和外观。生成的 3D 场景支持实时渲染,能够以超过 100 帧每秒的速度在标准 GPU 上运行。

SHARP的项目地址

  • 项目官网:https://apple.github.io/ml-sharp/
  • GitHub仓库:https://github.com/apple/ml-sharp
  • arXiv技术论文:https://arxiv.org/pdf/2512.10685

SHARP的应用场景

  • 虚拟场景构建:通过将单张照片快速转换为 3D 场景,SHARP 能为 VR 和 AR 应用提供逼真的虚拟环境,增强用户体验。
  • 影视制作:快速生成高质量的 3D 场景,用于电影、电视剧和广告的特效制作,节省时间和成本。
  • 环境建模:快速生成周围环境的 3D 地图,帮助自动驾驶车辆和机器人更好地理解场景,进行路径规划和导航。
  • 文物数字化:通过单张照片快速生成文物的 3D 模型,用于文化遗产的数字化保护和展示。
  • 虚拟实验室:为学生提供虚拟的实验环境,通过 3D 场景增强学习体验。

📝 站长洞察 (Editor’s Insight)

苹果开源SHARP模型,标志着实时、高质量3D内容生成进入了“秒级”时代。这不仅仅是一个速度的提升,更是AI赋能内容创作与空间计算的范式转变。其采用的3D高斯表示技术,通过神经网络一次性预测数百万高斯分布参数,实现了效率与质量的极致平衡,这背后是苹果在AI基础研究上的深厚积累。结合苹果在Vision Pro等硬件生态的布局,SHARP这类技术将成为构建沉浸式数字世界的“基石引擎”,极大降低3D内容生产门槛,加速元宇宙、数字孪生等愿景落地。未来,AI驱动的3D内容生成将与大语言模型、多模态技术深度融合,形成更智能、更自动化的创作工具链,重塑从娱乐到工业的多个产业。