惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

宝玉的分享
宝玉的分享
Engineering at Meta
Engineering at Meta
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园 - 聂微东
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
T
Tailwind CSS Blog
Apple Machine Learning Research
Apple Machine Learning Research
Hugging Face - Blog
Hugging Face - Blog
爱范儿
爱范儿
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
Jina AI
Jina AI
博客园 - 叶小钗
雷峰网
雷峰网
罗磊的独立博客
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
WordPress大学
WordPress大学
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
阮一峰的网络日志
阮一峰的网络日志
量子位

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
Meta SAM 3开源:AI视觉分割模型革命,支持文本/视频零样本分...
站外新闻 · 2026-06-16 · via Prompt 语宙

💡 站外导读:随着多模态AI的爆发,计算机视觉领域正经历从“识别”到“精准交互式分割”的范式跃迁。开发者和创作者面临的核心痛点在于:现有工具难以统一处理图像与视频、无法理解自然语言指令、且对未知物体束手无策。Meta SAM 3的开源,正为解决这一系列挑战提供了统一、强大且开放的解决方案。

SAM 3(Segment Anything Model 3)是 Meta AI 最新推出的先进计算机视觉模型,能通过文本、示例和视觉提示检测、分割和跟踪图像及视频中的对象。模型支持开放词汇的短语输入,具备强大的跨模态交互能力,可实时修正分割结果。SAM 3 在图像和视频分割任务中性能卓越,是现有系统的两倍,且支持零样本学习。模型扩展到 3D 重建领域,助力家居预览、创意视频编辑和科学研究等多场景应用,为计算机视觉的未来发展提供强大动力。

  • SAM 3是什么
  • SAM 3的主要功能
  • SAM 3的技术原理
  • SAM 3的项目地址
  • SAM 3的应用场景
      • 📝 站长洞察 (Editor’s Insight)

SAM 3

SAM 3的主要功能

  • 多模态提示支持:SAM 3 支持通过文本、示例和视觉提示(如点击、框选)检测和分割图像及视频中的对象,适应多种用户需求。

  • 图像和视频分割:SAM 3 能在图像中检测和分割所有匹配对象,支持在视频中跟踪对象,且能实时交互性修正分割结果。

  • 零样本学习:SAM 3 能通过开放词汇的文本提示处理未见过的概念,无需额外训练即可分割新对象类别。

  • 实时交互性:支持用户通过添加额外的提示(如点击或框选)修正模型的错误,进一步优化分割结果,提升用户体验。

  • 跨领域应用:SAM 3 广泛应用在创意媒体工具(如 Instagram Edits)、家居装饰预览(如 Facebook Marketplace)和科学领域(如野生动物监测)。

SAM 3的技术原理

  • 统一模型架构:SAM 3 基于统一的模型架构,同时支持图像和视频中的分割任务。模型结合强大的视觉编码器(如 Meta Perception Encoder)和文本编码器,能处理开放词汇的文本提示。模型架构包括一个图像级检测器和一个基于记忆的视频跟踪器,两者共享同一个视觉编码器。
  • 多模态输入处理
    • 文本编码器:将文本提示编码为特征向量,用于指导分割任务。
    • 视觉编码器:将图像或视频帧编码为特征向量,用于检测和分割对象。
    • 融合编码器:将文本和视觉特征融合,生成条件化的图像特征,用于后续的分割任务。
  • 存在头(Presence Head):为提高模型的分类能力,SAM 3 引入一个存在头(Presence Head),专门用在预测目标概念是否存在于图像或视频中。有助于将识别和定位任务解耦,提高模型的准确性和效率。
  • 大规模数据引擎:为训练 SAM 3,Meta 构建了高效的数据引擎,结合人类标注和 AI 辅助标注,生成超过 400 万个独特概念的高质量标注数据。数据覆盖多种视觉领域和任务,确保模型具有广泛的泛化能力。
  • 零样本学习:SAM 3 支持零样本学习,能处理未见过的概念。通过开放词汇的文本提示,模型用预训练的视觉和语言编码器识别和分割新的对象类别。
  • 实时交互性:SAM 3 支持实时交互性,用户能通过添加额外的提示(如点击或框选)修正模型的错误,进一步优化分割结果。交互性使模型能更好地适应用户的意图。
  • 视频跟踪和分割:在视频任务中,SAM 3 用基于记忆的跟踪器处理对象的时空一致性。跟踪器用检测器的输出和记忆中的历史信息,生成高质量的分割掩码,在视频帧之间传播掩码。

SAM 3的项目地址

  • 项目官网:https://ai.meta.com/sam3/
  • GitHub仓库:https://github.com/facebookresearch/sam3/
  • 在线体验Demo:https://www.aidemos.meta.com/segment-anything

SAM 3的应用场景

  • 创意媒体工具:创作者能快速为视频中的人物或物体应用特效,提升创作效率。

  • 家居装饰预览:在 Facebook Marketplace 中,SAM 3 支持“房间预览”功能,用户能预览家居装饰品在自己空间中的效果,辅助购买决策。

  • 科学应用:SAM 3 用在野生动物监测和海洋探索,帮助研究人员更好地理解和保护自然环境,例如通过视频分析野生动物行为。

  • 3D 重建:SAM 3D 能从单张图像重建 3D 物体和人体,为物理世界场景中的 3D 重建提供新标准,助力虚拟现实和增强现实应用。

  • 视频创作:SAM 3 提供 AI 视觉创作工具,支持对现有 AI 生成视频进行混剪,提升创作灵活性。

📝 站长洞察 (Editor’s Insight)

Meta SAM 3的发布,标志着视觉基础模型进入‘交互式全能分割’新阶段。其核心突破并非单一性能提升,而是通过统一架构同时攻克了开放词汇理解、时空一致性、以及人机实时交互三大长期瓶颈。这远超工具升级,实质是构建了连接语言、视觉与用户意图的‘通用视觉接口’。其‘零样本’与‘实时修正’能力,将极大降低专业视觉任务的门槛,推动AIGC从文本、图像生成向高精度视频编辑、3D重建乃至具身智能感知快速渗透。Meta通过开源SAM 3,不仅巩固其在AI基础研究中的领导地位,更意在打造下一代视觉AI的‘事实标准’生态,其影响将贯穿消费互联网、创意产业与前沿科学研究。