惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

U
Unit 42
Vercel News
Vercel News
博客园 - 叶小钗
大猫的无限游戏
大猫的无限游戏
MyScale Blog
MyScale Blog
P
Proofpoint News Feed
量子位
Engineering at Meta
Engineering at Meta
B
Blog RSS Feed
博客园 - 【当耐特】
Recent Announcements
Recent Announcements
Google DeepMind News
Google DeepMind News
D
DataBreaches.Net
Stack Overflow Blog
Stack Overflow Blog
博客园 - 聂微东
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
人人都是产品经理
人人都是产品经理
IT之家
IT之家
T
The Blog of Author Tim Ferriss
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Jina AI
Jina AI
博客园 - 三生石上(FineUI控件)

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
美团联合上交大发布OneCAT:纯解码器多模态大模型,开启AI视...
站外新闻 · 2026-06-22 · via Prompt 语宙

💡 站外导读:当前多模态AI领域面临架构复杂、计算开销大等挑战,尤其在高分辨率图像处理上效率瓶颈突出。美团联合上海交通大学推出的OneCAT模型,以纯解码器架构革新传统设计,摒弃外部视觉编码器,通过模态特定专家混合(MoE)和多尺度自回归机制,实现高效统一的多模态理解、生成与编辑。这一突破不仅简化模型结构,更在性能上对标前沿,为智能客服、创意设计等行业应用带来新可能,推动AI从单模态向无缝多模态交互演进。

OneCAT是美团推出的新型统一多模态模型,采用纯解码器架构,能无缝集成多模态理解、文本到图像生成和图像编辑功能。模型摒弃了传统多模态模型中依赖外部视觉编码器和分词器的设计,通过特定模态的专家混合(MoE)结构和多尺度自回归机制,实现了高效的多模态处理。在处理高分辨率图像输入和输出时表现出色。通过创新的尺度感知适配器和多模态多功能注意力机制,进一步增强了视觉生成能力和跨模态对齐能力。

  • OneCAT是什么
  • OneCAT的主要功能
  • OneCAT的技术原理
  • OneCAT的项目地址
  • OneCAT的应用场景
      • 📝 站长洞察 (Editor’s Insight)

OneCAT

OneCAT的主要功能

  • 多模态理解:能高效处理图像和文本的多模态理解任务,无需外部视觉编码器或分词器,直接在纯解码器架构中实现对图文内容的深度理解。

  • 文本到图像生成:根据文本描述生成高质量图像,通过多尺度自回归机制逐步从低分辨率到高分辨率预测视觉标记,生成过程高效且生成效果出色。

  • 图像编辑:支持基于指令的图像编辑,将视觉生成过程条件化在参考图像和编辑指令上,无需额外架构修改即可实现强大的条件生成能力,可对图像进行精准的局部和全局调整。

OneCAT的技术原理

  • 纯解码器架构:OneCAT采用纯解码器自回归Transformer模型,无需外部视觉组件,如视觉变换器(ViT)或视觉标记器,显著简化了模型结构,降低了计算开销,尤其在处理高分辨率输入时效率优势明显。

  • 模态特定的专家混合(MoE)结构:模型包含三个专门的前馈网络(FFN)专家,分别处理文本令牌、连续视觉令牌和离散视觉令牌,用于实现语言理解、多模态理解和图像合成。所有查询、键、值(QKV)和注意力层在不同模态和任务之间共享,提高了参数效率,增强了跨模态对齐能力。

  • 多尺度视觉自回归机制:在大型语言模型(LLM)中引入,以粗到细、层次化的方式生成图像,逐步从最低分辨率到最高分辨率预测视觉令牌,大幅减少解码步骤,同时保持最先进的性能。

  • 多模态多功能注意力机制:基于PyTorch FlexAttention,使模型能灵活适应多种模态和任务。文本标记采用因果注意力,连续视觉标记通过全注意力处理,多尺度离散视觉标记通过块状因果注意力处理。

OneCAT的项目地址

  • 项目官网:https://onecat-ai.github.io/
  • Github仓库:https://github.com/onecat-ai/onecat
  • HuggingFace模型库:https://huggingface.co/onecat-ai/OneCAT-3B
  • arXiv技术论文:https://arxiv.org/pdf/2509.03498

OneCAT的应用场景

  • 智能客服与内容审核:OneCAT的多模态理解能力能高效处理图像和文本内容,可用于智能客服系统中理解用户上传的图文信息并提供准确回复,也可用于内容审核领域,自动识别和筛选违规的图文内容。

  • 创意设计与数字内容创作:其文本到图像生成功能可根据文本描述生成高质量图像,为设计师和创作者提供创意灵感,快速生成符合需求的图像内容,可用于广告设计、影视特效制作、游戏开发等领域的前期概念设计。

  • 广告设计与营销:在广告设计中,OneCAT可以根据广告文案快速生成相应的图像素材,提高设计效率。可以用于生成个性化的广告内容,根据不同的目标受众生成符合其喜好的广告图像。

  • 影视后期制作:OneCAT的图像编辑功能可以用于影视后期制作中的图像修复、风格转换、特效添加等任务,帮助影视制作人员快速实现创意效果,提升制作效率。

  • 教育与学习:在教育领域,OneCAT可以生成与教学内容相关的图像,帮助学生更好地理解和记忆知识。例如,根据科学概念生成相应的示意图,或者根据历史事件描述生成相关的场景图像。

📝 站长洞察 (Editor’s Insight)

作为深耕科技前沿的观察者,我认为OneCAT的发布标志着多模态大模型架构正从“拼接式”向“原生统一”范式跃迁。其纯解码器设计彻底摆脱对ViT等外部组件的依赖,不仅降低计算成本,更通过MoE实现模态间高效对齐——这呼应了业界对轻量化、高集成度模型的迫切需求。多尺度自回归机制是关键创新,以粗到细生成策略平衡质量与效率,在文生图、图像编辑等AIGC场景中展现强大实用性。结合美团在本地生活领域的积累,OneCAT未来在智能客服、个性化营销等垂直场景的落地潜力巨大。当前,多模态竞争已从单纯参数竞赛转向架构创新与工程优化,OneCAT的探索为行业提供了重要参考:未来AI的核心竞争力在于如何以更少资源实现更通用的能力融合。