惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
博客园 - 司徒正美
Last Week in AI
Last Week in AI
Recent Announcements
Recent Announcements
Y
Y Combinator Blog
博客园 - 聂微东
M
MIT News - Artificial intelligence
博客园_首页
Jina AI
Jina AI
博客园 - 叶小钗
酷 壳 – CoolShell
酷 壳 – CoolShell
H
Hackread – Cybersecurity News, Data Breaches, AI and More
J
Java Code Geeks
F
Fortinet All Blogs
aimingoo的专栏
aimingoo的专栏
小众软件
小众软件
Vercel News
Vercel News
The Cloudflare Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG
N
Netflix TechBlog - Medium
B
Blog
Google DeepMind News
Google DeepMind News
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

IT之家

消息称大疆 Pocket 4 目标超千万,可能是一英寸 CMOS 出货量最大的单品 OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 - IT之家 鸿蒙智行问界 M6 预订量突破 10 万台,预售 26.98 万元起 今年一季度全国铁路完成固定资产投资 1379 亿元,西十高铁、雄商高铁山东段联调联试 - IT之家 首届北京市中学生人形机器人足球赛今日启动,近 50 支队伍参赛 - IT之家 涉及“赵一鸣是日本品牌”等,抖音处置 1500 余条谣言内容 - IT之家 广汽集团与海尔集团签约,探索“人车家”互联生态 - IT之家 亚马逊调整云游戏平台 Luna 业务模式,取消 Ubisoft+、GOG 等第三方商店 消息称华擎将推出 X870E Taichi White,补全 AMD 800 系白色旗舰主板缺失 长城汽车归元平台首款方盒子全球征名,十二佳提名公布 - IT之家 消息称雷克萨斯新车即将支持苹果数字车钥匙 - IT之家 普京要求俄罗斯加速自研有竞争力的 AI 模型,彻底转向国产技术 - IT之家 影石刘靖康:已开源保真全景无人机仿真平台 AirSim360、DAP 全景度量深度模型等核心成果 - IT之家 长安汽车总经理赵非:当前车企仅靠卖车已难以盈利 - IT之家 地平线创始人余凯:4 月 22 日推出中国第一款舱驾融合智能体芯片“星空” - IT之家 冯兴亚:广汽集团具身智能机器人即将量产,飞行汽车预计今年完成适航认证并量产交付 - IT之家 模块化笔电制造商 Framework CEO 痛批业界追逐“AI 优先”,称个人计算设备可能就此消亡 16 年来首次:小米首届员工运动会今天启幕,雷军压轴致辞 - IT之家 比亚迪廉玉波:新能源汽车产业正进入确定性与不确定性并存的阶段 - IT之家 阿耳忒弥斯 2 号宇航员安全返回地球,有哪些技术和科研收获 - IT之家 曝索尼 Alpha 7R VI 全画幅无反相机将随 100-400mm f/4.0 GM 镜头一同登场,发布会预计在 5 月 小米产教融合最新成绩披露:合作院校超 400 家、成都基地启用 - IT之家 亚马逊 CEO 贾西:自研芯片年化收入预估 500 亿美元,规模超 AMD 与英特尔 马来西亚推动“AI 城市”转型,目标 2030 年成为“AI 国家” Galaxy S24 Ultra 手机用户反馈三星人为设限,无法使用 Galaxy Buds4 Pro 耳机高清语音 广汽集团董事长冯兴亚:当前县级市场新能源汽车渗透率不到 20% - IT之家 消息称《地铁:离去》新作下周公布,有望 State of Play 发布会亮相 广汽新一代智能座舱架构与电子电气架构明日发布,将宣布芯片生态建设的重大突破 - IT之家 苹果预订台积电 6 万片晶圆产能,2027 年全力冲刺 AI 服务器芯片 日本经济产业省向 Rapidus 追加 6315 亿日元支持,加速下一代半导体研发
英伟达推出 Nemotron 3 Nano Omni 模型:采用 30B‑A3B 混合 M...
2026-04-29 · via IT之家

IT之家 4 月 29 日消息,当地时间 4 月 28 日,英伟达宣布推出名为 Nemotron 3 Nano Omni 的开源全模态推理模型,旨在为企业级 AI Agent 提供一体化基础模型底座。

据介绍,这是一款将视频、音频、图像和文本的统一多模态推理集成于单个高效开放模型中的产品。该模型旨在替代智能体系统中常见的碎片化视觉-语音-语言模型链,从而减少推理跳数与编排复杂度,降低推理成本,同时增强跨模态上下文一致性。

Nemotron 3 Nano Omni 可在智能体系统中充当多模态感知与上下文子 Agent,使智能体能够在单个共享的“感知-行动”循环中处理视觉、音频和文本输入,提升收敛速度,降低编排复杂度和推理成本。

在文档智能榜单(如 MMlongbench-Doc 和 OCRBenchV2)上,该模型取得了同类领先的准确率;同时在视频与音频理解基准(WorldSense、DailyOmni、VoiceBench)中也表现优异。

行业基准 MediaPerf(基于真实媒体数据和生成任务评估视频理解模型的性能、成本和吞吐量)显示,Nemotron 3 Nano Omni 在所有任务上实现了最高吞吐量,且视频级标注的推理成本最低。

▲ 在固定的用户交互阈值下,各模型所能维持的总系统吞吐量

该模型基于 30B‑A3B 混合专家(MoE)架构,可根据任务和模态进行激活,实现高吞吐量与可扩展的多模态性能。IT之家注意到,其模型权重、数据集和训练配方完全开放,开发者可在本地、云端或企业环境中定制、部署和集成多模态子 Agent。

英伟达表示,在固定交互延迟阈值下,Nemotron 3 Nano Omni 在视频推理任务中可持续提供更高的聚合吞吐量,相比其他开放式全模态模型有效系统容量最高提升约 9.2 倍;在多文档推理任务中,有效系统容量最高提升约 7.4 倍。在 Blackwell GPU 上采用 NVFP4 量化时,该模型在处理复杂文档、长时推理和大批量视频的企业级工作负载中,吞吐量在开放式全模态模型中居于领先。

架构设计方面,Nemotron 3 Nano Omni 核心为混合 MoE,结合 Mamba 层(提升序列与内存效率)和 Transformer 层(实现精准推理),内存和计算效率最高可提升 4 倍。

视觉处理方面,它采用 3D 卷积捕捉帧间运动,推理时通过高效视频采样层将高密度视觉 token 压缩为 LLM 可处理的精简集合;音频部分则基于 NVIDIA Parakeet 编码器与专用数据集;文本部分以强大的文本模型作为中心解码器,保留基础模型的语言能力;视觉编码采用 C-RADIOv4-H,支持高分辨率图像与 OCR 精度。

其训练方法涵盖适配器与编码器训练(约 1270 亿跨模态 token)、多阶段监督微调及后监督强化学习(超过 230 万次环境 rollout)。该模型权重已在 Hugging Face 上提供,并即将作为 NVIDIA NIM 微服务上线。英伟达还开放了完整的端到端训练与评估配方、部署指南、微调食谱以及开放数据集。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。