惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Recent Announcements
Recent Announcements
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog
T
The Blog of Author Tim Ferriss
J
Java Code Geeks
腾讯CDC
D
Docker
G
Google Developers Blog
D
DataBreaches.Net
雷峰网
雷峰网
Blog — PlanetScale
Blog — PlanetScale
S
SegmentFault 最新的问题
The Cloudflare Blog
有赞技术团队
有赞技术团队
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Stack Overflow Blog
Stack Overflow Blog
大猫的无限游戏
大猫的无限游戏
量子位
美团技术团队
aimingoo的专栏
aimingoo的专栏
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Engineering at Meta
Engineering at Meta
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
NVIDIA Nemotron Nano 2:9B参数推理提速6倍,开源高效AI模型...
站外新闻 · 2026-06-23 · via Prompt 语宙

💡 站外导读:当前大模型发展陷入“更大更强”与“更快更省”的两难。推理效率、部署成本和长上下文能力成为落地关键瓶颈。英伟达此次推出NVIDIA Nemotron Nano 2,正是瞄准这一核心痛点。它不仅将9B参数模型的推理速度提升至Qwen3-8B的6倍,更支持128k超长上下文,并在单块A10G GPU上运行。这标志着行业从单纯追求参数规模,转向深度优化架构效率与推理经济性的重要转折。

NVIDIA Nemotron Nano 2 是英伟达推出的高效推理模型,参数量为9B。模型基于混合Mamba-Transformer架构,在20万亿个token上预训练,支持128k上下文长度。相比Qwen3-8B,推理速度提升6倍,准确率相当或更高。模型具备思考预算控制功能,用户能指定推理token数量。英伟达开源了基础模型和大部分预训练数据集,助力开发者进一步研究与应用。

  • NVIDIA Nemotron Nano 2是什么
  • NVIDIA Nemotron Nano 2的主要功能
  • NVIDIA Nemotron Nano 2的技术原理
  • NVIDIA Nemotron Nano 2的项目地址
  • NVIDIA Nemotron Nano 2的应用场景
      • 📝 站长洞察 (Editor’s Insight)

NVIDIA Nemotron Nano 2

NVIDIA Nemotron Nano 2的主要功能

  • 高吞吐量:NVIDIA Nemotron Nano 2 在复杂推理任务中表现出色,吞吐量比 Qwen3-8B 高达 6 倍。
  • 长上下文支持:支持 128k 的上下文长度,能在单个 NVIDIA A10G GPU 上进行推理,适合处理长文本和复杂任务。
  • 推理过程支持:模型在生成最终答案前生成推理过程(reasoning trace),用户能指定模型的“思考”预算。
  • 灵活的输出模式:用户能选择跳过中间推理步骤,直接获取最终答案。
  • 多语言能力:预训练数据集包含多种语言的数据,支持强大的多语言推理能力。
  • 多领域覆盖:涵盖数学、代码、学术、STEM 等多个领域的数据,适合多种应用场景。

NVIDIA Nemotron Nano 2的技术原理

  • 混合 Mamba-Transformer 架构:用 Mamba-2 层替代传统 Transformer 中的大部分自注意力层,显著提升推理速度,特别是在生成长推理链时。Transformer 层保留部分自注意力层,保持模型的灵活性和准确性。
  • 预训练过程:在 20 万亿个 token 上进行预训练,用 FP8 精度和 Warmup-Stable-Decay 学习率调度。通过持续预训练长上下文扩展阶段,使模型能处理 128k 的上下文长度,不降低其他基准测试的性能。
  • 后训练优化:监督微调(SFT)对模型进行监督微调,提升其在特定任务上的表现。通过策略优化提升模型的指令遵循能力。优化模型的偏好,让模型更符合人类的偏好。通过人类反馈进行强化学习,提升模型的对话能力和指令遵循能力。
  • 模型压缩:基于剪枝和知识蒸馏技术,将 12B 参数的基础模型压缩到 9B 参数,同时保持模型的性能。优化模型支持在单个 NVIDIA A10G GPU 上进行 128k token 的上下文推理,显著降低推理成本。
  • 推理预算控制:基于截断训练,模型能根据用户指定的“思考”预算进行推理,避免不必要的计算。用户能灵活控制模型的推理过程,选择是否展示推理过程或直接获取最终答案。

NVIDIA Nemotron Nano 2的项目地址

  • 项目官网:https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  • HuggingFace模型库:https://huggingface.co/collections/nvidia/nvidia-nemotron-689f6d6e6ead8e77dd641615
  • 技术论文:https://research.nvidia.com/labs/adlr/files/NVIDIA-Nemotron-Nano-2-Technical-Report.pdf
  • 在线体验Demo:https://build.nvidia.com/nvidia/nvidia-nemotron-nano-9b-v2

NVIDIA Nemotron Nano 2的应用场景

  • 教育领域:在教育领域,帮助学生解决复杂的数学和科学问题。通过逐步推理的方式解释复杂的数学公式或物理定律,帮助学生更好地理解和掌握知识。
  • 学术研究:研究人员进行学术研究,生成详细的推理过程和分析报告,辅助论文撰写和实验设计。
  • 软件开发:开发者生成高质量的代码片段,帮助快速开发和优化代码。
  • 编程教育:在编程教育中,模型提供代码示例和解释,帮助初学者更好地理解编程语言和算法。
  • 客户服务:在客户服务领域,作为多语言聊天机器人,提供高效且准确的客户支持。

📝 站长洞察 (Editor’s Insight)

英伟达此番出手,绝非发布一个新模型那么简单,它预示着AI推理范式的深刻变革。传统Transformer架构的计算瓶颈日益凸显,而Nemotron Nano 2采用的Mamba-Transformer混合架构,正是对下一代高效推理基座的关键探索。其6倍速度提升与“思考预算”控制,直接回应了企业级AI应用对成本与可控性的核心诉求。更值得关注的是其开源策略——从基础模型到大部分预训练数据,这不仅是技术自信,更是构建生态、抢占下一代AI基础设施话语权的深远布局。在开源与闭源模型竞逐的当下,英伟达以硬件巨头的身份,通过软硬协同的极致优化,为行业树立了效率新标杆。这不仅是技术的胜利,更是生态与商业战略的精准卡位。