惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MyScale Blog
MyScale Blog
Apple Machine Learning Research
Apple Machine Learning Research
H
Help Net Security
雷峰网
雷峰网
V
Visual Studio Blog
G
Google Developers Blog
Microsoft Azure Blog
Microsoft Azure Blog
Hugging Face - Blog
Hugging Face - Blog
爱范儿
爱范儿
IT之家
IT之家
Engineering at Meta
Engineering at Meta
Microsoft Security Blog
Microsoft Security Blog
aimingoo的专栏
aimingoo的专栏
大猫的无限游戏
大猫的无限游戏
M
MIT News - Artificial intelligence
月光博客
月光博客
A
About on SuperTechFans
B
Blog RSS Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
The GitHub Blog
The GitHub Blog
N
Netflix TechBlog - Medium
J
Java Code Geeks
云风的 BLOG
云风的 BLOG
Blog — PlanetScale
Blog — PlanetScale

Java for You

《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u
同一套GPU多服务2.5倍用户,关键不是换模型 - Java for You -...
蜗牛 · 2026-09-12 · via Java for You

云架构示意图

部署大模型后,团队最容易犯的错,是拿“每秒总共生成多少Token”宣布优化成功,却忽略用户已经等得不耐烦。可引用的核心判断是:推理性能不是单个内核的数字,而是在明确延迟目标下,精度、并行、缓存、调度和解码共同形成的系统结果。NVIDIA的新测试给了一个很具体的样本,也给了足够多的限定条件。

发生了什么

NVIDIA在9月10日公布Nemotron 3 Ultra NIM 2.0.12的服务测试。硬件是四张B200,负载包含64K输入、400 Token输出、76% KV缓存复用率,目标是每位用户50 Token/s,也就是约20毫秒的Token间延迟。

在这个前提下,官方称未开启NIM优化的基线吞吐为718 Token/s,开启完整优化栈后为1997 Token/s,约2.5倍。这里的“多服务2.5倍用户”不是任何场景下的保证,而是同一交互速度门槛下,系统可承载并发量的对比。

关键事实与证据

测试配置、结果与复现命令来自NVIDIA技术文章。NIM 2.0.12组合了模型感知内核、四卡张量并行、前缀与Mamba状态复用、调度和显存参数调整,以及MTP推测解码。

这些优化的收益不能简单相加。缓存复用对重复系统提示和多轮代理很有价值,对每次都完全不同的短请求则可能很小;推测解码依赖候选Token接受率,也会消耗额外显存。官方测试由NVIDIA完成,只覆盖特定模型、硬件与流量形态,尚不是跨框架的通用结论。

技术原理:吞吐为什么必须和延迟一起看

把并发开得更高,GPU通常会更忙,总吞吐也会上升;但批次排队会拉长首字时间和Token间延迟。如果只看吞吐,最“高效”的配置可能也是用户体验最差的配置。正确做法是画Pareto曲线:对每个并发档位,同时记录系统吞吐与用户侧延迟,只比较满足服务等级目标的点。

前缀缓存避免重复计算相同上下文;部分前缀匹配让并非完全一致的请求也能复用一段结果;张量并行把模型切到多张GPU;调度器决定多少序列和Token同时在途;MTP先一次提出多个候选Token,再由主模型验证。任何一层改变,都可能移动计算、显存和等待之间的平衡。

mermaid diagram

一个具体场景

一家代码审查服务让代理反复读取同一仓库规则和大型代码上下文。系统提示、工具说明与多数仓库文件在多轮里重复,前缀和状态缓存很可能有效。若产品要求流式输出不低于50 Token/s,团队可以把并发从1、4、8、16逐级增加,直到P95 Token间延迟接近红线,再比较开启缓存和MTP后的可承载请求数。

换成一次性短问答,64K输入和76%缓存复用就不再代表真实流量。此时照搬2.5倍数字,可能会高估收益。

对开发者和团队的影响

对平台工程师,优化工作会从“找最快框架”转成“保存流量画像并持续回放”。模型升级、提示词变长、代理工具增加,都可能改变最佳配置。对产品团队,必须把用户体验翻译成可测SLO,例如P95首字低于两秒、Token间延迟低于40毫秒,而不是只说“响应要快”。

普通用户最终感知到的不是显卡型号,而是等待时间、流式输出是否卡顿和高峰期能否稳定服务。系统优化的价值,应该用这些结果来结算。

同一套测试还应持续回放,避免模型或提示词变化后沿用过期结论。

我的判断及依据

我的判断是,大模型推理下一阶段最值钱的能力,是可重复的性能工程,而不是单次跑分。依据是这次2.5倍提升来自一组相互作用的配置,并且官方明确要求使用代表性轨迹构建Pareto曲线。能保存请求分布、版本和SLO的团队,才有资格判断一次优化是否真实。

适用边界与风险

4×B200、Nemotron 3 Ultra、64K输入和高缓存复用并不代表多数应用。平均值还可能掩盖尾延迟、冷缓存、突发流量和失败重试。敏感生产请求在制作为压测轨迹前必须脱敏。任何“更新到新版本”也要固定镜像标签或摘要,否则前后对比无法复现。

一次可执行的压测步骤

  • 从生产采样并脱敏输入长度、输出长度、到达间隔与重复前缀比例。
  • 先定义P95首字时间和Token间延迟红线,再扫并发档位。
  • 分别测试冷缓存、热缓存和突发流量,不只跑稳定平均负载。
  • 固定模型、精度、镜像摘要和硬件,逐项记录配置变化。
  • 选择满足SLO的最高吞吐点,并计算每千次请求成本。

你的线上AI服务更容易被哪项指标拖垮:首字延迟、单用户生成速度、并发量,还是缓存命中率?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。