惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
罗磊的独立博客
宝玉的分享
宝玉的分享
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
T
Tailwind CSS Blog
博客园_首页
量子位
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
爱范儿
爱范儿
S
SegmentFault 最新的问题
雷峰网
雷峰网
小众软件
小众软件
博客园 - 聂微东
美团技术团队
Apple Machine Learning Research
Apple Machine Learning Research
WordPress大学
WordPress大学
Jina AI
Jina AI
Hugging Face - Blog
Hugging Face - Blog

Java for You

GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u 智能体上线最难的不是提示词:Agents API开始托管运行时 - Java for You - java4u AI任务一多就堵车:问题可能不在模型速度 - Java for You - java4u AI能写无人机控制代码后,安全边界不能只守提示词 - Java for You - java4u AI代码扫描能批量开了,但它还不能替你挡住合并 - Java for You - java4u 机器人动作误差降近九成,真正该先看数据切分 - Java for You - java4u 图片一多首字就慢?用EPD拆开多模态推理三段路 - Java for You - java4u 蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转 - Java for You - java4u
同一套GPU多服务2.5倍用户,关键不是换模型 - Java for You -...
蜗牛 · 2026-09-12 · via Java for You

云架构示意图

部署大模型后,团队最容易犯的错,是拿“每秒总共生成多少Token”宣布优化成功,却忽略用户已经等得不耐烦。可引用的核心判断是:推理性能不是单个内核的数字,而是在明确延迟目标下,精度、并行、缓存、调度和解码共同形成的系统结果。NVIDIA的新测试给了一个很具体的样本,也给了足够多的限定条件。

发生了什么

NVIDIA在9月10日公布Nemotron 3 Ultra NIM 2.0.12的服务测试。硬件是四张B200,负载包含64K输入、400 Token输出、76% KV缓存复用率,目标是每位用户50 Token/s,也就是约20毫秒的Token间延迟。

在这个前提下,官方称未开启NIM优化的基线吞吐为718 Token/s,开启完整优化栈后为1997 Token/s,约2.5倍。这里的“多服务2.5倍用户”不是任何场景下的保证,而是同一交互速度门槛下,系统可承载并发量的对比。

关键事实与证据

测试配置、结果与复现命令来自NVIDIA技术文章。NIM 2.0.12组合了模型感知内核、四卡张量并行、前缀与Mamba状态复用、调度和显存参数调整,以及MTP推测解码。

这些优化的收益不能简单相加。缓存复用对重复系统提示和多轮代理很有价值,对每次都完全不同的短请求则可能很小;推测解码依赖候选Token接受率,也会消耗额外显存。官方测试由NVIDIA完成,只覆盖特定模型、硬件与流量形态,尚不是跨框架的通用结论。

技术原理:吞吐为什么必须和延迟一起看

把并发开得更高,GPU通常会更忙,总吞吐也会上升;但批次排队会拉长首字时间和Token间延迟。如果只看吞吐,最“高效”的配置可能也是用户体验最差的配置。正确做法是画Pareto曲线:对每个并发档位,同时记录系统吞吐与用户侧延迟,只比较满足服务等级目标的点。

前缀缓存避免重复计算相同上下文;部分前缀匹配让并非完全一致的请求也能复用一段结果;张量并行把模型切到多张GPU;调度器决定多少序列和Token同时在途;MTP先一次提出多个候选Token,再由主模型验证。任何一层改变,都可能移动计算、显存和等待之间的平衡。

mermaid diagram

一个具体场景

一家代码审查服务让代理反复读取同一仓库规则和大型代码上下文。系统提示、工具说明与多数仓库文件在多轮里重复,前缀和状态缓存很可能有效。若产品要求流式输出不低于50 Token/s,团队可以把并发从1、4、8、16逐级增加,直到P95 Token间延迟接近红线,再比较开启缓存和MTP后的可承载请求数。

换成一次性短问答,64K输入和76%缓存复用就不再代表真实流量。此时照搬2.5倍数字,可能会高估收益。

对开发者和团队的影响

对平台工程师,优化工作会从“找最快框架”转成“保存流量画像并持续回放”。模型升级、提示词变长、代理工具增加,都可能改变最佳配置。对产品团队,必须把用户体验翻译成可测SLO,例如P95首字低于两秒、Token间延迟低于40毫秒,而不是只说“响应要快”。

普通用户最终感知到的不是显卡型号,而是等待时间、流式输出是否卡顿和高峰期能否稳定服务。系统优化的价值,应该用这些结果来结算。

同一套测试还应持续回放,避免模型或提示词变化后沿用过期结论。

我的判断及依据

我的判断是,大模型推理下一阶段最值钱的能力,是可重复的性能工程,而不是单次跑分。依据是这次2.5倍提升来自一组相互作用的配置,并且官方明确要求使用代表性轨迹构建Pareto曲线。能保存请求分布、版本和SLO的团队,才有资格判断一次优化是否真实。

适用边界与风险

4×B200、Nemotron 3 Ultra、64K输入和高缓存复用并不代表多数应用。平均值还可能掩盖尾延迟、冷缓存、突发流量和失败重试。敏感生产请求在制作为压测轨迹前必须脱敏。任何“更新到新版本”也要固定镜像标签或摘要,否则前后对比无法复现。

一次可执行的压测步骤

  • 从生产采样并脱敏输入长度、输出长度、到达间隔与重复前缀比例。
  • 先定义P95首字时间和Token间延迟红线,再扫并发档位。
  • 分别测试冷缓存、热缓存和突发流量,不只跑稳定平均负载。
  • 固定模型、精度、镜像摘要和硬件,逐项记录配置变化。
  • 选择满足SLO的最高吞吐点,并计算每千次请求成本。

你的线上AI服务更容易被哪项指标拖垮:首字延迟、单用户生成速度、并发量,还是缓存命中率?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。