











最近在服务器上部署 Qwen3.8-27B 时,碰到了不少容易混淆的概念,比如 FP8、NVFP4、上下文长度、激活参数、Dense、MoE 等。
其实这些概念并没有那么复杂,这篇文章结合实际部署场景,用比较通俗的方式简单梳理一下。
当前服务器使用的是:
Qwen3.8-27B-NVFP4
硬件环境:
简单理解:
vLLM 启动参数中配置了:
--max-model-len 262144
262144 Token 约等于 256K Token。
它表示一次请求中,模型能够处理的:
输入内容 + 输出内容
最大可以达到约 256K Token。
例如:
这些内容都会占用上下文。
可以把上下文理解成模型的一张“草稿纸”,草稿纸越大,一次能够看到的文档、代码和历史对话就越多。
不过上下文越长,KV Cache 占用也越大,所以长上下文和高并发之间通常需要做取舍。
服务器上同时有两个版本:
Qwen3.8-27B-FP8
Qwen3.8-27B-NVFP4
它们本质上还是同一个 27B 模型,主要区别是模型参数使用的数值精度不同。
| 类型 | 特点 |
|---|---|
| FP8 | 精度更高,显存占用更大 |
| NVFP4 | 精度更低一些,但更省显存,推理效率更高 |
简单理解:
FP8 相当于每个参数使用更多空间保存。
NVFP4 相当于使用更少的空间保存参数。
因此 NVFP4 最大的意义就是:
用更少的显存保存同样规模的模型。
对于 RTX 5090 这类 Blackwell 架构显卡,NVFP4 也比较适合推理部署。
不会。
这是非常容易混淆的地方。
无论是:
Qwen3.8-27B-FP8
还是:
Qwen3.8-27B-NVFP4
模型仍然都是约 27B 参数。
NVFP4 改变的是:
每个参数占多少空间。
而不是:
有多少参数参与计算。
可以简单理解成:
FP8:
27B 参数,每个参数占得大一些。
NVFP4:
还是 27B 参数,只是每个参数占得更小。
讨论大模型时,经常会看到类似:
总参数:100B
激活参数:13B
这里的“激活参数”可以简单理解成:
模型每次推理时,真正参与计算的参数数量。
对于普通 Dense 模型,例如 Qwen3.8-27B:
总参数:约 27B
激活参数:约 27B
也就是推理时基本全部参数都会参与计算。
Dense 中文一般叫:
稠密模型。
可以把它理解成一个公司有 27 个员工。
每来一个任务:
27 个人基本全部参与工作。
Qwen3.8-27B 就属于这种方式:
27B 总参数
↓
每次推理
↓
基本全部参与计算
↓
激活参数约 27B
MoE 全称:
Mixture of Experts
中文一般叫:
混合专家模型。
MoE 和 Dense 最大的区别是:
模型虽然很大,但每次推理只让其中一部分参数参与计算。
例如一个 MoE 模型:
总参数:100B
激活参数:13B
可以把它理解成一个公司里面有很多不同领域的专家:
当用户提出一个问题后,模型内部会有一个类似“调度员”的 Router:
用户问题
↓
Router 判断
↓
选择合适的几个专家
↓
这些专家参与计算
↓
生成答案
所以整个模型虽然可能有 100B 参数,但一次推理真正参与计算的可能只有 13B。
可以直接记住一句话:
Dense 是所有人一起干活,MoE 是人很多,但每次只叫几个专家干活。
例如 Dense:
27B 总参数
↓
约 27B 参数参与计算
而 MoE:
100B 总参数
↓
根据问题选择部分专家
↓
可能只有 13B 参数参与计算
因此 MoE 的一个重要优势就是:
可以把模型总参数做得很大,同时不用每次把所有参数都计算一遍。
把这些概念放到一起,其实就比较清楚了。
最容易混淆的一点就是:
模型量化和激活参数是两回事。
FP8、NVFP4 解决的是:
参数怎么存。
Dense、MoE 解决的是:
推理时哪些参数参与计算。
理解了这一点,后面再看到 FP8、FP4、27B、激活参数、MoE 这些概念,就不会那么容易混在一起了。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。