惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 聂微东
宝玉的分享
宝玉的分享
Apple Machine Learning Research
Apple Machine Learning Research
罗磊的独立博客
Last Week in AI
Last Week in AI
WordPress大学
WordPress大学
博客园 - 【当耐特】
大猫的无限游戏
大猫的无限游戏
小众软件
小众软件
博客园 - 司徒正美
博客园 - Franky
爱范儿
爱范儿
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
Hugging Face - Blog
Hugging Face - Blog
Jina AI
Jina AI
量子位
博客园 - 叶小钗
博客园_首页
月光博客
月光博客
博客园 - 三生石上(FineUI控件)
The Cloudflare Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报

博客园 - 人艰不拆_zmc

AG-UI 是什么?一篇文章讲清楚 AI Agent 与前端如何交互 AI 里的“本体”到底是什么?一篇写给技术小白的通俗解释 15000mAh 到底是什么概念?一篇看懂电池容量 go2_ros2_sdk 到底是干什么的?从 Go2、官方 SDK、ROS2 一路讲到 SLAM 和 Nav2 买了宇树 Go2 以后怎么二次开发?写给第一次做机器狗项目的人 买了一块 NVIDIA Jetson,怎么在上面安装 ROS2?从 JetPack 到 ROS2 的完整入门指南 NVIDIA Jetson 到底是什么?写给第一次接触机器人和边缘 AI 的人 ROS / ROS2 到底是什么?写给第一次接触机器人开发的人 大模型到底能同时多少人用?一篇看懂并发、排队与容量估算 大模型为什么有快有慢?一篇看懂响应速度背后的关键因素 技术小白也能看懂:大模型里的量化、蒸馏到底是什么意思? Codex 使用技巧:从“会聊天”到“真正能干活” 我终于搞懂了:Codex 对话中插件和 Skill 到底怎么用 我终于搞懂了 Agent Spec:它其实就是 Agent 的“标准设计图” 我终于搞懂了 Tool:原来不只是 Function Calling 里的函数 Skill 里的 Python 脚本,到底是不是 Tool? 我终于搞懂了 Codex 的 Plugin 和 Skill:顺便把 App、MCP 一次理清 我终于搞懂了 Codex 的“应用”:App 到底是什么,怎么添加和维护? 我终于搞懂了 Tool、Function Calling 和 MCP:大模型到底怎么知道该调哪个接口? 我终于搞懂了 MCP:从 HTTP API 到 ERP MCP Server 的完整入门 我终于搞懂了 Codex 的“记忆”是怎么回事 Codex 用久了越来越慢?我的上下文管理小技巧 我终于搞懂了 Codex 里的 Thread、Turn 和 Session FPS 是什么意思?简单理解 60 FPS、25 FPS 和视频帧率 DeepSeek Harness 明明像 AI Coding 工具,为什么又能用来构建各种 Agent? 使用 Codex 开发项目,怎么才能节约 Token? 模型里的 32K、128K、256K 是什么意思?简单聊聊上下文限制 Codex 一次对话到底会给模型发送什么?以 Spring Boot 项目为例讲清 Context、代码读取与 Token 消耗 AI Agent 中的 Rule 是什么?以 Codex 为例,小白也能看懂 我终于搞懂了 Harness:它不是论文,也不是标准,更不是 Codex 独有
从 Qwen3.8-27B 到 FP8、NVFP4、MoE:一次搞懂几个常见大模型...
人艰不拆_zmc · 2026-09-03 · via 博客园 - 人艰不拆_zmc

最近在服务器上部署 Qwen3.8-27B 时,碰到了不少容易混淆的概念,比如 FP8、NVFP4、上下文长度、激活参数、Dense、MoE 等。

其实这些概念并没有那么复杂,这篇文章结合实际部署场景,用比较通俗的方式简单梳理一下。

一、我们现在跑的是什么模型?

当前服务器使用的是:

Qwen3.8-27B-NVFP4

硬件环境:

  • 2 × NVIDIA RTX 5090
  • Tensor Parallel:2
  • 最大上下文:262144 Token

简单理解:

  • Qwen3.8-27B:约 270 亿参数的大模型
  • NVFP4:模型采用低精度 FP4 格式
  • TP=2:模型由两张 5090 一起运行
  • 262144 Token:也就是常说的 256K 上下文

二、256K 上下文是什么意思?

vLLM 启动参数中配置了:

--max-model-len 262144

262144 Token 约等于 256K Token

它表示一次请求中,模型能够处理的:

输入内容 + 输出内容

最大可以达到约 256K Token。

例如:

  • 系统提示词
  • 历史对话
  • 用户问题
  • RAG 检索内容
  • 模型最终回答

这些内容都会占用上下文。

可以把上下文理解成模型的一张“草稿纸”,草稿纸越大,一次能够看到的文档、代码和历史对话就越多。

不过上下文越长,KV Cache 占用也越大,所以长上下文和高并发之间通常需要做取舍


三、FP8 和 NVFP4 有什么区别?

服务器上同时有两个版本:

Qwen3.8-27B-FP8
Qwen3.8-27B-NVFP4

它们本质上还是同一个 27B 模型,主要区别是模型参数使用的数值精度不同。

类型 特点
FP8 精度更高,显存占用更大
NVFP4 精度更低一些,但更省显存,推理效率更高

简单理解:

FP8 相当于每个参数使用更多空间保存。

NVFP4 相当于使用更少的空间保存参数。

因此 NVFP4 最大的意义就是:

用更少的显存保存同样规模的模型。

对于 RTX 5090 这类 Blackwell 架构显卡,NVFP4 也比较适合推理部署。


四、NVFP4 会不会让 27B 变成 13B?

不会。

这是非常容易混淆的地方。

无论是:

Qwen3.8-27B-FP8

还是:

Qwen3.8-27B-NVFP4

模型仍然都是约 27B 参数。

NVFP4 改变的是:

每个参数占多少空间。

而不是:

有多少参数参与计算。

可以简单理解成:

FP8:
27B 参数,每个参数占得大一些。

NVFP4:
还是 27B 参数,只是每个参数占得更小。

五、什么叫“激活参数”?

讨论大模型时,经常会看到类似:

总参数:100B
激活参数:13B

这里的“激活参数”可以简单理解成:

模型每次推理时,真正参与计算的参数数量。

对于普通 Dense 模型,例如 Qwen3.8-27B:

总参数:约 27B
激活参数:约 27B

也就是推理时基本全部参数都会参与计算。


六、什么是 Dense?

Dense 中文一般叫:

稠密模型。

可以把它理解成一个公司有 27 个员工。

每来一个任务:

27 个人基本全部参与工作。

Qwen3.8-27B 就属于这种方式:

27B 总参数
    ↓
每次推理
    ↓
基本全部参与计算
    ↓
激活参数约 27B

七、什么是 MoE?

MoE 全称:

Mixture of Experts

中文一般叫:

混合专家模型。

MoE 和 Dense 最大的区别是:

模型虽然很大,但每次推理只让其中一部分参数参与计算。

例如一个 MoE 模型:

总参数:100B
激活参数:13B

可以把它理解成一个公司里面有很多不同领域的专家:

  • 程序专家
  • 数学专家
  • 写作专家
  • 金融专家
  • 法律专家

当用户提出一个问题后,模型内部会有一个类似“调度员”的 Router:

用户问题
    ↓
Router 判断
    ↓
选择合适的几个专家
    ↓
这些专家参与计算
    ↓
生成答案

所以整个模型虽然可能有 100B 参数,但一次推理真正参与计算的可能只有 13B。


八、Dense 和 MoE 最简单的区别

可以直接记住一句话:

Dense 是所有人一起干活,MoE 是人很多,但每次只叫几个专家干活。

例如 Dense:

27B 总参数
    ↓
约 27B 参数参与计算

而 MoE:

100B 总参数
    ↓
根据问题选择部分专家
    ↓
可能只有 13B 参数参与计算

因此 MoE 的一个重要优势就是:

可以把模型总参数做得很大,同时不用每次把所有参数都计算一遍。


九、最后简单总结

把这些概念放到一起,其实就比较清楚了。

Qwen3.8-27B

  • 27B:模型大约有 270 亿参数
  • Dense:推理时基本全部参数参与计算
  • NVFP4:降低参数存储精度,减少显存占用
  • TP=2:两张 GPU 一起运行一个模型
  • 256K Context:一次请求最多处理约 256K Token

最容易混淆的一点就是:

模型量化和激活参数是两回事。

FP8、NVFP4 解决的是:

参数怎么存。

Dense、MoE 解决的是:

推理时哪些参数参与计算。

理解了这一点,后面再看到 FP8、FP4、27B、激活参数、MoE 这些概念,就不会那么容易混在一起了。