惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

GbyAI
GbyAI
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
S
Securelist
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Google DeepMind News
Google DeepMind News
N
News and Events Feed by Topic
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - Franky
T
Threat Research - Cisco Blogs
罗磊的独立博客
IT之家
IT之家
人人都是产品经理
人人都是产品经理
Stack Overflow Blog
Stack Overflow Blog
K
Kaspersky official blog
博客园_首页
T
The Blog of Author Tim Ferriss
T
Tenable Blog
I
InfoQ
Apple Machine Learning Research
Apple Machine Learning Research
T
The Exploit Database - CXSecurity.com
D
Docker
TaoSecurity Blog
TaoSecurity Blog
S
Schneier on Security
Attack and Defense Labs
Attack and Defense Labs
N
News and Events Feed by Topic
M
MIT News - Artificial intelligence
U
Unit 42
N
Netflix TechBlog - Medium
L
LINUX DO - 热门话题
C
CERT Recently Published Vulnerability Notes
T
Tailwind CSS Blog
Hacker News: Ask HN
Hacker News: Ask HN
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
爱范儿
爱范儿
美团技术团队
F
Fortinet All Blogs
Last Week in AI
Last Week in AI
AWS News Blog
AWS News Blog
V
V2EX
博客园 - 【当耐特】
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Hacker News - Newest:
Hacker News - Newest: "LLM"
Schneier on Security
Schneier on Security
腾讯CDC
H
Help Net Security
B
Blog RSS Feed
T
Tor Project blog
P
Privacy & Cybersecurity Law Blog
The Last Watchdog
The Last Watchdog
有赞技术团队
有赞技术团队

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
什么是模型量化
微信公众号 · 2025-09-06 · via 陈少文的网站

Please enable Javascript to view the contents

什么是模型量化

1. 什么是模型量化

模型量化是将高精度的模型(通常为 32 位浮点数 FP32 或 16 位浮点数 FP16 )的权重和激活值转换为低精度模型(如 8 位整数 INT8)的过程。

FP32 的值范围为 -3.4*10^383.4*10^38,有 40 亿个值。而对于 INT8,我们只能看到可能值集内的 256 个值,值范围为 -128 到 128。计算 INT8 矩阵比 FP32、FP16 的速度要快很多。

模型量化的过程就是建立高精度数值映射到低精度数值的映射关系。

2. 模型量化的好处

  • 降低模型的显存占用

https://huggingface.co/Qwen/Qwen2.5-7B 为例,默认使用的是 bfloat16 精度,估算一下模型权重占用的显存为 7B _ 16/8 Byte = 14 GB 显存。如果进行 Int8 量化,模型权重的显存占用降为 7B _ 8/8 Byte = 7 GB 显存,只有之前的一半。

  • 提高模型的推理速度

首先是计算量会大大减少,W8A16(权重 8 位,激活 16 位)计算量减少 30~40%,W8A8(权重 8 位,激活 8 位)计算量减少 60-75%。

其次,还有数据传输量能减少 50% 左右,能够有效降低显存带宽占用。传输相同数据量,量化版本的模型比非量化版本的传输时间要短很多。

3. 常见的量化位数

简写含义应用场景
W16A16权重 FP16/BF16,激活 FP16/BF16常见的混合精度训练、推理
W8A8权重 INT8,激活 INT8经典 INT8 量化,推理部署广泛(TensorRT、ONNX Runtime、OpenVINO 等)
W8A16权重 INT8,激活 FP16/BF16折中方案,降低权重存储与带宽但保持较高精度
W4A16权重 INT4,激活 FP16/BF16大模型推理常用配置(如 GPTQ、AWQ、QLoRA)
W4A8权重 INT4,激活 INT8激进的低精度方案,压缩率更高,但精度下降风险大

4. 常见的量化方法

4.1 GGUF

GGUF 全称 GPT-Generated Unified Format,是由 Georgi Gerganov(llama.cpp 开源项目创始人)定义发布的一种大模型文件格式。

原理:

  • 使用 GPT 生成的统一格式
  • 采用块级量化技术,将权重按块进行量化处理
  • 通过块级结构平衡模型大小和精度损失

特点与优势:

  • 支持多种量化精度(Q4_0, Q4_1, Q5_0, Q5_1, Q8_0 等)
  • 对硬件要求低,普通 CPU 即可运行
  • 模型文件相对较小,便于存储和传输
  • 社区支持度高,工具链完善
  • 支持流式生成,用户体验良好
  • 采用块级量化,有效平衡了模型大小和精度

使用场景:

  • CPU 推理
  • 本地个人电脑运行大模型
  • 边缘设备部署
  • 资源受限环境

4.2 GPTQ

GPTQ 全称 Gradient-based Post-Training Quantization,是一种基于梯度的训练后量化方法。

原理:

  • 基于梯度信息进行训练后量化
  • 使用梯度下降法优化量化过程中的误差
  • 通过梯度信息指导量化参数的选择

特点与优势:

  • 基于梯度的训练后量化技术
  • 通常量化到 4bit 或 8bit
  • 在 4bit 量化下仍能保持较好的模型性能
  • 相比原始模型显著减少显存占用
  • 推理速度较快
  • 适合在消费级 GPU 上部署大模型

使用场景:

  • GPU 推理
  • 需要较高精度的生产环境
  • 中等规模的推理服务

4.3 AWQ

AWQ 全称 Activation-aware Weight Quantization,是一种基于激活感知的权重量化方法。

原理:

  • 基于激活值分布进行权重量化
  • 使用梯度下降法优化量化误差
  • 通过最小化量化误差来确定量化参数
  • 量化参数包括量化范围、量化步长等

特点与优势:

  • 基于激活感知的权重量化技术
  • 保护重要权重通道不被量化,保持关键信息
  • 通常实现 4bit 量化
  • 在相同量化位数下精度更高
  • 推理速度快,显存占用少
  • 特别适合需要高质量输出的应用

使用场景:

  • GPU 推理
  • 高性能推理需求
  • 对模型精度要求较高的场景

4.4 FP4

FP4 全称 4-bit Floating Point,是一种 4 位浮点数表示方法。

原理:

  • 使用 4 位浮点数格式表示权重
  • 保持浮点数的指数和尾数结构
  • 相比整数量化能更好地保持原始数值分布

特点与优势:

  • 4 位浮点数表示,保持数值精度
  • 极低的存储和计算开销
  • 相比 4bit 整数量化精度更好
  • 相比整数量化能更好保持数值分布
  • 适合大规模部署
  • 通常结合特殊的硬件优化

使用场景:

  • 极端资源受限环境
  • 需要最大化压缩比的场景
  • 特定硬件加速器

4.5 NVFP4

NVFP4 全称 NVIDIA 4-bit Floating Point,是 NVIDIA 专门优化的 4 位浮点数表示方法。

原理:

  • 基于 NVIDIA 硬件优化的 4 位浮点数格式
  • 针对 NVIDIA GPU 架构进行专门优化
  • 保持浮点数特性的同时实现极致压缩

特点与优势:

  • NVIDIA 专用的 4 位浮点数表示
  • 极低的存储和计算开销
  • 相比 4bit 整数量化精度更好
  • 相比整数量化能更好保持数值分布
  • 适合大规模部署
  • 针对 NVIDIA 硬件进行了特殊优化

使用场景:

  • NVIDIA GPU 环境下的极端资源受限场景
  • 需要最大化压缩比的 NVIDIA 硬件部署
  • NVIDIA 特定硬件加速器

微信公众号