惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
博客园 - 叶小钗
The Cloudflare Blog
D
DataBreaches.Net
J
Java Code Geeks
G
Google Developers Blog
L
LangChain Blog
N
Netflix TechBlog - Medium
Stack Overflow Blog
Stack Overflow Blog
月光博客
月光博客
酷 壳 – CoolShell
酷 壳 – CoolShell
WordPress大学
WordPress大学
小众软件
小众软件
量子位
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
博客园_首页
罗磊的独立博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
B
Blog
腾讯CDC

博客园 - jiftle

llama.cpp 启用 Vulkan 后端:编译与测试工作记录 华为镜像站 JDK下载 opencode系统提示词加载机制 Qoder CN版本v1.4.2 (2026-06-27) 提供套餐余量查看 清理宝塔面板 桌面 AI 应用技术栈深度对比:腾讯元宝 vs WorkBuddy 【转载】编辑器之神与神的编辑器:Vim 与 Emacs 的传奇 OpenCode 源码解读报告 linux双网卡默认路由问题 通过4种方法来重置 UOS 操作系统中的用户密码 统信服务器系统【重置登录密码】解决方案 vscode插件Git Graph 怎么只提交单个文件 opencode 配置本地ollama模型编程 opencode编程工具 ollama模型导出 【转载】从源码看 Qwen Code 的设计思路 Qwen Code 代码分析 模型性能评测 职场真相:不是赏饭吃,是价值交换 vim插件AI结对编程辅助编程插件 千问网页版生成的代码不支持语法高亮 linux检查显存大小(集成显卡) golang测试模型的token输出速度 Go 实现本地 Ollama 模型基准测试工具 使用golang编写大语言模型的输出速度性能 ollama v0.18.2手工部署安装,linux, deepin 20.9 树莓派pico使用无源蜂鸣器播放小星星 树莓派pico播放玛丽有只小羊羔 树莓派pico蜂鸣器播放音乐 树莓派 pico W(创客版)RP2020 W代码示例温度检测+液晶显示屏+HTTP服务器页面控制灯光
GGUF ggml通用文件 格式详解
jiftle · 2026-08-24 · via 博客园 - jiftle

一、GGUF 是什么?

GGUF 是一种 通用二进制文件格式,用于存储大语言模型的参数(如权重和偏置)、元信息、配置以及 Tokenizer 等内容。
它的目标是让开发者只用一个文件就能完成模型的加载、推理和部署,无需额外配置。

换句话说,如果以前的 LLM 模型是一堆分散的文件(权重文件、配置文件、词表文件等),
那么 GGUF 就把它们都“打包进了一个文件里”,方便拷贝、分发、加载。
二、GGUF 的内部架构

一个 GGUF 文件本质上是一个二进制文件(binary file),内部按照固定顺序存储了模型的元信息(metadata)、张量信息(tensor info)以及实际的权重数据(tensor data)。

图片

文件的量化类型 file_type = 10 表示 Q4、Q5 等
词表 tokenizer.ggml.tokens

张量信息区(Tensor Info Section)

紧接在元数据后面,用紫色方框标出。
这里存储了每个张量(权重矩阵)的基本信息,数量为 tensor_count。

每个张量包含以下字段:
字段 说明 类型 示例
name 张量名称 GGUF string blk.0.ffn_gate.weight
n_dimensions 张量维度数 UINT32 2
dimensions 各维度大小 UINT64[] [4096, 32000]
type 数据类型 / 量化方式 UINT32 10(GGML_TYPE_Q2_K)
offset 该张量在文件中实际数据的偏移位置 UINT64 43024384

也就是说,这里列出的是“索引表”,告诉加载程序去文件哪个位置取对应权重。

4)张量数据区(Tensor

Data Section)

在文件的最后部分(图中黑色长条 “rest of the file”)存储的是实际的模型权重数据。
每个张量在前面的 offset 字段中标明了自己在文件中的位置。

这些数据通常是量化后的数值矩阵,例如使用 Q4 或 Q5 量化后的权重块。
它们通过 mmap 技术可以直接映射到内存中进行计算,而不需要全部加载到内存中。