惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
T
The Blog of Author Tim Ferriss
Apple Machine Learning Research
Apple Machine Learning Research
B
Blog
L
LangChain Blog
博客园_首页
Vercel News
Vercel News
月光博客
月光博客
B
Blog RSS Feed
S
SegmentFault 最新的问题
博客园 - Franky
C
Check Point Blog
A
About on SuperTechFans
Stack Overflow Blog
Stack Overflow Blog
J
Java Code Geeks
F
Fortinet All Blogs
Recent Announcements
Recent Announcements
Y
Y Combinator Blog
罗磊的独立博客
D
Docker
酷 壳 – CoolShell
酷 壳 – CoolShell
云风的 BLOG
云风的 BLOG
人人都是产品经理
人人都是产品经理
WordPress大学
WordPress大学

土法炼钢兴趣小组的算法知识备份

国密算法与国密 TLS 系列索引 【系统架构设计】架构质量属性:不只是"高可用高性能" 【系统架构设计百科】告警策略:如何避免"狼来了" 【系统架构设计】CQRS:读写分离的架构哲学 【系统架构设计】空间架构:极端扩展场景的解法 【系统架构设计】微服务架构深度审视:优势、代价与适用边界 【系统架构设计】扩展性原理:水平、垂直与对角扩展 【系统架构设计】无状态设计:扩展的第一步也是最难的一步 【系统架构设计】缓存架构:从本地到分布式的多级缓存体系 【系统架构设计】管道与过滤器:Unix 哲学的架构表达 【系统架构设计】复杂性管理:架构的核心战场 【系统架构设计】消息队列架构:异步解耦的设计与陷阱 【系统架构设计】CDN 架构:全球加速的设计原理 【系统架构设计】连接池设计:被忽视的性能杀手 【系统架构设计】弹性设计模式:熔断器、舱壁与超时 【系统架构设计】高可用设计模式:冗余、故障转移与仲裁 【系统架构设计】容量规划:从拍脑袋到数据驱动 【系统架构设计】数据库扩展:分库分表的工程实践与替代方案 【系统架构设计】SLO 工程:可靠性的量化管理 【系统架构设计】性能建模:用数学思维分析系统瓶颈 【系统架构设计】混沌工程:主动验证系统的韧性 【系统架构设计】零拷贝与内存映射:数据搬运的极致优化 【系统架构设计】线程模型:从 thread-per-request 到协程 【系统架构设计】容灾架构:多活与灾备设计 【系统架构设计】数据库性能模式:索引、查询与连接管理 【系统架构设计】数据建模:从关系范式到文档模型的真实权衡 【系统架构设计】吞吐量优化:批处理、流水线与并发模型 【系统架构设计】流处理架构:从批处理到实时的范式迁移 【系统架构设计】搜索引擎架构:倒排索引之上的系统设计 【系统架构设计】时序数据架构:监控与 IoT 的存储设计
【操作系统百科】Slab/SLUB 分配器
2026-05-03 · via 土法炼钢兴趣小组的算法知识备份

内核里到处是小对象:task_struct、inode、dentry、sk_buff、bio……它们几十到几百字节,如果每次都向 buddy 要一整页太浪费。slab 层把一页切成多个”对象槽”,复用已分配的页。

一、先看图

flowchart TD
    KMALLOC[kmalloc 64 字节] --> CACHE[kmem_cache<br/>size=64]
    CACHE --> PCPU{per-CPU<br/>freelist?}
    PCPU -->|有| OBJ[返回 object]
    PCPU -->|无| PARTIAL[partial slab<br/>页]
    PARTIAL -->|有空槽| OBJ
    PARTIAL -->|无| BUDDY[buddy alloc<br/>新 slab 页]
    BUDDY --> INIT[切成 N 个<br/>64 字节 slot]
    INIT --> OBJ
    classDef fast fill:#3fb95022,stroke:#3fb950,color:#adbac7;
    classDef slow fill:#f0883e22,stroke:#f0883e,color:#adbac7;
    class PCPU,OBJ fast
    class BUDDY,INIT slow

二、slab → SLUB → SLOB 简史

2.1 slab(1994)

Solaris 启发:per-cache 的 full / partial / empty 三链表 + coloring。复杂、管理结构占用大。

2.2 SLUB(2.6.22,2007)

Christoph Lameter 重写:

  • 无 full/empty 链表——只跟踪 partial
  • 对象元数据存在对象自身(空闲时 freelist 指针)
  • per-CPU freelist 替代 per-CPU slab
  • 代码量少一半、内存开销更低

6.x 唯一主力。

2.3 SLOB(已删除 6.4)

极简分配器,面向 <64KB RAM 嵌入式。6.4 后删除。

三、kmem_cache

每种对象类型一个 kmem_cache

struct kmem_cache *task_struct_cache;
task_struct_cache = kmem_cache_create("task_struct",
    sizeof(struct task_struct), __alignof__(struct task_struct),
    SLAB_PANIC|SLAB_ACCOUNT, NULL);

// 分配
struct task_struct *p = kmem_cache_alloc(task_struct_cache, GFP_KERNEL);
// 释放
kmem_cache_free(task_struct_cache, p);

kmalloc

通用分配器——底层是一组按 size class 的 kmem_cache:

kmalloc-8, kmalloc-16, kmalloc-32, ..., kmalloc-8192
void *p = kmalloc(100, GFP_KERNEL);  // 实际从 kmalloc-128 分配
kfree(p);

4.1 slab page

一个 slab 页(通常 order-0 或 order-1)被切成若干对象:

[ obj0 | obj1 | obj2 | ... | objN ]

空闲对象串成 freelist(在对象内部存 next 指针)。

4.2 per-CPU freelist

每 CPU 缓存一个”当前 slab”+ freelist。分配只需读 freelist 头——无锁(this_cpu_cmpxchg)。

4.3 partial 链表

CPU freelist 空了 → 从 node 的 partial 链表取一个 slab。SLUB_CPU_PARTIAL 控制缓存多少 partial。

4.4 冻结

partial slab 从 node 链表移到 CPU 本地时被”冻结”——其他 CPU 不能碰。减少争抢。

五、对齐与着色

  • 对象按 ARCH_SLAB_MINALIGN(通常 8/16 字节)对齐
  • KASAN 要求额外 redzone(对象前后的守卫区)
  • 缓存行着色(cache line coloring):同类 slab 的起始偏移不同,分散 cache 冲突

六、KASAN 集成

KASAN(Kernel Address SANitizer)在 SLUB 级别检测 UAF 和 OOB:

CONFIG_KASAN=y
CONFIG_KASAN_GENERIC=y     # 基于 shadow memory
CONFIG_KASAN_SW_TAGS=y     # arm64 tag-based
CONFIG_KASAN_HW_TAGS=y     # arm64 MTE

SLUB 分配时 poison 对象,释放后再 poison → 访问已释放内存触发 KASAN report。

七、SLUB_DEBUG

编译期 CONFIG_SLUB_DEBUG=y + 启动参数 slub_debug=FZPU

  • F:sanity check(double free、对象损坏)
  • Z:red zone(对象前后填充守卫值)
  • P:poison(释放后填充 0x6b/0xa5)
  • U:user tracking(记录分配调用栈)

生产一般不开(性能惩罚 2-10x)。调试时通过 slub_debug=FZP,kmalloc-64 只对特定 cache 开。

八、memcg 感知

cgroup v2 下 SLUB 支持 SLAB_ACCOUNT flag → 内核对象计入 memcg。

cat /sys/fs/cgroup/myapp/memory.stat | grep slab
# slab 12345678
# slab_reclaimable 8765432
# slab_unreclaimable 3580246

九、观察

# 所有 slab cache
cat /proc/slabinfo | head

# 或更友好的
slabtop -o

# 特定 cache
cat /sys/kernel/slab/kmalloc-256/objs_per_slab
cat /sys/kernel/slab/kmalloc-256/cpu_partial
cat /sys/kernel/slab/kmalloc-256/total_objects

# slab 总内存
cat /proc/meminfo | grep Slab
# Slab:           456000 kB
# SReclaimable:   300000 kB
# SUnreclaim:     156000 kB

十、常见问题

A:Slab 占用很高 检查 slabtop 看哪个 cache 大——常见:dentry_cache、inode_cache(文件系统 cache)。echo 2 > /proc/sys/vm/drop_caches 可回收,但不推荐生产常用。

B:slab leak kmemleak 工具扫描 slab 中没有引用指向的对象 → 可能泄漏。

C:KASAN report UAF in slab 看 report 的 alloc/free stack trace,定位生命周期管理 bug。

十一、小结

  • SLUB 是 buddy 之上的对象缓存层
  • per-CPU freelist 让分配几乎无锁
  • kmalloc 按 size class 走预置的 kmem_cache
  • KASAN + SLUB_DEBUG 是内核内存 bug 的主力检测
  • memcg 感知让容器可以限制内核 slab 使用

参考文献

  • Bonwick, J. “The Slab Allocator: An Object-Caching Kernel Memory Allocator.” USENIX 1994
  • Christoph Lameter, “SLUB: The Unqueued Slab Allocator.” 2007
  • mm/slub.c
  • Documentation/mm/slub.rst
  • include/linux/slab.h

工具

  • /proc/slabinfoslabtop
  • /sys/kernel/slab/
  • slub_debug= boot param
  • kmemleak
  • perf kmem

延伸阅读


上一篇Buddy 系统 下一篇vmalloc/kmap/ioremap

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-05-06 · os

【操作系统百科】内核内存调试

内核内存 bug 是最难追的:UAF、OOB、double free、leak 都可能沉默数月。本文讲 KASAN 三种模式、KFENCE 生产采样、kmemleak、SLUB_DEBUG、UBSAN/KCSAN 联动。

2026-04-27 · os

【操作系统百科】内存回收

Linux 内存回收是 VM 最复杂的子系统之一。本文讲 active/inactive LRU、kswapd 与 direct reclaim、watermark 三线、swappiness 的真实含义、MGLRU 改造、memcg 回收与 PSI。

2026-04-28 · os

【操作系统百科】交换

swap 还值得开吗?本文讲 swap area 基础、swap cache、zram 压缩内存、zswap 前端压缩池、swappiness 的真实含义、容器里的 swap 策略,以及为什么现代 Android 全靠 zram 不靠磁盘。

2026-05-07 · os

【操作系统百科】用户态分配器

glibc malloc、tcmalloc、jemalloc、mimalloc 各有哲学。本文讲 arena、thread cache、size class、madvise 返还策略、碎片与 RSS 膨胀、如何根据负载选分配器。