惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
月光博客
月光博客
D
DataBreaches.Net
云风的 BLOG
云风的 BLOG
F
Fortinet All Blogs
T
The Blog of Author Tim Ferriss
Stack Overflow Blog
Stack Overflow Blog
Blog — PlanetScale
Blog — PlanetScale
aimingoo的专栏
aimingoo的专栏
U
Unit 42
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
MyScale Blog
MyScale Blog
T
Tailwind CSS Blog
N
Netflix TechBlog - Medium
B
Blog
博客园_首页
G
Google Developers Blog
Recent Announcements
Recent Announcements
博客园 - 【当耐特】
P
Proofpoint News Feed
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
MongoDB | Blog
MongoDB | Blog
Last Week in AI
Last Week in AI

土法炼钢兴趣小组的算法知识备份

国密算法与国密 TLS 系列索引 【系统架构设计】架构质量属性:不只是"高可用高性能" 【系统架构设计百科】告警策略:如何避免"狼来了" 【系统架构设计】CQRS:读写分离的架构哲学 【系统架构设计】空间架构:极端扩展场景的解法 【系统架构设计】微服务架构深度审视:优势、代价与适用边界 【系统架构设计】扩展性原理:水平、垂直与对角扩展 【系统架构设计】无状态设计:扩展的第一步也是最难的一步 【系统架构设计】缓存架构:从本地到分布式的多级缓存体系 【系统架构设计】管道与过滤器:Unix 哲学的架构表达 【系统架构设计】复杂性管理:架构的核心战场 【系统架构设计】消息队列架构:异步解耦的设计与陷阱 【系统架构设计】CDN 架构:全球加速的设计原理 【系统架构设计】连接池设计:被忽视的性能杀手 【系统架构设计】弹性设计模式:熔断器、舱壁与超时 【系统架构设计】高可用设计模式:冗余、故障转移与仲裁 【系统架构设计】容量规划:从拍脑袋到数据驱动 【系统架构设计】数据库扩展:分库分表的工程实践与替代方案 【系统架构设计】SLO 工程:可靠性的量化管理 【系统架构设计】性能建模:用数学思维分析系统瓶颈 【系统架构设计】混沌工程:主动验证系统的韧性 【系统架构设计】零拷贝与内存映射:数据搬运的极致优化 【系统架构设计】线程模型:从 thread-per-request 到协程 【系统架构设计】容灾架构:多活与灾备设计 【系统架构设计】数据库性能模式:索引、查询与连接管理 【系统架构设计】数据建模:从关系范式到文档模型的真实权衡 【系统架构设计】吞吐量优化:批处理、流水线与并发模型 【系统架构设计】流处理架构:从批处理到实时的范式迁移 【系统架构设计】搜索引擎架构:倒排索引之上的系统设计 【系统架构设计】时序数据架构:监控与 IoT 的存储设计
【操作系统百科】内存回收
2026-04-27 · via 土法炼钢兴趣小组的算法知识备份

物理内存有限;页缓存和匿名页不断增长。内核需要一套策略:谁先被回收、什么时候开始回收、回收多少。Linux 的回收子系统经历了 20 年演化,到今天 MGLRU 是新方向。

一、先看图

flowchart TD
    ALLOC[页分配请求] --> WM{watermark 检查}
    WM -->|> high| OK[直接分配]
    WM -->|< low| WAKEUP[唤醒 kswapd]
    WM -->|< min| DR[direct reclaim<br/>阻塞当前进程]
    WAKEUP --> KSWAPD[kswapd 扫描]
    DR --> SCAN[扫描 LRU / MGLRU]
    KSWAPD --> SCAN
    SCAN --> FILE{clean file page?}
    FILE -->|yes| DROP[直接丢弃]
    FILE -->|dirty| WB[writeback 后丢弃]
    SCAN --> ANON{anon page?}
    ANON -->|swappiness > 0| SWAP[swap out]
    ANON -->|swappiness = 0| SKIP[跳过]
    classDef ok fill:#3fb95022,stroke:#3fb950,color:#adbac7;
    classDef warn fill:#f0883e22,stroke:#f0883e,color:#adbac7;
    classDef crit fill:#f8514922,stroke:#f85149,color:#adbac7;
    class OK ok
    class WAKEUP,KSWAPD,WB warn
    class DR crit

二、Watermark 三线

每个 zone 有三个水位:

  • high:充裕,正常分配
  • low:kswapd 唤醒阈值
  • min:direct reclaim 阈值(分配者亲自回收)

还有 boost watermark(5.0+):sudden spike 时临时提高 low,让 kswapd 提前介入。

cat /proc/zoneinfo | grep -E 'min|low|high|managed'

三、经典 LRU

3.1 四条链表

每个 zone(实际按 lruvec / memcg)维护:

  • active anon
  • inactive anon
  • active file
  • inactive file

页首次分配进 inactive。被访问(PTE A bit)后提升到 active。

3.2 扫描

shrink_nodeshrink_lruvecshrink_list

  1. 扫描 inactive 链表尾部
  2. 检查 PTE A bit(page_referenced):有访问 → 回到 active
  3. 无访问 → 回收候选
  4. clean file → 直接丢
  5. dirty → writeback 后丢
  6. anon → swap out

3.3 swappiness

vm.swappiness = 60(默认)

控制扫描 anon vs file 的比例——不是”swap 概率”。

  • =0:几乎不回收匿名页(除非没有 file 页可回收了)
  • =100:同等对待 anon 和 file
  • =200(6.1+):更激进回收 anon(适合 zram)

容器内:memory.swap.max + memory.zswap.max 也影响。

四、MGLRU(Multi-Gen LRU)

4.1 经典 LRU 的问题

  • 只有 active/inactive 两代,粒度粗
  • A bit 扫描需要遍历 PTE(rmap),开销大
  • 工作集估计不准——新旧混杂

4.2 MGLRU 方案(6.1 合入)

引入多代(generation):

gen 0 (最老) → gen 1 → gen 2 → gen 3 (最新)

每代是一个 FIFO。页被访问时提升到最新代;回收时从最老代扫。

关键优化:

  • 页表扫描:直接 walk 页表而非 rmap,更高效
  • bloom filter:快速判断”这个 gen 里有没有热页”
  • 类型分离:anon 和 file 独立分代

4.3 效果

Google 在 Chromebook 和 Android 上实测:

  • 低内存抖动减少 40%
  • kswapd CPU 使用降低 35%
  • major fault 减少

启用:

cat /sys/kernel/mm/lru_gen/enabled     # 0x0007 = 全开
echo 7 > /sys/kernel/mm/lru_gen/enabled

五、kswapd vs direct reclaim

  • kswapd:后台内核线程,每 zone 一个(kswapd0kswapd1…)。low watermark 触发,回收到 high
  • direct reclaim:分配者自己在 __alloc_pages_slowpath 里回收。min watermark 触发

direct reclaim 是延迟杀手——当前进程阻塞直到回收够页。

生产诊断:

sar -B 1
# pgscank/s = kswapd scan
# pgscand/s = direct reclaim scan → 越高越危险

六、memcg 回收

cgroup v2 memory.max 限制:memcg 内存超限时触发 memcg 级回收,不影响全局。

memory.current   # 当前使用
memory.max       # 硬限
memory.high      # 软限:超过开始 throttle
memory.low       # 保护:尽量不回收
memory.min       # 绝对保护

层级继承:子 cgroup 受父限制。

七、reclaim 调优

7.1 watermark

# 提高 watermark boost,让 kswapd 更早介入
sysctl vm.watermark_boost_factor=15000
sysctl vm.watermark_scale_factor=200    # 拉大 low-high 间距

7.2 swappiness

# DB 服务器(想保留文件缓存、少 swap)
sysctl vm.swappiness=10

# 桌面/Android(zram 有效)
sysctl vm.swappiness=100

7.3 PSI

Pressure Stall Information(4.20+)检测回收压力:

cat /proc/pressure/memory
# some avg10=0.50 avg60=0.30 avg300=0.20 total=12345
  • some:至少一个任务因内存等待
  • full:所有任务都在等

systemd-oomd 基于 PSI 触发 cgroup 级 OOM。

八、compact 与回收的关系

回收释放页后可能碎片化——高阶(order>0)分配仍失败。compaction 把散落的页搬到一起,腾出连续大块。

echo 1 > /proc/sys/vm/compact_memory   # 手动触发
cat /proc/buddyinfo                      # 看各 order 空闲页数

THP 分配失败 → 触发 compaction → 如果还失败 → fallback 4K。这个链条是 THP 抖动的根源。

九、观察

vmstat 1
# si/so = swap in/out
# free = 空闲页数

cat /proc/vmstat | grep -E 'pgsteal|pgscan|pgrefill|pgactivate'
# pgsteal_kswapd  pgsteal_direct

cat /proc/meminfo | grep -E 'Active|Inactive|Slab|SReclaimable'

十、小结

  • watermark 三线控制何时回收、谁来回收
  • 经典 LRU 四链表 + swappiness 控制 anon/file 比例
  • MGLRU 多代替代两代,减少扫描开销和抖动
  • direct reclaim 是延迟杀手——降 pgscand 是关键目标
  • PSI 是现代内存压力的标准度量

参考文献

  • Gorman, M. “Understanding the Linux Virtual Memory Manager.” §10 “Page Frame Reclaiming”
  • Yu Zhao, “Multi-Gen LRU Framework.” LWN.net 2022
  • mm/vmscan.c
  • Documentation/admin-guide/mm/multigen_lru.rst
  • Johannes Weiner, “PSI: Pressure Stall Information.” LPC 2018

工具

  • vmstatsar -B
  • /proc/vmstat/proc/meminfo/proc/zoneinfo
  • cgroup v2 memory.stat
  • bpftrace + vmscan tracepoints

延伸阅读


上一篇页缓存深入 下一篇交换

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-04-28 · os

【操作系统百科】交换

swap 还值得开吗?本文讲 swap area 基础、swap cache、zram 压缩内存、zswap 前端压缩池、swappiness 的真实含义、容器里的 swap 策略,以及为什么现代 Android 全靠 zram 不靠磁盘。

2026-05-03 · os

【操作系统百科】Slab/SLUB 分配器

buddy 只管页粒度(4K+),内核大多数对象只有几十到几百字节。slab/SLUB 在 buddy 之上做对象级缓存。本文讲 slab 历史、SLUB 接手、SLOB 退场、kmem_cache、per-CPU cache、KASAN 集成。

2026-05-07 · os

【操作系统百科】用户态分配器

glibc malloc、tcmalloc、jemalloc、mimalloc 各有哲学。本文讲 arena、thread cache、size class、madvise 返还策略、碎片与 RSS 膨胀、如何根据负载选分配器。

2026-05-18 · os

【操作系统百科】io_uring 内核内部

io_uring 用共享内存 ring buffer 实现零 syscall 异步 I/O——SQ/CQ、SQPOLL、IOPOLL、注册 fd/buffer、multishot、安全模型演化。本文深入内核实现与工程实践。