惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
C
Check Point Blog
宝玉的分享
宝玉的分享
Attack and Defense Labs
Attack and Defense Labs
www.infosecurity-magazine.com
www.infosecurity-magazine.com
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Application and Cybersecurity Blog
Application and Cybersecurity Blog
博客园 - Franky
V
V2EX
Hugging Face - Blog
Hugging Face - Blog
Google DeepMind News
Google DeepMind News
罗磊的独立博客
S
SegmentFault 最新的问题
S
Secure Thoughts
T
Troy Hunt's Blog
J
Java Code Geeks
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
W
WeLiveSecurity
Help Net Security
Help Net Security
S
Security @ Cisco Blogs
T
Threatpost
Apple Machine Learning Research
Apple Machine Learning Research
D
Darknet – Hacking Tools, Hacker News & Cyber Security
V2EX - 技术
V2EX - 技术
T
Tor Project blog
S
Security Affairs
T
Tailwind CSS Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
H
Hacker News: Front Page
腾讯CDC
博客园 - 司徒正美
The Last Watchdog
The Last Watchdog
N
News | PayPal Newsroom
博客园 - 聂微东
小众软件
小众软件
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
爱范儿
爱范儿
C
CERT Recently Published Vulnerability Notes
AI
AI
N
News and Events Feed by Topic
C
Cybersecurity and Infrastructure Security Agency CISA
O
OpenAI News
T
The Exploit Database - CXSecurity.com
L
LINUX DO - 最新话题
T
Threat Research - Cisco Blogs
雷峰网
雷峰网
NISL@THU
NISL@THU
V
Visual Studio Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
凌晨告警排查记:一次AWS EBS磁盘IO利用率100%的真相
东风微鸣 · 2026-05-18 · via 博客园_首页

凌晨 3:30(其实是UTC时间, 美国站点的晚上, 我们这边正常上班时间, 嘿嘿嘿),电话响了。心里咯噔一下:这个时间点的告警,十有八九不是什么好事。果然,值班同事反馈应用变得特别慢,大量请求超时,用户已经开始骂了。

我第一反应:是不是有什么 job 跑起来了?比如凌晨的日志备份。

查了一圈,发现确实有一个日志备份(先压缩写入, 再读取通过网络传到S3上去)的 cronjob 正在执行。正当我以为是元凶时,仔细一看,这 job 的日志量不算大,不至于把服务搞趴。但问题又确确实实发生了,那个时间点也只有这一个明显的操作。

好吧,排障的经典套路来了:先看基础设施层面有没有瓶颈

💥 常规指标一切正常?

登录监控系统(Prometheus + Grafana),先扫了一眼传统三件套:

  • CPU:不高,才 20% 左右。
  • 内存:也正常,50% 左右。
  • 网络:带宽用了 1Gbps 左右,而 EC2 实例的基线带宽是 3Gbps,离打满还远着呢。
  • 磁盘 IOPS:EC2 跑的应用,挂载的是 gp3 卷,IOPS 基线 3000,峰值可以飙到 12000 左右。当时的读写 IOPS 也就 500 多,也没达到上限。

Network

Disk IOPS

这数据看着好像没什么问题……那应用为什么会慢?

等等。

有个指标被我忽略了——磁盘 IO 利用率

🐾 注意:
Prometheus 中的 node_disk_io_time_secondsrate() 化之后,(具体是: instance_device:node_disk_io_time_seconds:rate5m)
反映的是磁盘完成 IO 请求所花费的时间占比,可以理解为磁盘的 '忙碌程度'。
如果这个值维持在 100%,说明磁盘一直是满负荷运转的,IO 请求排着队,应用能不卡吗。

赶紧查了下这个指标,好家伙,直接 100%

IO Util

这就矛盾了:明明 IOPS 和网络带宽都没打满,为啥磁盘会一直 100% 忙?

🔍 隐藏的凶手:gp3 卷的吞吐量限制

这时候我突然觉得不对劲,仔细看了下网络流量和磁盘的指标。

  • 网络流量:通过 node_network_receive_bytes_total 计算,大约 1Gbps。
  • 磁盘吞吐量:通过 node_disk_bytes_total 计算,也是大约 1Gbps,和网卡流量几乎完全吻合。

等等,gp3 卷的吞吐量上限是多少?

AWS 官网写得明明白白:gp3 卷的吞吐量单独计价,基础的吞吐量是 125 MB/s(约 1 Gbps)。不像 gp2, 如果你的 IOPS 和吞吐量都超出了基线,可以利用积分(burst credits),但一旦积分耗尽,吞吐量就会被硬性限制在 1 Gbps。
gp3 卷的吞吐量上限默认就是 125 MB/s(约 1 Gbps), burst 不了。除非你提前花钱买额外的吞吐量.

🤔 网卡流量 1 Gbps,磁盘吞吐量 1Gbps?这显然已经达到了 gp3 卷的 1Gbps 吞吐量限制。

真相只有一个:日志备份 job 产生了大量的磁盘写入/读取,瞬间吃光了 gp3 卷的吞吐量积分,导致后续所有的 IO 请求都被限速。 应用发起的业务请求虽然 IOPS 不高,但数据量不小,也被堵在了队列里。磁盘 IO 利用率 100%,并非 IOPS 不够,而是吞吐量被卡住了。

这就像是:一个快递站(gp3 卷)的处理速度(吞吐量)是固定的,突然来了一大卡车货(日志备份),把整条传送带占满了。后面来的一箱箱 VIP 快件(业务请求),只能等着,自然就超时了。

🛠️ 如何确认这个猜想?

为了验证,我快速查了以下信息:

  1. 对比网络入流量和磁盘写入量:确认两者高度一致,都达到了 1Gbps。这说明磁盘写入和网络流量是'一路货'。
  2. 确认 gp3 卷的吞吐量配置:检查控制台,确认该卷的吞吐量配置确实是默认的 125MB/s(1Gbps)。

🤔 这次排查教会了我们什么?

👍️ 做得好的地方

  1. 监控覆盖全面:我们部署了 node_exporter,采集了磁盘 IO 利用率、IOPS、网络带宽等几乎全部的关键指标,没有出现盲区。
  2. 常规指标都排查了:第一时间排查了 CPU、内存、IOPS、带宽,这是非常正确的第一反应。
  3. 数据对比能力强:能迅速对比网络流量和磁盘吞吐量,发现两者数值吻合,这是最关键的一步。

👎 需要改进的地方

  1. 对监控指标理解不够深:只关注了 "IOPS" 和 "带宽" 是否打满,而忽视了 IO 利用率 这个关键指标。它才是反映"应用是否在排队等待 IO"的望远镜。
  2. 对 AWS 卷类型特性不熟:虽然最后发现是 gp3 限速,但排查过程中对 gp3/gp2 等不同卷类型的 IOPS/吞吐量/积分机制 缺乏系统了解。当时是 gp3,真真切切被它坑了。
    • 😱 所以,一个"卷性能速查表"是多么重要。
  3. 排查流程不够完整:排查时,应该在"常规指标正常"后就立刻转向磁盘 IO 队列深度instance_device:node_disk_io_time_weighted_seconds:rate5m),这是判断 IO 是否真的 '拥堵' 的核心指标,而不是只看利用率。

IO Saturation

💡 写在最后:一份实用的 EBS 性能排查清单

这次 Case 让我意识到,很多'云原生' '云计算'的坑,都是对底层基础设施的'一知半解'导致的。以后排查类似问题,建议按以下顺序走:

  1. 看现象:应用慢、超时。
  2. 扫硬件:CPU、内存、IOPS、带宽。
    • ⚠️ 如果这些指标都正常,立刻进入第三步。
  3. 看 IO 队列:检查 instance_device:node_disk_io_time_weighted_seconds:rate5m 指标,判断是否有 IO 拥堵。
    • 如果 IO 队列高,但 IOPS 不高,大概率是吞吐量或 IO 模型问题
  4. 对比流量:查看网卡流量和磁盘写入/读取吞吐量,看它们是否匹配。
  5. 验证假设
    • 确认是 EBS 限速?根据EBS类型判断是查 BurstBalance 指标, 还是查 IOPS 和 吞吐量等指标。
    • 确认是应用 IO 模型问题?分析具体是哪个文件的读写导致 IO 高(如 /var/log 的日志)。
  6. 调整配置
    • EBS 限速:升级卷类型(如 gp3 → io2)或调整吞吐量基线。
    • 应用问题:优化日志输出(如异步、批量、减少日志级别),调整 cronjob 的执行周期或错峰, 日志备份限速等。

🤔对云服务的更多思考

经历了这次问题, 我专门查找了相关的资料, 发现云服务的限制不止这些.

云服务虽带来弹性与可扩展性,但网络节流(带宽限制)常被忽视,是导致应用响应慢、卡顿的重要原因。即便CPU、内存等指标正常,网络节流仍会通过丢包、重传大幅增加延迟,引发服务中断、性能不稳定,甚至造成数百万美元收入损失。

核心问题

  • 云服务商(AWS、Azure、GCP等)根据实例大小设定带宽基线,超出后触发自动节流(如AWS的突发积分耗尽后降速)。
  • 节流规则复杂、不透明,传统监控(如仅测RTT)无法有效识别,NTP精度不足,PTP成本高。

常见场景与解决方案

  • 持续高利用率:升级实例、负载分散、智能缓存。
  • 微突发(Microburst):应用级限速、流量整形、高粒度监控。

未来应对策略

  • 实施实时单向延迟监控。
  • 架构设计考虑弹性,容忍带宽限制。
  • 平衡实例大小与网络需求,避免过度配置。
  • 建立性能基线,主动测试。
  • 核心转变:从反应式扩缩容转向主动自动化延迟自愈,将网络节流管理视为业务必需,而非仅IT问题。

📝总结

排查应用故障,不能只看「有多少水(IOPS)」,更要关注「水的流速(吞吐量)」和「水管子堵不堵(IO 利用率)」。

📚️参考文档

  1. Amazon EBS 卷类型 - AWS 官方文档
  2. 监控 Amazon EBS 卷 - CloudWatch 指标
  3. node_exporter 磁盘指标说明
  4. Cloud Apps Slow? Network Throttling Could Be Why