惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

人人都是产品经理
人人都是产品经理
Google DeepMind News
Google DeepMind News
博客园 - 【当耐特】
量子位
博客园 - 司徒正美
爱范儿
爱范儿
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
Jina AI
Jina AI
J
Java Code Geeks
腾讯CDC
大猫的无限游戏
大猫的无限游戏
V
Visual Studio Blog
I
InfoQ
D
Docker
Recent Announcements
Recent Announcements
MongoDB | Blog
MongoDB | Blog
博客园 - Franky
宝玉的分享
宝玉的分享
G
Google Developers Blog
GbyAI
GbyAI
Y
Y Combinator Blog
有赞技术团队
有赞技术团队
H
Help Net Security

土法炼钢兴趣小组的算法知识备份

国密算法与国密 TLS 系列索引 【系统架构设计】架构质量属性:不只是"高可用高性能" 【系统架构设计百科】告警策略:如何避免"狼来了" 【系统架构设计】CQRS:读写分离的架构哲学 【系统架构设计】空间架构:极端扩展场景的解法 【系统架构设计】微服务架构深度审视:优势、代价与适用边界 【系统架构设计】扩展性原理:水平、垂直与对角扩展 【系统架构设计】无状态设计:扩展的第一步也是最难的一步 【系统架构设计】缓存架构:从本地到分布式的多级缓存体系 【系统架构设计】管道与过滤器:Unix 哲学的架构表达 【系统架构设计】复杂性管理:架构的核心战场 【系统架构设计】消息队列架构:异步解耦的设计与陷阱 【系统架构设计】CDN 架构:全球加速的设计原理 【系统架构设计】连接池设计:被忽视的性能杀手 【系统架构设计】弹性设计模式:熔断器、舱壁与超时 【系统架构设计】高可用设计模式:冗余、故障转移与仲裁 【系统架构设计】容量规划:从拍脑袋到数据驱动 【系统架构设计】数据库扩展:分库分表的工程实践与替代方案 【系统架构设计】SLO 工程:可靠性的量化管理 【系统架构设计】性能建模:用数学思维分析系统瓶颈 【系统架构设计】混沌工程:主动验证系统的韧性 【系统架构设计】零拷贝与内存映射:数据搬运的极致优化 【系统架构设计】线程模型:从 thread-per-request 到协程 【系统架构设计】容灾架构:多活与灾备设计 【系统架构设计】数据库性能模式:索引、查询与连接管理 【系统架构设计】数据建模:从关系范式到文档模型的真实权衡 【系统架构设计】吞吐量优化:批处理、流水线与并发模型 【系统架构设计】流处理架构:从批处理到实时的范式迁移 【系统架构设计】搜索引擎架构:倒排索引之上的系统设计 【系统架构设计】时序数据架构:监控与 IoT 的存储设计
可观测性工程
2026-04-22 · via 土法炼钢兴趣小组的算法知识备份

十年前问”系统挂没挂”,看一张 Zabbix 的 CPU 图就够;今天问”为什么 p99 突增”,要同时看 Metrics、Logs、Traces、Profiles 加上服务拓扑、变更事件、K8s 调度,才能落到一行具体代码上。现代可观测性已经是一套工程体系:数据模型、传输协议、存储结构、查询语言、采样策略、成本控制、SLO 治理、故障响应,每一环都可以单独写一本书。

这个系列面向 SRE、平台工程师、架构师与稳定性负责人,把可观测性当成工程问题来拆:协议怎么选、eBPF 能做到哪一步、OpenTelemetry 的语义约定为什么重要、SLO 与告警怎么闭环、国内厂商的方案有哪些坑、事故发生时怎么从”指标抖动”走到”代码行号”。

本系列为工程参考,不构成任何具体产品或厂商背书。

适合谁看

  • SRE / 稳定性工程师:正在搭建或优化可观测栈,负责 SLO、告警、事故响应。
  • 平台工程师:为全公司提供统一观测平台、基础库、埋点规范。
  • 后端与架构师:需要理解埋点成本、采样、数据模型如何影响系统性能与账单。
  • 稳定性负责人:面对云厂商方案(阿里 ARMS、腾讯 APM、华为 AOM、观测云等)的选型与自建决策。

推荐阅读路径

  • 想系统入门 → 01 → 02 → 03 → 04 → 05
  • 做三大支柱选型 → 06 → 08 → 10 → 11
  • 做性能与内核观测 → 12 → 14 → 15 → 16 → 17
  • 做 SLO 与事故治理 → 18 → 19 → 22 → 24
  • 国内方案对比 / 自建 vs 托管 → 23 → 25

目录

第一部分:可观测性基础

  1. 可观测性全景:Metrics、Logs、Traces、Profiles、Events 五大支柱
  2. 可观测性 vs 监控:从 Zabbix/Nagios 到 OpenTelemetry 的二十年
  3. 指标体系设计:USE、RED、Golden Signals 与业务 KPI
  4. 埋点哲学:粒度、采样、基数爆炸与成本模型
  5. 数据模型:时间序列、日志、Span、Profile 的内部表达

第二部分:三大支柱深入

  1. Metrics:Prometheus、VictoriaMetrics、Thanos、Mimir、M3
  2. 时序数据库内核:TSM、TSI、倒排索引与 Gorilla 压缩
  3. Logs:Loki、ClickHouse、Elasticsearch、OpenObserve 的取舍
  4. 日志管道:Fluent Bit、Vector、Logstash、Filebeat
  5. Traces:Jaeger、Tempo、Zipkin、SkyWalking 与采样传播
  6. OpenTelemetry 深入:SDK、Collector、语义约定与版本演进
  7. 持续性能分析(Profiling):pprof、Pyroscope、Parca、async-profiler、JFR
  8. Events 与变更关联:CloudEvents、发布打点、K8s 事件

第三部分:eBPF 与内核可观测性

  1. eBPF 可观测性全景:bcc、bpftrace、libbpf 的工程路径
  2. 网络可观测性:Cilium Hubble、Pixie、DeepFlow、Tetragon
  3. Continuous Profiling:Parca、Pyroscope、Grafana Beyla
  4. 内核追踪:ftrace、kprobe、uprobe、tracepoint 生产实战

第四部分:治理与工程落地

  1. SLO 工程:错误预算、Burn Rate、多窗口多燃烧率告警
  2. 告警体系:Alertmanager、PagerDuty、OnCall 与分级抑制
  3. 可观测性存储与成本:采样、下采样、冷热分层、对象存储
  4. 多租户与安全:数据隔离、标签治理、PII 清洗
  5. 故障演练与混沌工程:ChaosBlade、Chaos Mesh、LitmusChaos

第五部分:真实案例与中国落地

  1. 中国可观测性厂商对比:阿里 ARMS、腾讯 APM、华为 AOM、观测云、夜莺、DeepFlow
  2. 真实事故复盘:从指标抖动到根因的全链路追查剧本
  3. 自建 vs 托管:OpenTelemetry 自建栈与 SaaS 的选型决策

延伸阅读

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-04-22 · architecture / observability

【可观测性工程】指标体系设计:USE、RED、Golden Signals 与业务 KPI

USE 方法论适用于资源,RED 方法论适用于请求,Golden Signals 适用于服务——三套方法论各有其适用对象。本文从 Brendan Gregg、Tom Wilkie、Google SRE 的原始定义出发,构建覆盖资源→服务→业务的完整指标体系,并给出 Prometheus 命名规范、基数治理策略与可抄的指标清单。