惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 司徒正美
M
MIT News - Artificial intelligence
博客园_首页
IT之家
IT之家
L
LangChain Blog
D
DataBreaches.Net
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Google DeepMind News
Google DeepMind News
Blog — PlanetScale
Blog — PlanetScale
人人都是产品经理
人人都是产品经理
博客园 - Franky
云风的 BLOG
云风的 BLOG
罗磊的独立博客
量子位
G
Google Developers Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 【当耐特】
博客园 - 叶小钗
S
SegmentFault 最新的问题
Stack Overflow Blog
Stack Overflow Blog
B
Blog
T
Tailwind CSS Blog
A
About on SuperTechFans
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

暗无天日

读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 browser-harness:让 AI 直接接管你的浏览器 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 读 — Prompt Caching 省钱指南 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日
TIL-可观测性工具的成本盲区 - 暗无天日
2026-05-19 · via 暗无天日

跟上一篇 《把成本当作 SLI》 同一个作者。David Iyanu Jonathan 在 DZone 上发了《The Cost of Knowing: When Observability Becomes the Outage》,这次说的问题是:你花钱买监控工具盯系统,但没人盯监控工具自己花了多少钱。

监控工具不会告诉你它自己花了多少钱

日志收集器产生的日志,不会出现在日志收集器的仪表盘上。指标系统的运行开销,不会自动变成指标系统里的一条指标。你不可能"不小心就发现"监控工具花了基础设施预算的 12%,得有人主动去查,得有人先在意这件事。

这就是可观测性成本总被忽视的根因:数据有,但不在你平时看的地方。

出错的全记,正常的可以丢

采样是砍监控成本最狠的一刀,但团队不敢用,怕漏掉重要数据。有个聪明的做法叫 tail-based sampling:等请求跑完了再看结果,再决定记不记。报错的、响应慢的,全量记下来。那些正常的 200-OK、12 毫秒就返回的请求,直接丢掉。Jaeger、Zipkin、AWS X-Ray 都内置了这个能力。

你真正会去查的数据一条没少,账单能砍掉 90% 以上。

监控花费该有个上限

SRE 圈子里天天聊可用性、延迟、错误率的 SLO,但几乎没人给监控花费定一个占基础设施的比例上限。原文给的参考:创业公司可以到 20%,成熟组织应该控制在 10% 以内。超过 30%,说明你看系统的钱比跑系统的钱还多。

做法不复杂:把云厂商账单 API 的数据接进 Prometheus,算 监控花费 / 基础设施总花费 ,做一个让财务和运维一起看的仪表盘。