惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Palo Alto Networks Blog
N
Netflix TechBlog - Medium
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
小众软件
小众软件
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
B
Blog
MyScale Blog
MyScale Blog
Microsoft Security Blog
Microsoft Security Blog
aimingoo的专栏
aimingoo的专栏
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Hugging Face - Blog
Hugging Face - Blog
S
Schneier on Security
Project Zero
Project Zero
T
Tenable Blog
T
Tor Project blog
U
Unit 42
G
GRAHAM CLULEY
N
News and Events Feed by Topic
P
Proofpoint News Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Y
Y Combinator Blog
C
Cybersecurity and Infrastructure Security Agency CISA
腾讯CDC
博客园 - 叶小钗
M
MIT News - Artificial intelligence
Vercel News
Vercel News
T
Threat Research - Cisco Blogs
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
The Exploit Database - CXSecurity.com
P
Privacy & Cybersecurity Law Blog
I
Intezer
博客园 - 聂微东
SecWiki News
SecWiki News
Scott Helme
Scott Helme
C
Cyber Attacks, Cyber Crime and Cyber Security
IT之家
IT之家
量子位
S
Secure Thoughts
The Cloudflare Blog
博客园 - 司徒正美
Know Your Adversary
Know Your Adversary
Hacker News: Ask HN
Hacker News: Ask HN
V
Vulnerabilities – Threatpost
Simon Willison's Weblog
Simon Willison's Weblog
N
News | PayPal Newsroom
C
Check Point Blog
Spread Privacy
Spread Privacy
C
CXSECURITY Database RSS Feed - CXSecurity.com
Cyberwarzone
Cyberwarzone

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
Thanos 进阶使用指南
微信公众号 · 2022-03-29 · via 陈少文的网站

1. 使用 Query 聚合数据

如上图,Thanos Query 可以对接的组件有:

  • Thanos Store Gateway
  • Thanos Query
  • Thanos Receive
  • Prometheus,借助于 Sidecar

利用 Thanos Query 之间的级联,我们可以实现跨组件的关联查询,组建超大型的监控系统。这也意味着,每个对接的组件应该提供足够快的 Prometheus API。整个接口的响应时间依赖于最慢组件的响应时间。

当然你也可以在不同层级,提供不同级别的查询数据源。如下图:

在全局、区域、实例级别都可以提供查询接口。

2. 指标数据的拆分及生命周期管理

Thanos 采用的是存储空间换计算时间和内存的方式,加速长周期指标的查询。Thanos Compact 组件会将小的存储块,合并为大的存储块。如下图,Compact 组件还提供了对存储块的管理能力:

在右下角,我们可以标记删除一个存储块,也可以选择不对其进行降采样。

当打开降采样开关时,Compact 会对所有原始指标数据存储时长大于 40 h 的进行 5 min 采样,对所有 5 min 指标数据存储时长大于 10 day 的进行 1 h 采样。至于,原始数据、5 min 采样指标数据、1 h 采样指标数据保存多长时间,可以通过以下参数配置:

  • --retention.resolution-raw=90d,原始数据保存最近 90 天
  • --retention.resolution-5m=180d,5 分钟采样数据保存 180 天
  • --retention.resolution-1h=360d,1 小时采样数据保存 360 天,0d 代表永久存储

这意味着,我们只能看到全年 1 h 采样的序列,而局部看不半年前,1 h 之内的任意细节数据;只能看到半年 5 min 采样序列,而局部看不到三个月前,5 min 内的任何细节数据。

为了避免冲突,一个 Bucket 也只允许运行一个 Compact。而 Compact 的参数,直接决定了一个存储 Bucket 的生命周期。

当业务规模庞大时,不可能只用一个 Bucket 存储全部监控数据,即使对象存储的性能已经非常好。我们依然需要对数据存储进行拆分,如下图:

每一个 Store Gateway 都需要配置一个 Bucket 桶,而一个 Bucket 只允许一个 Compact。可以根据以下维度进行划分 Bucket:

  • 结算方式
  • 所在区域
  • 所属业务
  • 基础设施层级
  • 单指标的横向拆分

3. 将 Prometheus 的存储周期设置为 6 h

刚使用 Thanos 时,会碰到两个迷惑的地方:

  • 怎么没有最近 2 h 的数据

因为没有配置 Prometheus 的查询源。

  • 怎么查询速度没有提升

因为 Prometheus 查询源的存储周期太长了。

答案在下面这张图里:

  • Sidecar 模式下,每隔 2 h 上传一次数据,因此如果只配置 Store Gateway 的地址,那么 Query 组件将只能查询到超过 2 h 的数据。
  • 当 Prometheus 设置的存储时间太长,就会导致 Query 查询长周期数据时,不能有效利用 Store Gaway 查询降采样数据,而需要等待 Prometheus 也返回结果,不能提升查询性能。
  • 只有将 Prometheus 源以 Sidecar 的 Grpc 的形式接入到 Query 组件并将其设置为短周期时,才能感受到 Thanos 带来的查询性能提升。

通常,将 Prometheus 的 --storage.tsdb.retention.time 参数设置为 3 倍的 Sidecar 上传存储块的周期,也就是 3 * 2 h = 6 h 即可。

4. 调优 Store Gateway 加速查询

Thanos Store 组件基于对象存储中的指标数据,对外提供给 Thanos Query 查询接口。Store 组件提供了一些可以优化查询的参数。

4.1 设置缓存

--index-cache-size=250MB 默认会使用内存缓存,加速查询。其他可选的缓存包括,memcached、redis。

4.2 设置查询范围

--min-time--max-time 参数可以指定当前 Store 能查询的数据范围。

可以直接根据 RFC3339 规范指定 -min-time=2018-01-01T00:00:00Z,--max-time=2019-01-01T23:59:59Z,也可以指定一个相对时间 --min-time=-6w,--max-time=-2w 只允许查询 2 个星期前但是不超过 6 个 星期的数据。

这种方式不仅可以控制查询范围,还可以加快接口数据的返回,屏蔽不必要的查询结果。

另外一个优化的方向是使用 Query Frontend 组件,同样是借助缓存加速查询响应。

5 重新设计标签系统

使用 Thanos Query 合并多个 Prometheus 数据源之后,遇到的首要问题就是,怎么区分不同数据源的数据。如果没有提前规划好 external_labels 将会导致各种环境、区域下的指标数据混淆在一起,根本无法使用。

如下图,在每一个 Prometheus 实例中都需要设置一些必要的 Labels 信息,以区分不同的 Prometheus 实例数据。

另一方面,在查询和使用监控指标数据时,也需要带上这些标签。这部分的工作量会体现在修改 Grafana 的展示面板和查询 API 的参数调整上。

6. 总结

本篇主要是在生产环境下使用 Thanos 的一些思考和总结。刚开始使用 Thanos 时的目标是,能够部署起来;部署到线上之后的目标是,能够用起来;最后的目标是能够预见一些未来的问题,提前解决掉。

7 参考