惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
V
Visual Studio Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
量子位
月光博客
月光博客
阮一峰的网络日志
阮一峰的网络日志
T
Tailwind CSS Blog
GbyAI
GbyAI
爱范儿
爱范儿
Y
Y Combinator Blog
宝玉的分享
宝玉的分享
有赞技术团队
有赞技术团队
罗磊的独立博客
Recent Announcements
Recent Announcements
博客园 - 司徒正美
M
MIT News - Artificial intelligence
小众软件
小众软件
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
B
Blog RSS Feed
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog
Apple Machine Learning Research
Apple Machine Learning Research
雷峰网
雷峰网

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
Ops 新增 Server 及 UI 服务
微信公众号 · 2024-02-14 · via 陈少文的网站

Please enable Javascript to view the contents

1. 什么是 Ops 项目

我在之前的文章中介绍过一个常用的 Ops 工具。

Ops 的设计理念在于,运维工具的核心在于文本分发和脚本执行,实现了这两种能力就能够满足运维的功能诉求。

目前我主要的运维对象是 Host 主机、Kubernetes 集群,因此在 OpsObject 层实现了 Host 和 Cluster 对象,分别对应主机和 Kubernetes 集群。

在此之上,分别实现了面向主机的文件分发、脚本执行,以及面向 Kubernetes 集群的文件分发、脚本执行,也就是 Core 核心能力层。

得益于 Core 层的能力,我已经可以实现一些简单的运维功能,比如:批量添加 hosts,批量安装、变更 Prometheus 等。

2. Ops Server 和 UI 功能

在上面的架构中,我提供了三个入口,:opscli、opsserver、opscontroller。

由于之前工作需求已经完成了 opscli、opscontroller 两个组件,近期补齐了 opsserver 项目的部分功能和一个简单的 UI 界面。通过 helm charts 的方式,已经可以直接安装,详情参考 https://www.chenshaowen.com/ops/

下面是一些功能截图:

  • 查看托管的主机列表

Ops 会自动从主机上定时同步信息,比如: 主机名、CPU、内存、磁盘、系统信息等。

  • 查看托管的集群

Ops 会自动从集群上定时同步信息,比如: 版本、节点数量、Pod 的状态、证书过期时间等。

  • 查看 Task 对象

Task 是我定位的复用级对象,能够沉淀并共享运维能力,实现标准化操作。

通过 Task 指定具体的主机或者集群,设置变量值,创建 TaskRun 对象就能够实现运维任务的执行。另外,Task 也支持定时执行。

  • 查看 TaskRun 对象

TaskRun 对象包含了任务的基本信息,包括: 任务名称、具体操作、执行结果等。

3. 下一步

目前 Server 端的迭代主要依赖于 Copilot 项目的诉求。

LLM 擅长分析并回答问题,得到一个解决方案或者一系列的 Command,但 LLM 并不能直接执行这些 Command。如上图,Ops Server 接下来的迭代的目标就是对接好 LLM ,让 LLM 能够读懂 Ops Server 的设计意图,在输出 Command 之后,能够直接转换为具有真实影响的 Action,让 LLM 具备真正的运维能力。

这种设计的意义在于:

  • 不必在本地执行命令、配置凭证
  • 支持批量的主机、集群操作
  • 远程执行环境约束力更强,更加安全可审计
  • 远端能够配置实现一些更加灵活、复杂的操作

简单点理解就是 Ops Server 会提供一种远端的运维能力,通过 API 对接到 LLM 应用中实现运维的自动化。


微信公众号