惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
博客园 - 三生石上(FineUI控件)
V
V2EX
博客园 - 司徒正美
小众软件
小众软件
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
Last Week in AI
Last Week in AI
雷峰网
雷峰网
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Apple Machine Learning Research
Apple Machine Learning Research
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
S
SegmentFault 最新的问题
美团技术团队
Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
爱范儿
爱范儿
博客园 - 聂微东
量子位
J
Java Code Geeks
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Vercel News
Vercel News

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
如何修复重装系统后的 Kubernetes Master 节点
微信公众号 · 2023-01-17 · via 陈少文的网站

Please enable Javascript to view the contents

最近碰到两次,因故障需要重装主机系统。其中一次 Etcd 只剩下一个节点,导致整个集群宕机半个小时才恢复。本篇主要记录的是新系统 Ubuntu 20.04 初始化的过程,完成初始化之后采用优秀的集群安装工具 Kubekey 的 add nodes 命令,无需修改配置文件,一键就将节点重新加入了集群。

1. 恢复 Etcd

三个节点的 Etcd 集群,只有一个节点运行是无法工作的。因此,务必首先修复 Etcd 集群。这里比较幸运的是,系统重装之后 Ip 没有发生变化,否则需要重新生成证书,具体操作见另外一篇博文,《如何修复变更 IP 之后的 Kubernetes 集群》

  • 在重装节点上,拷贝其他节点的 Etcd 二进制文件、配置文件、启动文件
1
2
3
4
scp etcd-node1:/usr/local/bin/etcd /usr/local/bin/
scp etcd-node1:/etc/etcd.env /etc/
scp etcd-node1:/etc/systemd/system/etcd.service /etc/systemd/system/
scp -r etcd-node1:/etc/ssl/etcd /etc/ssl/

通常,一个 Etcd 集群的所有节点启动方式一样,只需要完全拷贝另外一个节点的即可。

  • 在重装节点上,编辑配置文件,替换主机信息

这里需要替换的主要是 IP、NodeName 信息,将这些信息替换为当前节点的即可。因为这些会涉及到证书、Etcd WAL 数据中的节点信息数据的有效性。保持与之前一样,有助于快速恢复 Etcd 集群。

  • 启动 Etcd
  • 设置开机启动 Etcd

三个节点的 Etcd 有两个能运行,集群就能正常工作。剩下的就是初始化节点,并将节点重新添加到集群。这里有些特殊的是集群主要用于持续集成,需要挂载一块额外的存储盘,安装指定的 Docker 版本。

2. 初始化数据盘并格式化

  • 安装 SSD 盘驱动

由于采用的是宝存企业级 SSD,还需要安装驱动。根据提供的文档,安装驱动有两种安装方式,一种是 deb 安装,另一种是编译安装。但是提供的 deb 版本没有匹配上 Ubuntu 20.04,而编译安装有奇怪报错无法解决。

可行的安装方式是,先编译生成 deb 驱动包,再安装 deb 驱动包。宝存的 SSD 下面会给出一个测速以供参考。

  • 查看磁盘

安装完成 SSD 驱动之后,操作系统就能识别到磁盘了。

1
2
3
4
5
6
7
lsblk

NAME   MAJ:MIN RM   SIZE RO TYPE MOUNTPOINT
sda      8:0    0 558.4G  0 disk
├─sda1   8:1    0     1M  0 part
└─sda2   8:2    0 558.4G  0 part /
dfa    252:0    0   2.9T  0 disk

其中的 /dev/dfa 就是额外的 SSD 数据盘。

  • 使用 parted 创建 GPT 分区表

由于硬盘超过了 2TB,fdisk 无法处理,需要使用 parted

  • 格式化分区为 btrfs
  • 挂载分区到 /data 目录
1
2
mkdir /data
mount /dev/dfa /data
  • 修改 /etc/fstab 开启自动挂载磁盘

新增如下内容:

1
/dev/dfa  /data btrfs defaults  0  0

修改完成之后,一定要测试以下步骤,否则可能无法开机。

  1. 卸载 /data 挂载的设备
  1. 自动挂载设备
  1. 查看是否成功自动挂载
  • 使用 fio 测试随机读写速度
1
2
3
4
4K 随机写: (groupid=0, jobs=1)
  write: IOPS=78.2k, BW=306MiB/s (320MB/s)(3072MiB/10051msec)
4K 随机读: (groupid=0, jobs=1)
  read: IOPS=120k, BW=468MiB/s (490MB/s)(3072MiB/6571msec)

3. 设置软链接指向数据盘

  • Docker
1
2
3
mkdir /data/docker
ln -s /data/docker /var/lib/docker
ls -al /var/lib/docker
  • Kubelet
1
2
3
mkdir /data/kubelet
ln -s /data/kubelet /var/lib/kubelet
ls -al /var/lib/kubelet
  • Openebs
1
2
3
mkdir /data/openebs
ln -s /data/openebs /var/openebs
ls -al /var/openebs

4. 安装指定版本 Docker

  • 卸载 Docker
1
apt-get autoremove docker docker-ce docker-engine  docker.io  containerd runc
  • 添加 Docker 源
1
2
curl -fsSL https://mirrors.aliyun.com/docker-ce/linux/ubuntu/gpg | sudo apt-key add -
add-apt-repository "deb [arch=amd64] https://mirrors.aliyun.com/docker-ce/linux/ubuntu $(lsb_release -cs) stable"
  • 更新系统源
  • 查看 Docker 版本
1
2
3
4
apt-cache madison docker-ce

 docker-ce | 5:20.10.22~3-0~ubuntu-focal | https://mirrors.aliyun.com/docker-ce/linux/ubuntu focal/stable amd64 Packages
 docker-ce | 5:20.10.12~3-0~ubuntu-focal | https://mirrors.aliyun.com/docker-ce/linux/ubuntu focal/stable amd64 Packages
  • 安装指定版本
1
apt-get install docker-ce=5:20.10.12~3-0~ubuntu-focal

至此,新系统初始化完成,剩下的交给 Kubekey,由于 IP 未变,可以直接使用安装时的配置文件一键添加 Master 节点到集群。

1
sudo ./kk add nodes -f config.yaml

微信公众号