惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
O
OpenAI News
V
V2EX
大猫的无限游戏
大猫的无限游戏
博客园 - 聂微东
S
Schneier on Security
C
CXSECURITY Database RSS Feed - CXSecurity.com
小众软件
小众软件
L
LINUX DO - 热门话题
C
Cybersecurity and Infrastructure Security Agency CISA
博客园 - Franky
Security Latest
Security Latest
S
SegmentFault 最新的问题
Project Zero
Project Zero
Spread Privacy
Spread Privacy
K
Kaspersky official blog
J
Java Code Geeks
V
Vulnerabilities – Threatpost
C
Cisco Blogs
C
CERT Recently Published Vulnerability Notes
月光博客
月光博客
T
The Exploit Database - CXSecurity.com
L
Lohrmann on Cybersecurity
人人都是产品经理
人人都是产品经理
博客园 - 三生石上(FineUI控件)
Scott Helme
Scott Helme
WordPress大学
WordPress大学
量子位
T
Threat Research - Cisco Blogs
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
宝玉的分享
宝玉的分享
Hugging Face - Blog
Hugging Face - Blog
AWS News Blog
AWS News Blog
Help Net Security
Help Net Security
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Simon Willison's Weblog
Simon Willison's Weblog
S
Secure Thoughts
博客园 - 【当耐特】
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
V
Visual Studio Blog
Last Week in AI
Last Week in AI
T
Tailwind CSS Blog
腾讯CDC
Cyberwarzone
Cyberwarzone
IT之家
IT之家
GbyAI
GbyAI
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
云风的 BLOG
云风的 BLOG
T
Troy Hunt's Blog
D
Docker

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
容器化部署多节点 FoundationDB 及运维
微信公众号 · 2026-02-10 · via 陈少文的网站

Please enable Javascript to view the contents

1. 生成集群ID

1
cat /dev/urandom | tr -dc 'a-zA-Z0-9' | fold -w 16 | head -n 1

下面以 CLUSTER_ID=fKbIga9RHP79OIx1 为例

2. 第一个节点上

  • 清理旧数据
1
2
3
$CONTAINER_CLI rm -f $FDB_INSTANCE_NAME
mv $FDB_DIR $FDB_DIR.$(date +%Y%m%d%H%M%S).bak
mkdir -p $FDB_DIR
  • 配置环境变量
1
2
3
4
5
6
7
8
9
export CONTAINER_CLI=nerdctl
export IMAGE=foundationdb/foundationdb:7.1.26

export CLUSTER_ID=fKbIga9RHP79OIx1
export FDB_INSTANCE_NAME=fdb_server
export FDB_CLUSTER_FIRST_IP=$(hostname -I | awk '{print $1}')
export FDB_PORT=4500

export FDB_DIR=/data/ops/fdb/$FDB_INSTANCE_NAME
  • 创建 cluster 文件
1
2
3
mkdir -p $FDB_DIR
echo "${FDB_INSTANCE_NAME}:${CLUSTER_ID}@${FDB_CLUSTER_FIRST_IP}:4500" > $FDB_DIR/fdb.cluster
cat $FDB_DIR/fdb.cluster
  • 启动服务器节点
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
mkdir -p $FDB_DIR/data $FDB_DIR/logs
$CONTAINER_CLI run -d \
  --name $FDB_INSTANCE_NAME \
  --restart always \
  --network host \
  --ulimit memlock=-1 \
  --ulimit stack=67108864 \
  --ulimit nofile=1048576:1048576 \
  --memory-swappiness=0 \
  -h $(hostname) \
  -v $FDB_DIR/fdb.cluster:/var/fdb/fdb.cluster \
  -v $FDB_DIR/data:/var/fdb/data \
  -v $FDB_DIR/logs:/var/fdb/logs \
  --entrypoint "" \
  $IMAGE \
  fdbserver --listen-address 0.0.0.0:$FDB_PORT --public-address $FDB_PUBLIC_IP:$FDB_PORT
  • 初始化集群
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "configure new ssd single"

先初始化集群为 single 模式,否则会因为副本不够会 hang 住。

  • 查看集群状态
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "status"
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
Configuration:
  Redundancy mode        - single
  Storage engine         - ssd-2
  Coordinators           - 1
  Usable Regions         - 1

Cluster:
  FoundationDB processes - 1
  Zones                  - 1
  Machines               - 1

3. 其他节点

需要其他节点全都加入到第一个节点新建的集群中。

  • 清理旧数据
1
2
3
$CONTAINER_CLI rm -f $FDB_INSTANCE_NAME
mv $FDB_DIR $FDB_DIR.$(date +%Y%m%d%H%M%S).bak
mkdir -p $FDB_DIR
  • 配置环境变量
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
export CONTAINER_CLI=nerdctl
export IMAGE=foundationdb/foundationdb:7.1.26

export FDB_DIR=/data/ops/fdb/$FDB_INSTANCE_NAME

export CLUSTER_ID=fKbIga9RHP79OIx1
export FDB_INSTANCE_NAME=fdb_server
export FDB_PUBLIC_IP=$(hostname -I | awk '{print $1}')
export FDB_PORT=4500

export FDB_CLUSTER_FIRST_IP="10.0.0.1"
export FDB_CLUSTER_FIRST_PORT=4500
  • 写入第一个节点的 cluster 文件
1
2
mkdir -p $FDB_DIR
echo "$FDB_INSTANCE_NAME:$CLUSTER_ID@$FDB_CLUSTER_FIRST_IP:$FDB_CLUSTER_FIRST_PORT" > $FDB_DIR/fdb.cluster
  • 启动服务器节点
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
$CONTAINER_CLI run -d \
  --name $FDB_INSTANCE_NAME \
  --restart always \
  --network host \
  --ulimit memlock=-1 \
  --ulimit stack=67108864 \
  --ulimit nofile=1048576:1048576 \
  --memory-swappiness=0 \
  -h $(hostname) \
  -v $FDB_DIR/fdb.cluster:/var/fdb/fdb.cluster:ro \
  -v $FDB_DIR/data:/var/fdb/data \
  -v $FDB_DIR/logs:/var/fdb/logs \
  --entrypoint "" \
  $IMAGE \
  fdbserver --listen-address 0.0.0.0:$FDB_PORT --public-address $FDB_PUBLIC_IP:$FDB_PORT
  • 查看集群状态
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "status"

全部节点添加完成应该可以看到

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
Configuration:
  Redundancy mode        - single
  Storage engine         - ssd-2
  Coordinators           - 1
  Usable Regions         - 1

Cluster:
  FoundationDB processes - 5
  Zones                  - 5
  Machines               - 5

此时应该有 5 个服务器节点。

4. 调整副本数量为 triple

single 模式下数据为单副本,不是生产环境推荐配置,需要调整为 triple 模式以提高数据可靠性。

  • 调整数据冗余模式
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "configure ssd triple"
  • 查看集群状态
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "status"
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
Configuration:
  Redundancy mode        - triple
  Storage engine         - ssd-2
  Coordinators           - 1
  Usable Regions         - 1

Cluster:
  FoundationDB processes - 5
  Zones                  - 5
  Machines               - 5

此时 Coordinators 的数量还是为 1,不是生产可用状态。

5. 更新全部节点的 cluster 文件

将全部节点都添加到 cluster 文件中。

  • 更新 cluster 文件
1
echo "$FDB_INSTANCE_NAME:$CLUSTER_ID@10.0.0.1:4500,10.0.0.2:4500,10.0.0.3:4500,10.0.0.4:4500,10.0.0.5:4500" > $FDB_DIR/fdb.cluster
  • 重启 fdb 服务
1
$CONTAINER_CLI restart $FDB_INSTANCE_NAME

6. 查看集群状态

1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "status"
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
Configuration:
  Redundancy mode        - triple
  Storage engine         - ssd-2
  Coordinators           - 5
  Usable Regions         - 1

Cluster:
  FoundationDB processes - 5
  Zones                  - 5
  Machines               - 5
  Fault Tolerance        - 2 machines

此时的 Coordinators 的数量应该为 5,集群可以容忍 2 台机器故障。

7. 启动备份 agent

  • 创建备份目录
1
mkdir -p $FDB_DIR/backup
  • 启动备份 agent
1
2
3
4
5
6
7
8
9
$CONTAINER_CLI run -d \
  --name fdb_backup_agent \
  --restart always \
  --network host \
  -v $FDB_DIR/fdb.cluster:/var/fdb/fdb.cluster:ro \
  -v $FDB_DIR/backup:/var/fdb/backup \
  --entrypoint "" \
  $IMAGE \
  backup_agent --cluster_file /var/fdb/fdb.cluster

8. 备份数据

  • 创建备份容器
1
2
3
4
5
$CONTAINER_CLI run -it --rm \
  -v $FDB_DIR/fdb.cluster:/var/fdb/fdb.cluster:ro \
  -v $FDB_DIR/backup:/var/fdb/backup \
  --entrypoint "" \
  $IMAGE bash
  • 开始备份数据
1
fdbbackup start -d file:///var/fdb/backup
  • 查看备份状态
  • 查看备份文件

9. 恢复数据

  • 进入恢复容器
1
2
3
4
5
$CONTAINER_CLI run -it --rm \
  -v $FDB_DIR/fdb.cluster:/var/fdb/fdb.cluster:ro \
  -v $FDB_DIR/backup:/var/fdb/backup \
  --entrypoint "" \
  $IMAGE bash
  • 清空旧数据
1
fdbcli --exec "writemode on; clearrange '' \xFF"
  • 恢复数据
1
2
3
fdbrestore start \
    -r file:///var/fdb/backup/backup-2026-02-10-06-09-38.111134 \
    --dest-cluster-file /var/fdb/fdb.cluster

每个backup目录就是一份数据。

  • 查看恢复状态
1
fdbrestore status --dest-cluster-file /var/fdb/fdb.cluster

确认恢复状态为 State: completed 即恢复完成。

  • 查看数据
1
fdbcli --exec "getrange '' \xFF"

10. 监控集群状态

1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "status"
1
$CONTAINER_CLI exec -it $FDB_INSTANCE_NAME fdbcli --exec "describe"

11. 集群监控

  • 设置环境变量
1
2
3
4
5
export CONTAINER_CLI=nerdctl
export IMAGE=aikoven/foundationdb-exporter

export FDB_INSTANCE_NAME=fdb_server
export FDB_DIR=/data/ops/fdb/$FDB_INSTANCE_NAME
  • 启动监控容器
1
2
3
4
5
6
7
$CONTAINER_CLI run -d \
  --name fdb-exporter \
  --restart always \
  -v $FDB_DIR/fdb.cluster:/etc/foundationdb/fdb.cluster:ro \
  -p 9444:9444 \
  $IMAGE \
  exporter
  • 查看监控指标
1
curl http://localhost:9444/metrics

指标含义参考 https://github.com/aikoven/foundationdb-exporter

  • 配置 Grafana

配置采集之后,导入面板 https://github.com/aikoven/foundationdb-exporter/blob/master/grafana/foundationdb.json 稍微调整下即可看到如下面板:


微信公众号