global 集群灾难恢复
本页介绍运行在 传统操作系统 上的 global 集群灾难恢复。Immutable Infrastructure 上的 global 集群灾难恢复正在开发中;请参见 Immutable Infrastructure 上的 global 集群灾难恢复。
概述
本方案面向涉及 global 集群的灾难恢复场景。global 集群作为平台的控制平面,负责管理其他集群。为确保在 global 集群故障时平台服务持续可用,本方案部署两个 global 集群:主集群和备用集群。
该灾难恢复机制基于将主集群的 etcd 数据实时同步到备用集群。如果主集群因故障不可用,服务可以快速切换到备用集群。
支持的灾难场景
- 主集群发生无法恢复的系统级故障,导致其无法运行;
- 承载主集群的物理机或虚拟机发生故障,导致其无法访问;
- 主集群所在位置发生网络故障,造成服务中断;
不支持的灾难场景
global集群内已部署应用的故障;- 存储系统故障导致的数据丢失(超出 etcd 同步范围);
主集群 和 备用集群 的角色是相对的:当前为平台提供服务的集群是主集群(DNS 指向它),而待命集群是备用集群。发生故障切换后,这两个角色会互换。
注意事项
-
本方案仅同步
global集群的 etcd 数据;不包含 registry、chartmuseum 或其他组件的数据; -
为便于故障排查和管理,建议按
standby-global-m1这类风格命名节点,以表明该节点属于哪个集群(主集群或备用集群)。 -
不支持集群内应用数据的灾难恢复;
-
两个集群之间需要保持稳定的网络连通性,以确保 etcd 同步可靠;
-
如果集群基于异构架构(例如 x86 和 ARM),请使用双架构安装包;
-
以下 namespace 不参与 etcd 同步。如果在这些 namespace 中创建了资源,用户需要手动备份:
-
如果两个集群都设置为使用内置镜像仓库,则容器镜像必须分别上传到每个集群;
-
如果主集群部署了 DevOps Eventing v3(knative-operator)及其实例,则备用集群中必须预先部署相同的组件。
流程概述
- 准备一个统一的域名用于平台访问;
- 将域名指向 主集群 的 VIP,并安装 主集群;
- 临时将 DNS 解析切换到备用 VIP,以安装备用集群;
- 将 主集群 的 ETCD 加密密钥复制到之后将作为备用集群控制平面节点的节点上;
- 安装并启用 etcd Synchronizer;
- 验证同步状态并进行例行检查;
- 在发生故障时,将 DNS 切换到备用集群以完成灾难恢复。
所需资源
- 一个统一域名,作为
Platform Access Address,以及用于该域名 HTTPS 服务的 TLS 证书和私钥; - 每个集群各自一个专用虚拟 IP 地址:一个用于 主集群,另一个用于备用集群;
网络要求
统一域名是灾难恢复的前提。在正常运行期间,该域名仅解析到 主集群 的 VIP。备用集群使用该域名访问主集群上的平台服务。
在安装任一集群之前,请完成以下两项网络准备:
- 配置每个集群的负载均衡器,将其 VIP 上所需的 TCP 端口转发到该 VIP 后面的控制平面节点。仅当用户通过 HTTP 访问平台时,才配置端口
80。 - 在主集群和备用集群网络之间双向放行所需的 TCP 端口。请将规则应用于防火墙、安全组、路由器 ACL 以及其他任何站点间网络控制。
网络策略必须是双向的,因为在故障切换后,集群角色会反转。在故障切换之前,实际生效的服务流量通常是从备用集群流向主集群。故障切换后,原主集群会变成新的备用集群,并且必须通过相同端口访问新的主集群。此要求并不表示 etcd 复制是双向的: etcd Synchronizer 只运行在当前备用集群上,并将同步数据写入其本地 etcd。
操作步骤
步骤 1:安装主集群
安装 DR 环境的主集群时,
- 首先,记录在安装 Web UI 指导过程中设置的所有参数。在安装备用集群时,部分选项必须保持一致。
- 必须预先配置 User-Provisioned Load Balancer,以路由发送到虚拟 IP 的流量。
Self-built VIP选项不可用。 Platform Access Address字段必须是域名,而Cluster Endpoint必须是虚拟 IP 地址。- 两个集群都必须配置为使用
An Existing Certificate(必须是同一张证书),如有必要请申请合法证书。Self-signed Certificate选项不可用。 - 当
Image Repository设置为Platform Deployment时,Username和Password字段都不能为空;IP/Domain字段必须设置为用作Platform Access Address的域名。 Platform Access Address的HTTP Port和HTTPS Port字段必须分别为 80 和 443。- 在安装指南第二页(Step:
Advanced)中,Other Platform Access Addresses字段必须包含当前集群的虚拟 IP。
请参考以下文档完成安装:
步骤 2:安装备用集群
-
临时将域名指向备用集群的 VIP;
-
登录 主集群 的第一个控制平面节点,并将 etcd 加密配置复制到所有备用集群控制平面节点:
-
按与主集群相同的方式安装备用集群
安装 DR 环境的备用集群时, 以下选项必须与 主集群 保持一致:
Platform Access Address字段。Certificate的所有字段。Image Repository的所有字段。- 重要:请确保镜像仓库和 管理员用户的凭据与 主集群 上设置的一致。
并且务必已遵循步骤 1 中的 DR(灾难恢复环境)安装注意事项。
请参考以下文档完成安装:
步骤 3:启用 etcd 同步
-
如有需要,请配置负载均衡器,将端口
2379转发到对应集群的控制平面节点。仅支持 TCP 模式;不支持 L7 转发。INFO不一定需要通过负载均衡器进行端口转发。 如果备用集群可以直接访问活动 global 集群,请通过 Active Global Cluster ETCD Endpoints 指定 etcd 地址。
-
使用 VIP 访问 备用 global 集群 Web Console,并切换到 Administrator 视图。
-
导航到 Marketplace > Cluster Plugins,选择
global集群。 -
找到 etcd Synchronizer,点击 Install,并配置以下参数:
前提条件(仅适用于 4.3.1+): 在备用 global 集群上创建
etcd-sync-active-cluster-tokenSecret。首先,从活动 global 集群中获取用于访问活动 global 集群 API server 的 bearer token。然后复制命令输出,并在创建该 Secret 时使用它。该 Secret 将 token 存储在 data 键token下。复制输出值,然后在备用集群上运行此命令:
- 将 Active Global Cluster VIP 设置为活动 global 集群的 VIP。
- 当未通过负载均衡器转发端口
2379时,请正确配置 Active Global Cluster ETCD Endpoints。 - 将 Standby Cluster ETCD Endpoints 设置为备用集群的 etcd 地址。除非本地 etcd 服务通过其他端点暴露,否则请使用默认值。
- 将 Active Global Cluster Token Secret 设置为
etcd-sync-active-cluster-token。 - 使用 Data Check Interval 的默认值。
- 除非用于排障,否则保持 Print detail logs 关闭。
安装期间,系统会在
etcd-syncDeployment 启动之前先运行etcd-sync-bootstrapJob。只有当该 Job 准备好remote-etcd-ca、remote-etcd-issuer和remote-etcd-client后,插件安装才会继续。验证 bootstrap Job 和运行时资源:
等待 kubectl get lease -n cpaas-system etcd-sync-mirror -o jsonpath='{.spec.holderIdentity}' 返回非空值后再继续。
验证同步 Pod 是否已在备用集群上运行,并识别当前 leader:
如果带有 ownerReference 依赖的资源需要重新同步,请在出现 Start Sync update 后重建当前 leader Pod:
检查同步状态:
输出说明:
LOCAL ETCD missed keys:主 global 集群中存在这些 Key,但备用集群中缺失。通常重启当前etcd-syncleader Pod 后即可解决。LOCAL ETCD surplus keys:备用 global 集群中存在这些 Key,但主集群中不存在。删除前请先与运维团队确认。
如果已安装以下组件,请重启其服务:
-
Log Storage for Elasticsearch:
-
Monitoring for VictoriaMetrics:
灾难恢复流程
此操作会卸载 etcd Synchronizer。在卸载之前,请确认备用集群数据与主集群一致。如果在备用集群缺少主集群所持有的数据时卸载该插件,可能会导致 owner reference 解析错误,并且工作负载集群的 Machine 对象——包括 Immutable OS 集群在内,这将销毁其背后的虚拟机——可能会被删除。如果一致性检查报告有缺失或多余的 Key,请不要卸载该插件;请先解决不一致问题或联系技术支持。
-
如有必要,请先重启备用集群上的 Elasticsearch:
-
验证备用集群中的数据一致性(与 步骤 3 中的检查相同)。如果检查报告有缺失或多余的 Key,则说明备用集群与主集群不一致:请不要继续执行下一步。请先解决不一致问题或联系技术支持。此外,还要在 两个 集群上确认没有
Machine节点处于非运行状态;如果有,请先解决后再继续: -
卸载 etcd Synchronizer;
-
从两个 VIP 上移除端口
2379的端口转发; -
将平台域名的 DNS 切换到备用 VIP,此时该集群将成为新的主集群;
-
验证 DNS 解析:
-
清除浏览器缓存并访问平台页面,确认其已显示原备用集群;
-
重启以下服务(如果已安装):
-
Log Storage for Elasticsearch:
-
Monitoring for VictoriaMetrics:
-
cluster-transformer:
-
-
如果工作负载集群将监控数据发送到主集群,请在工作负载集群中重启 warlock:
-
在原主集群上重复 启用 etcd 同步 的步骤,将其转换为新的备用集群。
日常检查
定期检查备用集群上的同步状态:
如果有任何 Key 缺失或多余,请按照输出中的说明进行处理。
上架软件包
有关 violet push 子命令的详细信息,请参见 上架软件包。