评估 global 集群的资源

概述

在规划用于多集群 部署的 global 集群时,请使用这些资源评估实践。

合理的节点规格有助于 global 集群管理已注册集群、处理同步流量,并在符合环境性能预期的情况下处理用户 API 和 Web Console 请求。

节点规格

global 集群负责:

  • 维护集群注册和元数据。
  • 处理来自 Web Console 和 CLI 的入站 API 请求。
  • 协调与已连接集群之间的同步和心跳消息。
  • 管理内部控制器和资源调谐循环。

由于 global 集群既要处理管理操作,又要聚合所有已连接集群的数据,因此请根据预期规模和工作负载强度来规划资源分配。

生产环境基准规格

生产规模的规格主要取决于以下因素:

  • 受管集群数量
  • 同步周期频率
  • 并发 API 请求率(来自用户或自动化)
  • 流式请求数量
  • 已安装插件数量

下表提供了经过内部性能测试验证的参考配置。

规模等级受管集群节点数每节点 CPU每节点内存备注
小型≤ 1038 cores16 GB适用于小规模环境
中型≤ 50316 cores32 GB默认生产环境配置
大型≤ 100324 cores48 GB支持高强度 Web Console 使用和频繁同步周期
超大型≤ 500632 cores64 GB需要水平扩展和专用基础设施节点
WARNING

这些建议仅为通用指导。实际需求取决于集群拓扑、用户并发以及已安装的插件。

垂直扩展指南

当单节点负载增加时(例如,集群数量增加 2 倍或用户并发更高),请按以下方式调整:

参数扩展建议
CPU每增加 50 个受管集群,增加 50%
内存每增加 50 个受管集群,增加 50%

水平扩展指南

当受管集群数量超过 100 个,或持续出现超过 500 ms 的 API 延迟时:

添加节点,以分散请求处理和控制器工作负载。

资源验证与监控

部署后,请持续监控以下指标以验证节点规格:

指标建议范围
节点 CPU 利用率峰值负载下 60–75%
节点内存利用率持续 ≤80%
API 请求延迟P90 < 500ms
etcd 提交延迟P99 < 50ms
Node CPU utilization
Node Memory utilization
API request latency
etcd commit latency
100 * (1 - avg by (instance)(rate(node_cpu_seconds_total{mode="idle"}[5m])))
NOTE

如果持续资源使用率始终超过建议阈值,请在面向用户的性能下降发生之前进行垂直扩展(增加 CPU/内存)或水平扩展(添加节点)。

总结

global 集群进行规格规划时:

  1. 对于中等规模部署(≤50 个集群),从 3 个节点 × 16 cores × 32 GB 开始。
  2. 当请求并发更高或 Web Console 使用强度更大时,进行垂直扩展
  3. 超过 100 个集群后进行水平扩展,以保持 API 响应能力。
  4. 每当受管集群数量或同步频率发生显著增长后,重新评估规格。

使用这些实践可使资源规划与 Multi-Cluster 环境的增长保持一致。