节点监控

在节点详情页查看节点监控数据。

TIP
  • 当集群包含多个节点时,您可以在节点详情页的资源路径区域单击 当前节点名称,展开节点下拉列表,然后单击选择一个节点,以便快速切换到其他节点详情页。

  • 当为集群配置了监控组件时,您可以查看节点监控数据,包括资源运行状态、资源使用情况和资源趋势统计。

操作步骤

  1. 在左侧导航栏中,单击 Clusters > Clusters

  2. 单击目标节点所在的 集群名称

  3. Nodes 选项卡下,单击目标 节点名称

  4. 单击 Monitoring 选项卡,进入节点监控数据展示页面并查看相关节点监控数据。

    TIP
    • 将鼠标悬停在卡片上并单击 详情 图标,以查看 PromQL 表达式;单击 导出 图标可导出当前页面所有图表的 PromQL 表达式。

    • 当集群包含多个节点时,您可以在节点详情页的资源路径区域单击 当前节点名称,展开节点下拉列表,然后单击选择一个节点,以便快速切换到其他节点详情页。

    TIP

    在存储空间统计展示区域中,当节点存在超过 4 个存储分区时:

    • 在分区总使用量饼图中,使用量最高的前 3 个分区会单独显示,其余分区会显示为 其他,并在悬停到该区域时显示其总使用量数据;

    • 在分区使用量条形图中,使用量最高的前 3 个分区会单独显示,其余分区会显示为 其他,并在悬停到条形图上时显示其总使用量和各自的使用率。

    监控趋势统计如下表所述。

    参数描述
    CPU指定时间范围内 CPU 的使用率请求率限制率

    使用率 = 节点上所有 Pod 的 CPU 使用量 / 节点的 CPU 总量。
    说明:如果某一时间段内节点的 CPU 使用率出现突增,您需要先找出占用 CPU 资源最多的进程。例如,对于 Java 自定义应用,代码中的内存泄漏或死循环都可能导致 CPU 使用率过高。

    请求率 = 节点上所有 Pod 的 CPU requests / 节点的 CPU 总量。
    说明:如果某一时间段内节点的 CPU 请求率出现突增,可能是由于集群超分配比设置不合理,或者节点上运行的 Pod 的 request 值过高,从而导致资源浪费。

    限制率 = 节点上所有 Pod 的 CPU limits / 节点的 CPU 总量。
    说明:如果某一时间段内节点的 CPU 限制率出现突增,表明节点上运行的 Pod 的 limit 值设置过高,可能会导致 CPU 资源浪费。
    Memory指定时间范围内内存的使用率请求率限制率

    使用率 = 节点上所有 Pod 的内存使用量 / 节点的总内存。
    内存是服务器上的重要组件之一,也是 CPU 进行通信的桥梁。因此,内存性能对机器有显著影响。程序运行时,数据加载、线程并发以及 I/O 缓冲都依赖内存。可用内存大小决定了程序能否正常运行以及运行方式。

    请求率 = 节点上所有 Pod 的内存 requests / 节点的总内存。
    说明:如果某一时间段内节点的内存请求率出现突增,可能是由于集群超分配比设置不合理,或者节点上运行的 Pod 的 request 值过高,从而导致资源浪费。

    限制率 = 节点上所有 Pod 的内存 limits / 节点的总内存。
    说明:如果某一时间段内节点的内存限制率出现突增,表明节点上运行的 Pod 的 limit 值设置过高,可能会导致内存资源浪费。
    Storage指定时间范围内的空间使用率inode 使用率

    空间使用率 = 已使用存储空间 / 存储空间总量。
    通过监控历史磁盘空间数据,您可以评估某一时间段内的磁盘使用情况。当磁盘使用率较高时,您可以通过清理不必要的镜像或容器来释放磁盘空间。

    inode 使用率 = 已使用 inode 存储 / inode 存储总量。
    说明:每个文件都必须拥有一个 inode 来存储文件元数据,例如文件创建者和创建日期。inode 也会占用磁盘空间,且大量小型缓存文件容易导致 inode 资源耗尽。此外,当 inode 耗尽但磁盘未满时,无法在磁盘上创建新文件。
    System Load1 分钟、5 分钟和 15 分钟的平均 CPU 负载。该值是当前由 CPU 正在执行和等待执行的进程总数与 CPU 可执行的最大进程数之比,是衡量系统繁忙/空闲状态的重要指标。

    说明:如果在某一时间段内 1 分钟/5 分钟/15 分钟曲线相近,说明集群的 CPU 负载相对稳定。
    如果在某一时间段或某一时间点 1 分钟值远大于 15 分钟值,说明最近 1 分钟内负载在上升,需要持续观察。一旦 1 分钟值超过 CPU 数量,可能表示系统过载,您需要进一步分析问题根因。
    如果在某一时间段或某一时间点 1 分钟值远小于 15 分钟值,说明最近 1 分钟内系统负载在下降,而前 15 分钟内曾产生较高负载。
    Disk Throughput指定时间范围内的磁盘吞吐量,指磁盘传输数据流的速度,其中传输数据为读写数据之和。
    Disk IOPS指定时间范围内的磁盘 IOPS 为每秒连续读写次数之和,表示磁盘每秒读写操作数量的性能指标。
    Network Traffic Rate指定时间范围内的网络流入和流出速率,由节点的物理网卡统计。
    Network Packet Rate (packets/sec)指定时间范围内的网络收发包速率,由节点的物理网卡统计。