监控 HAMi 用量
可通过 ACP 监控以及(如果已安装)HAMi WebUI 来观察 HAMi 用量。
ACP 监控面板
使用 ACP 监控面板查看加速器指标以及其他集群和工作负载指标。
- 打开
管理员->Operations Center->Monitor->Dashboards。 - 选择适用于你的环境的 HAMi 或加速器监控面板。
- 检查工作负载用量、设备用量和 exporter 抓取状态。
监控面板管理属于 ACP 监控。有关监控面板导入和管理,请参见 管理监控面板。
对于 HAMi NVIDIA 监控路径,此文档站点提供一个 MonitorDashboard 资源。下载 hami-vgpu-metrics-dashboard-v1.0.2.yaml 到一台可以访问业务集群的机器,然后应用它:
该监控面板使用 HAMi 和 NVIDIA 指标。请通过 NVIDIA GPU 产品文档安装并验证 NVIDIA 指标组件;该监控面板清单不会安装这些组件。
HAMi WebUI
如果已安装 Alauda Build of HAMi-WebUI,请打开 {platform-url}/clusters/{cluster-name}/hami-webui。有关 Prometheus 认证、主机端口以及后端查询校验,请参见 安装 HAMi-WebUI。
当你需要查看 HAMi 专属资源概览时,请使用 HAMi WebUI。当你需要平台级监控面板、告警和指标管理时,请使用 ACP 监控。
HAMi Ascend 软切片指标
HAMi Ascend Device Plugin v1.4.0 为软切片提供内置的 Pod 和容器内存指标。请在 HAMiAscendDevicePlugin 实例中启用 ServiceMonitor,以便将这些指标提供给 ACP 监控。
对于由 HAMi 管理的整卡工作负载,请使用下文描述的 Ascend NPU Exporter 监控路径。当前,HAMi 管理的硬切片工作负载不提供工作负载级别的指标。软切片提供 Pod 和容器内存指标。软切片工作负载所显示的计算利用率是底层物理设备的利用率,因此共享该设备的工作负载会报告相同的值。
指标来源
HAMi 不会安装厂商指标组件。
- 对于 NVIDIA 后端指标,请使用
Alauda Build of DCGM-Exporter,并参考 NVIDIA GPU 指标文档 进行安装和验证。DCGM-Exporter 是 NVIDIA GPU 监控组件,不是 HAMi 组件。 - 对于 Ascend 后端指标,当在
NPUOperatorCtl实例中启用 exporter 组件时,Alauda Build of NPU Operator会管理 NPU Exporter。NPU Exporter 是 Ascend NPU 监控组件,不是 HAMi 组件。请使用 Ascend NPU 监控文档 进行 exporter 验证和监控面板集成。
请使用后端页面确认哪个组件负责该指标路径: