常见问题

以下检查适用于 GPU、NPU 和 HAMi 配置。如果示例使用了 GPU 指标或项目,请替换为相应资源页面中的规范化指标和项目。

为什么没有显示加速器使用量?

对于已配置的资源页面,请按以下顺序检查:

  1. 源 exporter 或 HAMi scheduler 指标返回了所选资源页面所需的标签。
  2. 规范化分配指标在 Prometheus(alauda_gpu_allocated_countalauda_npu_allocated_countalauda_hami_virtual_memory_allocated_bytes)中返回数据。
  3. 集合 ConfigMap 位于加速器集群的 cpaas-system 中,并且具有 cpaas.io/slark.collection.config: "true" 标签。
  4. 集合项目和查询与所选资源页面的 recording rule 匹配。
  5. 智能体已重新加载配置,并且已经过了足够的时间以完成一个集合周期。

为什么有使用量却没有账单?

检查 Cost Model 是否已链接到 GPU 集群,并且是否为确切的计费项目和方法设置了价格。确认显示的 ConfigMap 项目名称与集合项目完全一致。

为什么所有记录都使用默认价格?

特定模型的覆盖项与计费标签 modelName 匹配。请确认:

  • recording rule 创建了 label_modelName
  • 该值被复制到计费记录中,作为 modelName
  • Cost Model 键恰好为 modelName
  • 该值区分大小写并且匹配。

项目配额记录使用默认项目价格,因为配额指标没有 GPU 模型维度。

为什么显示的数据有延迟?

示例配置每五分钟评估一次使用量,并按小时聚合。在检查控制台之前,至少等待一个集合间隔以及账单处理时间。

为什么更改价格没有影响旧账单?

Cost Model 的更改不会自动重新计算历史账单。除非执行单独且范围受限的重新计算操作步骤,否则应将新价格视为适用于之后处理的数据。

可以直接为 DCGM_FI_DEV_GPU_UTIL 计费吗?

不能。它的数值是利用率百分比,而不是 GPU 数量。示例利用带标签的 GPU 序列是否存在来推导每个 UUID 分配了一个 GPU。