常见问题
以下检查适用于 GPU、NPU 和 HAMi 配置。如果示例使用了 GPU 指标或项目,请替换为相应资源页面中的规范化指标和项目。
目录
为什么没有显示加速器使用量?为什么有使用量却没有账单?为什么所有记录都使用默认价格?为什么显示的数据有延迟?为什么更改价格没有影响旧账单?可以直接为DCGM_FI_DEV_GPU_UTIL 计费吗?为什么没有显示加速器使用量?
对于已配置的资源页面,请按以下顺序检查:
- 源 exporter 或 HAMi scheduler 指标返回了所选资源页面所需的标签。
- 规范化分配指标在 Prometheus(
alauda_gpu_allocated_count、alauda_npu_allocated_count或alauda_hami_virtual_memory_allocated_bytes)中返回数据。 - 集合
ConfigMap位于加速器集群的cpaas-system中,并且具有cpaas.io/slark.collection.config: "true"标签。 - 集合项目和查询与所选资源页面的 recording rule 匹配。
- 智能体已重新加载配置,并且已经过了足够的时间以完成一个集合周期。
为什么有使用量却没有账单?
检查 Cost Model 是否已链接到 GPU 集群,并且是否为确切的计费项目和方法设置了价格。确认显示的 ConfigMap 项目名称与集合项目完全一致。
为什么所有记录都使用默认价格?
特定模型的覆盖项与计费标签 modelName 匹配。请确认:
- recording rule 创建了
label_modelName; - 该值被复制到计费记录中,作为
modelName; - Cost Model 键恰好为
modelName; - 该值区分大小写并且匹配。
项目配额记录使用默认项目价格,因为配额指标没有 GPU 模型维度。
为什么显示的数据有延迟?
示例配置每五分钟评估一次使用量,并按小时聚合。在检查控制台之前,至少等待一个集合间隔以及账单处理时间。
为什么更改价格没有影响旧账单?
Cost Model 的更改不会自动重新计算历史账单。除非执行单独且范围受限的重新计算操作步骤,否则应将新价格视为适用于之后处理的数据。
可以直接为 DCGM_FI_DEV_GPU_UTIL 计费吗?
不能。它的数值是利用率百分比,而不是 GPU 数量。示例利用带标签的 GPU 序列是否存在来推导每个 UUID 分配了一个 GPU。