如何定义 vGPU(Hami) 成本模型
目录
前提条件关于 Alauda Build of Hami操作步骤创建 PrometheusRule 以生成所需指标添加采集配置(成本管理智能体)添加显示/存储配置(成本管理服务端)为 vGPU 成本模型添加价格计费方式说明为成本模型添加价格成本详情和成本统计前提条件
在 GPU 集群中:
- 已安装 Alauda Build of Hami
- 已安装成本管理智能体
关于 Alauda Build of Hami
Heterogeneous AI Computing Virtualization Middleware (HAMi),前身为 k8s-vGPU-scheduler,是一个用于在 k8s 集群中管理 Heterogeneous AI Computing Devices 的 "all-in-one" chart。它可以提供在任务之间共享 Heterogeneous AI 设备的能力。
操作步骤
创建 PrometheusRule 以生成所需指标
在 Hami 集群中创建一个 PrometheusRule。
添加采集配置(成本管理智能体)
在运行成本管理智能体的 Hami 集群中创建一些 ConfigMap,以声明需要采集的内容。
注意:项目配额的 configmap 仅在 hami 2.7+ 中受支持
添加 yaml 后,需要重启智能体 Pod 以重新加载配置。
添加显示/存储配置(成本管理服务端)
在运行成本管理服务端的集群中创建一个 ConfigMap,用于声明计费项、计费方式、单位和显示名称。这会告诉服务端需要计费的内容以及计费方式。
注意: 如果没有启用 GPU Overcommitment Ratio,使用 Request Usage 没有意义。如果你使用 Request Usage,请先启用 GPU Overcommitment Ratio。
添加 yaml 后,需要重启服务端 Pod 以重新加载配置。
为 vGPU 成本模型添加价格
如果 GPU 集群没有 Cost model,你需要先创建一个新的 cost model。然后就可以为 GPU 集群的 cost model 添加价格:
计费方式说明
为成本模型添加价格
-
在 Billing Items 中选择
vGPU或vGPUMemory。 -
在 Method 中选择
Request Usage (core-hours)、Used Usage (core-hours)或Project Quota (core-hours)。 -
设置 Default Price。
-
配置 Price By Label(可选)。 目前仅支持两个键:
modelName和devicemodelName:GPU 型号,例如 "Tesla P100-PCIE-16GB" 或 "Tesla T4"(可通过运行
nvidia-smi获取)。device:GPU 厂商,例如 "nvidia" 或 "ascend"。
成本详情和成本统计
最后,等待 1 个或多个小时后,你可以在 Cost Details 中按 namespace 和 card uuid 维度查看成本详情。 你还可以在 Cost Statistics 中查看基于 cluster、project 和 namespace 的总成本。