资源键

本页介绍通过 Alauda Build of NPU Operator 直接分配 NPU 的方式。对于 HAMi 共享、虚拟化、vNPU 行为,或 Ascend 设备上的 HAMi 特定资源键,请使用 HAMi 文档。

Kubernetes 扩展资源

Resource key含义单位
huawei.com/Ascend910通用 Ascend 910 系列设备数量键。910B 或 910B4 节点仍可能报告此键。count
其他 huawei.com/Ascend*安装的 device plugin 报告的、与环境或软件包相关的键count
huawei.com/Ascend310PAscend 310P 设备数量count

这些资源键由 device plugin 报告,并由 workload 的 resources.limits 消费。请始终从目标业务集群中的节点可分配资源中确认准确的键:

kubectl get node ${nodeName} -o jsonpath='{.status.allocatable}'
NOTE

芯片产品标签与 Kubernetes 资源键并不总是同一个字符串。

例如,芯片产品为 Ascend 910B 的节点可能会暴露 huawei.com/Ascend910

与 HAMi 结合使用

如果 NPU Operator 为 HAMi 部署准备 Ascend 基础环境,则仅使用所选设备暴露 owner 为目标节点暴露的资源键。

由 HAMi Ascend Device Plugin 选择的节点通常使用 HAMi Ascend selector,例如 ascend=on。除非已安装的产品版本明确记录并验证了该拓扑,否则请保持 NPU Operator Ascend Device Plugin 对同一设备禁用,或将其作用范围排除在外。

这两个组件的名称可能相近,并且都可能使用 huawei.com/Ascend* 资源键,但它们对应不同的产品路径:

组件产品路径目的
NPU Operator Ascend Device PluginAscend NPU vendor 基础路径报告用于直接 NPU 分配的 NPU 资源。
HAMi Ascend Device PluginHAMi Ascend 或 HAMi Ascend vNPU 路径通过 HAMi 管理的分配或 vNPU 行为暴露 Ascend 设备。

如果你不使用 Alauda Build of NPU Operator 进行全生命周期管理,请自行安装与 workload 模型匹配的 device plugin。当 workload 直接请求 NPU 时,请使用 Huawei 的 Ascend Device Plugin。当 workload 需要 HAMi 虚拟化或切片语义时,请使用 HAMi Ascend Device Plugin。

Huawei 路径的上游参考请使用 Huawei MindCluster。对于由 HAMi 管理的 Ascend 行为,请继续查阅 HAMi 文档。在 Alauda 部署中,请使用当前 Alauda 软件包随附的组件版本、镜像和安装参数。

节点标签

以下放置标签由 NPU 组件清单消费。NPU Feature Discovery 通常会自动推导并协调这些标签。仅当 discovery 无法在目标节点上运行时,才手动添加这些标签;当 discovery 之后重新协调该节点时,手动分配的值可能会被替换或移除。

标签目的
masterselector=dls-master-node选择 NPU 组件使用的控制节点。当 NPU Feature Discovery 在具有 node-role.kubernetes.io/control-plane 的节点上运行时,会自动分配此标签。
workerselector=dls-worker-node选择应承载 NPU 组件的 worker 节点。会自动分配给非 control-plane 节点;带有 NPU 的 control-plane 节点也可能获得此标签。
openfuyao.com/npu.present在 discovery 之后指示 NPU 存在。

节点注解

注解目的
npu.openfuyao.com/approve-reboot=true批准由 operator 管理的节点重启,用于升级或恢复。请使用 kubectl annotate node,不要使用 kubectl label node

ACP 配额字段

如果 ACP 配额页面需要显示 NPU 资源,请配置匹配的 ACP 资源元数据。请参见 加速器资源配额