前提条件

在安装 Alauda Build of NPU Operator 之前,请先准备集群和节点。

ACP 和集群访问

  • ACP v4.0-v4.3。
  • 目标业务集群需要具备集群管理员访问权限,后续将在该集群中安装 Alauda Build of NPU Operator
  • ACP 中可用 OperatorHub 和 Cluster Plugin 安装。
  • 支持从 Customer Portal 下载软件包,并在 ACP 中上传软件包。

节点和硬件

  • Ascend 910B 或 Ascend 310P worker 节点。
  • ARM 架构。
  • 目标业务集群已安装 Alauda Build of Node Feature Discovery,以便在 NPU 组件协调之前可获得共享 kernel、OS、架构和硬件标签。
  • 为 NPU 组件选择的节点允许运行 NPU Feature Discovery,或者你已识别出需要手动 placement-label 回退的节点。在创建 NPUOperatorCtl 实例后,请验证 masterselector=dls-master-nodeworkerselector=dls-worker-node;这些通常由系统自动维护,而不是作为安装前提手动添加。
  • 对于 Ascend 910 系列节点,请在工作负载验证之前完成 HCCN 设备 IP 配置。v26.6.0 不会自动初始化 HCCN 设备 IP。

驱动和运行时

在创建 NPUOperatorCtl 实例之前,请先选择一种驱动生命周期模式:

模式适用场景
预安装驱动当宿主机驱动在 Alauda Build of NPU Operator 之外安装和升级时使用。请在 NPUOperatorCtl 中禁用 Driver management。
operator 管理的普通 OS 安装当宿主机 OS 可以运行随产品交付的驱动安装流程时使用。请启用 Driver management,并保持预编译驱动交付禁用。
operator 管理的不可变 OS / Alauda OS 预编译安装当宿主机 OS 为不可变系统,或者应使用预编译驱动树时使用。请启用 Driver management,并启用预编译驱动交付。

在预安装驱动模式下,在启用依赖该驱动的 NPU 组件之前,请确认每个已选 NPU 节点上都存在 /usr/local/Ascend/driver

对于 operator 管理的不可变 OS / Alauda OS 预编译模式,请从产品包中单独导入匹配的 ARM64 Driver 镜像。将完整的源镜像引用映射到目标业务集群镜像仓库,并确保在集群实施镜像策略时,已接收的镜像被 ImageWhiteList 允许。

设备暴露模型

为每个节点选择一种 Ascend 设备暴露所有者:

模型Device plugin适用场景
NPU Operator 管理的直接 NPU 分配NPU Operator Ascend Device PluginAlauda Build of NPU Operator 负责节点生命周期管理,并且工作负载直接请求 NPU 时使用。
手动管理的直接 NPU 分配Huawei Ascend Device Plugin当你不使用 NPU Operator 进行完整生命周期管理,但工作负载仍直接请求 NPU 时使用。请将 Huawei MindCluster 文档作为上游参考。
HAMi 管理的分配或 vNPU 行为HAMi Ascend Device Plugin当工作负载需要 Ascend 设备上的 HAMi 调度、虚拟化或切分行为时使用。

除非当前产品版本明确说明并验证了该拓扑,否则不要在同一节点上对同一组 Ascend 设备同时运行多个设备暴露所有者。

可选组件

  • 仅当你计划启用 ClusterD 时,才安装 Volcano。
  • 仅当你计划在离线或受控网络环境中启用 MindIO TFT 或 MindIO ACP 时,才预先在每个目标 NPU 节点上放置 MindIO SDK zip 文件。

ACP 交叉引用