前提条件
在安装 Alauda Build of NPU Operator 之前,请先准备集群和节点。
ACP 和集群访问
- ACP v4.0-v4.3。
- 目标业务集群需要具备集群管理员访问权限,后续将在该集群中安装
Alauda Build of NPU Operator。 - ACP 中可用 OperatorHub 和 Cluster Plugin 安装。
- 支持从 Customer Portal 下载软件包,并在 ACP 中上传软件包。
节点和硬件
- Ascend 910B 或 Ascend 310P worker 节点。
- ARM 架构。
- 目标业务集群已安装
Alauda Build of Node Feature Discovery,以便在 NPU 组件协调之前可获得共享 kernel、OS、架构和硬件标签。 - 为 NPU 组件选择的节点允许运行 NPU Feature Discovery,或者你已识别出需要手动 placement-label 回退的节点。在创建
NPUOperatorCtl实例后,请验证masterselector=dls-master-node和workerselector=dls-worker-node;这些通常由系统自动维护,而不是作为安装前提手动添加。 - 对于 Ascend 910 系列节点,请在工作负载验证之前完成 HCCN 设备 IP 配置。v26.6.0 不会自动初始化 HCCN 设备 IP。
驱动和运行时
在创建 NPUOperatorCtl 实例之前,请先选择一种驱动生命周期模式:
在预安装驱动模式下,在启用依赖该驱动的 NPU 组件之前,请确认每个已选 NPU 节点上都存在 /usr/local/Ascend/driver。
对于 operator 管理的不可变 OS / Alauda OS 预编译模式,请从产品包中单独导入匹配的 ARM64 Driver 镜像。将完整的源镜像引用映射到目标业务集群镜像仓库,并确保在集群实施镜像策略时,已接收的镜像被 ImageWhiteList 允许。
设备暴露模型
为每个节点选择一种 Ascend 设备暴露所有者:
除非当前产品版本明确说明并验证了该拓扑,否则不要在同一节点上对同一组 Ascend 设备同时运行多个设备暴露所有者。
可选组件
- 仅当你计划启用 ClusterD 时,才安装 Volcano。
- 仅当你计划在离线或受控网络环境中启用 MindIO TFT 或 MindIO ACP 时,才预先在每个目标 NPU 节点上放置 MindIO SDK zip 文件。
ACP 交叉引用
- 关于软件包上传,请参见 Upload Packages。
- 关于配额资源显示,请参见 Accelerator Resource Quota。
- 关于 dashboard 管理,请参见 Manage dashboards。