介绍

Alauda Ascend NPU 文档涵盖 ACP accelerator workloads 的 Ascend vendor 基础路径。它帮助用户准备和操作 Ascend NPU 节点、直接 NPU 分配、RuntimeClass 集成、监控组件以及驱动生命周期工作流。

Alauda Build of NPU Operator 是该基础路径中的核心产品。它会在 ACP workload 集群上安装并管理 Ascend NPU software stack。它会根据 NPUOperatorCtl custom resource,协调 Ascend driver、container runtime 集成、device plugin、NPU exporter,以及可选的 MindCluster 组件。

当 ACP workloads 需要请求 Ascend NPU resources 时使用此产品,例如 910 系列设备的 huawei.com/Ascend910,或 huawei.com/Ascend310P,具体取决于目标集群中已安装的 device plugin 报告的内容。

本网站当前涵盖 NPU Operator、Ascend Device Plugin,以及由 ascend-docker-runtime 支持的 ascend RuntimeClass 路径。

何时使用

在以下情况下使用 Alauda Build of NPU Operator

  • 你在 Ascend 910B 或 Ascend 310P 节点上运行容器 workload;
  • 你希望将 Ascend driver、device plugin、runtime 集成和 exporter 作为 ACP 产品进行管理;
  • 你需要 operator 为 workload 分配 NPU devices 并配置 Ascend container runtime;
  • 你需要一个有文档说明的 driver 升级和节点重启工作流,用于受管 NPU 节点。

当用户任务从 Ascend devices 上的共享、虚拟化或调度行为开始时,请使用 HAMi 文档,例如 Ascend NPU 上的 HAMi 或 Ascend vNPU 上的 HAMi。在该组合路径中,本网站提供 Ascend 基础前提条件;HAMi 文档负责 HAMi 安装、device 暴露、resource keys、共享语义以及故障排查。

当你只需要在 GPU、NPU、HAMi、DRA 和 VM GPU passthrough 路径之间进行选择时,请使用 ACP accelerator 页面。对于不会影响 ACP 操作的 vendor hardware 概念、driver 内部机制以及上游 API 细节,请使用 Huawei 或 openFuyao 文档。

主要任务