发版日志

产品发布

本产品线记录了以下 Ascend NPU 厂商基础产品:

ComponentVersionNotes
Alauda Build of NPU Operatorv26.6.0当前 OperatorHub / OLM operator 交付模式。

使用 版本和组件 查看 NPU Operator 各版本之间的交付模式和组件差异。当历史 release notes 会影响迁移或支持决策时,会保留在下方。

v26.6.0

支持 ARM Ascend 310P 和 910B 节点上的 ACP v4.0-v4.3。

正式版 ARM64 包已在 Ascend 910B3 Host Driver 环境、Ascend 310P Host 和 Alauda OS 环境,以及使用 HAMi 全设备分配、硬切分和软切分的 Ascend 310P Host 环境中验证。发布扫描未在 Alauda 维护的镜像中发现 Critical 或 High 漏洞。

新增和优化功能

  • 为受支持的可变更操作系统新增由 operator 管理的 Host Driver 安装,同时保留预安装 Host Driver 和托管预编译 Driver 模式。
  • 根据已配置的 Driver 版本和节点发现标签自动解析预编译 Driver 镜像标签。

已修复问题

  • 在 Driver 升级期间,已进入 Failed 状态但仍在终止中的 NPU workload 可能会过早被视为已释放。Operator 现在会等待 Pod 消失,并在达到配置的超时时间后停止升级。
  • 重启后暂时不可用的托管 Host Driver 可能会被视为新的安装目标。安装器现在会等待现有安装恢复健康,并在其就绪后不再重新安装。
  • 卸载 Operator 可能会遗留托管策略和 finalizer。现在卸载流程会在 controller 移除之前删除这些托管对象。
  • 预安装 Host Driver 部署可能会因为未使用预编译 Driver 就绪标记而报告 HCCN 不可用。HCCN Bootstrap 观测现在使用 Host utility 路径,并在探测失败时保持 fail-closed。

升级说明

  • 对于预安装 Host Driver,请保持 Driver 管理禁用并选择 Host 模式。
  • 对于不可变操作系统,请在安装前导入匹配的 ARM64 预编译 Driver 镜像,并配置目标业务集群镜像映射或 ImageWhiteList。Driver 镜像与产品包分开交付。
  • v26.6.0 使用由 ascend-docker-runtime 支持的 ascend RuntimeClass。启用 admission webhook 后,该 webhook 会将此 RuntimeClass 注入请求 Ascend 资源的 Pod,因此 workload manifest 无需显式设置它。
  • 不要将 v1.2.4 的 CDI spec 作为 v26.6.0 的就绪性检查。应验证 RuntimeClass、runtime integration DaemonSet 和已接纳的 Pod。
  • 不要为同一组 Ascend 设备运行多个 device exposure owner。当 HAMi 管理分配或切分时,请为这些设备禁用由 NPU Operator 管理的 Ascend Device Plugin。

已知问题

  • 不支持自动 HCCN 设备 IP 初始化。HCCN Bootstrap 默认禁用;已验证的 profile 仅用于观测,在启用时不会重写预配置地址。
  • 在使用 host networking 和固定组件端口的单节点 control-plane 部署中,升级可能会短暂等待前一个 Pod 释放其端口。请确认旧 Pod 已终止后,再将替换 Pod 视为失败。

升级路径

  • 通过 OperatorHub / OLM 从 v1.2.4 升级到 v26.6.0。对于生产集群,请使用手动审批策略,并在升级后验证 NPUOperatorCtl 组件和一个 NPU workload。
  • 若要从 v1.1.3 或更早的集群插件版本迁移,先卸载旧的集群插件,再从 OperatorHub 安装 v26.6.0。不支持从集群插件交付模式原地转换。

v1.2.4

基于 openFuyao npu-operator 1.2.0。本次发版更改了 NPU Operator 交付模式,并新增对不可变 OS 的支持。

新增和优化功能

  • 支持 Alauda OS 和不可变 OS 节点。
  • 将 Ascend driver 作为预构建 driver 镜像交付,镜像由 HDK、芯片、内核和 OS 标识。
  • 通过禁用 Driver 组件支持预安装 driver passthrough。
  • 使用 CDI 进行 device injection。新 workload 可直接请求 NPU 资源,无需 runtimeClassName: ascend
  • 新增由 operator 管理的 driver 升级和节点重启工作流。
  • 新增由恢复策略控制的 chip 自愈工作流。
  • 将 MindCluster / Ascend 组件栈升级到 v7.3.0 版本线。
  • 自动创建 NPU Exporter ServiceMonitor

破坏性变更

  • 交付方式从集群插件变更为 OLM operator bundle。
  • 不支持从 v1.1.3 或更早的集群插件版本原地升级。
  • driver 默认以 container image 形式交付,而不是 host .run 包。
  • runtime integration 基于 CDI。旧的 RuntimeClass 路径仅为兼容性保留。

已弃用和已移除功能

  • 托管 driver 路径不再使用 v1.1.x 的 DKMS host-side driver 安装流程。

已修复问题

  • 修复 NPU Exporter ServiceMonitor 的 namespace 和 selector 问题。
  • 修复升级验证可能仅依赖 driver pod 就绪状态的问题。
  • 修复在卡死芯片上 runtime 初始化 fast-skip 行为的问题。
  • 包含社区对没有 NPU 卡的节点的安装和检测逻辑修复。

已知问题

  • Driver 镜像可用性取决于与节点内核匹配的 tag。若不存在对应 tag,请联系 Alauda Customer Support。
  • Driver 升级和 chip 自愈可能需要节点重启。

升级说明

要从 v1.1.3 或更早版本迁移到 v1.2.4,请先卸载旧的集群插件,然后从 OperatorHub 安装 v1.2.4 operator。

v1.1.3

基于 openFuyao npu-operator 1.1.1。本次发版使用较旧的集群插件交付模式以及 MindCluster / Ascend v7.2.RC1 组件栈。