发版日志
产品发布
本产品线记录了以下 Ascend NPU 厂商基础产品:
使用 版本和组件 查看 NPU Operator 各版本之间的交付模式和组件差异。当历史 release notes 会影响迁移或支持决策时,会保留在下方。
v26.6.0
支持 ARM Ascend 310P 和 910B 节点上的 ACP v4.0-v4.3。
正式版 ARM64 包已在 Ascend 910B3 Host Driver 环境、Ascend 310P Host 和 Alauda OS 环境,以及使用 HAMi 全设备分配、硬切分和软切分的 Ascend 310P Host 环境中验证。发布扫描未在 Alauda 维护的镜像中发现 Critical 或 High 漏洞。
新增和优化功能
- 为受支持的可变更操作系统新增由 operator 管理的 Host Driver 安装,同时保留预安装 Host Driver 和托管预编译 Driver 模式。
- 根据已配置的 Driver 版本和节点发现标签自动解析预编译 Driver 镜像标签。
已修复问题
- 在 Driver 升级期间,已进入
Failed状态但仍在终止中的 NPU workload 可能会过早被视为已释放。Operator 现在会等待 Pod 消失,并在达到配置的超时时间后停止升级。 - 重启后暂时不可用的托管 Host Driver 可能会被视为新的安装目标。安装器现在会等待现有安装恢复健康,并在其就绪后不再重新安装。
- 卸载 Operator 可能会遗留托管策略和 finalizer。现在卸载流程会在 controller 移除之前删除这些托管对象。
- 预安装 Host Driver 部署可能会因为未使用预编译 Driver 就绪标记而报告 HCCN 不可用。HCCN Bootstrap 观测现在使用 Host utility 路径,并在探测失败时保持 fail-closed。
升级说明
- 对于预安装 Host Driver,请保持 Driver 管理禁用并选择 Host 模式。
- 对于不可变操作系统,请在安装前导入匹配的 ARM64 预编译 Driver 镜像,并配置目标业务集群镜像映射或
ImageWhiteList。Driver 镜像与产品包分开交付。 - v26.6.0 使用由
ascend-docker-runtime支持的ascendRuntimeClass。启用 admission webhook 后,该 webhook 会将此 RuntimeClass 注入请求 Ascend 资源的 Pod,因此 workload manifest 无需显式设置它。 - 不要将 v1.2.4 的 CDI spec 作为 v26.6.0 的就绪性检查。应验证 RuntimeClass、runtime integration DaemonSet 和已接纳的 Pod。
- 不要为同一组 Ascend 设备运行多个 device exposure owner。当 HAMi 管理分配或切分时,请为这些设备禁用由 NPU Operator 管理的 Ascend Device Plugin。
已知问题
- 不支持自动 HCCN 设备 IP 初始化。HCCN Bootstrap 默认禁用;已验证的 profile 仅用于观测,在启用时不会重写预配置地址。
- 在使用 host networking 和固定组件端口的单节点 control-plane 部署中,升级可能会短暂等待前一个 Pod 释放其端口。请确认旧 Pod 已终止后,再将替换 Pod 视为失败。
升级路径
- 通过 OperatorHub / OLM 从 v1.2.4 升级到 v26.6.0。对于生产集群,请使用手动审批策略,并在升级后验证
NPUOperatorCtl组件和一个 NPU workload。 - 若要从 v1.1.3 或更早的集群插件版本迁移,先卸载旧的集群插件,再从 OperatorHub 安装 v26.6.0。不支持从集群插件交付模式原地转换。
v1.2.4
基于 openFuyao npu-operator 1.2.0。本次发版更改了 NPU Operator 交付模式,并新增对不可变 OS 的支持。
新增和优化功能
- 支持 Alauda OS 和不可变 OS 节点。
- 将 Ascend driver 作为预构建 driver 镜像交付,镜像由 HDK、芯片、内核和 OS 标识。
- 通过禁用 Driver 组件支持预安装 driver passthrough。
- 使用 CDI 进行 device injection。新 workload 可直接请求 NPU 资源,无需
runtimeClassName: ascend。 - 新增由 operator 管理的 driver 升级和节点重启工作流。
- 新增由恢复策略控制的 chip 自愈工作流。
- 将 MindCluster / Ascend 组件栈升级到 v7.3.0 版本线。
- 自动创建 NPU Exporter
ServiceMonitor。
破坏性变更
- 交付方式从集群插件变更为 OLM operator bundle。
- 不支持从 v1.1.3 或更早的集群插件版本原地升级。
- driver 默认以 container image 形式交付,而不是 host
.run包。 - runtime integration 基于 CDI。旧的 RuntimeClass 路径仅为兼容性保留。
已弃用和已移除功能
- 托管 driver 路径不再使用 v1.1.x 的 DKMS host-side driver 安装流程。
已修复问题
- 修复 NPU Exporter
ServiceMonitor的 namespace 和 selector 问题。 - 修复升级验证可能仅依赖 driver pod 就绪状态的问题。
- 修复在卡死芯片上 runtime 初始化 fast-skip 行为的问题。
- 包含社区对没有 NPU 卡的节点的安装和检测逻辑修复。
已知问题
- Driver 镜像可用性取决于与节点内核匹配的 tag。若不存在对应 tag,请联系 Alauda Customer Support。
- Driver 升级和 chip 自愈可能需要节点重启。
升级说明
要从 v1.1.3 或更早版本迁移到 v1.2.4,请先卸载旧的集群插件,然后从 OperatorHub 安装 v1.2.4 operator。
v1.1.3
基于 openFuyao npu-operator 1.1.1。本次发版使用较旧的集群插件交付模式以及 MindCluster / Ascend v7.2.RC1 组件栈。