发版日志

请使用 版本和组件 查看当前 Marketplace 版本、组件角色和安装链接。以下章节记录了每个发版的变更和限制。

有关 NVIDIA GPU 指标变更,请参阅 NVIDIA GPU 文档Alauda Build of DCGM-Exporter 的发版日志。有关 Ascend NPU 指标变更,请参阅 Ascend NPU 文档 中的 NPU Exporter 信息。

Alauda Build of HAMi

v2.9.0

Alauda Build of HAMi v2.9.0 是当前用于 HAMi 共享、虚拟化和调度的正式版 Alauda 发版。它以 ACP 集群插件形式交付,提供 amd64、arm64 和多架构(ALL)包。

新特性与改进

  • 为需要显式选择 scheduler 镜像的部署添加了完整的自定义 kube-scheduler 镜像路径。
  • Alauda 交付包为带污点的加速器节点上的 HAMi scheduler 和 device-plugin 工作负载配置了标准 toleration。
  • 从 v2.9.0 release tag 刷新了正式版 HAMi chart、runtime 镜像和 ACP plugin 包。

升级说明

  • 升级前,请确认目标 ACP 版本、后端路径、节点 taint,以及当前暴露的 HAMi 资源键。
  • 如果需要自定义 scheduler 镜像,请通过 HAMi plugin 参数配置 scheduler.kubeScheduler.customImage;当其为空时,镜像将根据目标集群的 Kubernetes 版本和已配置的镜像仓库生成。
  • 升级后,请验证 HAMi scheduler 和 device-plugin 的就绪状态、节点可分配资源键、ACP 配额元数据,以及 验证 中的一个代表性工作负载。

v2.8.3

已修复问题

  • 修复了当 GetMemoryInfo 返回 NOT_SUPPORTED 时,对统一内存 GPU 的内存信息处理问题。
  • 修复了 v2.8.2 中 HAMi-Core 监控问题。
  • 修复了在工作负载未指定 nvidia.com/gpucores 时 device utilization watcher 的启动问题。

v2.8.1

新特性与改进

  • 新增华为昇腾 NPU 共享支持。
  • 新增 NVIDIA 设备 CDI 模式支持。
  • 与 NVIDIA Kubernetes Device Plugin v0.18.0 同步。
  • 新增 hami_build_info Prometheus 指标和版本输出。
  • 新增 TLS 证书监听和热加载,无需重启 Pod。
  • 新增 NVIDIA GPU Operator toolkit 就绪检查。
  • 新增 GPUDirect RDMA copy(GDRCopy)和 GPUDirect Storage(GDS)配置支持。
  • 新增 mock device plugin 支持,适用于测试环境。
  • 为兼容 HAMi v2.8,将 HAMi-WebUI 升级到 v1.10.0。HAMi-WebUI v1.10.0 兼容 HAMi v2.7 和 v2.8。HAMi-WebUI v1.5.0 与 HAMi v2.8 不兼容。

已修复问题

  • 更新 HAMi-Core 以修复与 vLLM 相关的问题。
  • 修复了在使用多个 GPU 时,vLLM 0.18 之后版本的启动失败问题。
  • 修复了配额计算错误。
  • 修复了 MIG 实例分配错误,避免 scheduler 选择错误的 MIG 实例。
  • nvidia-mig-parted 升级到 v0.12.2 以修复安全问题。
  • 修复了从 GPU 节点移除 device plugin 后,GPU 节点仍然可见的旧状态问题。
  • 修复了并发 map 读写错误。
  • 修复了 device NUMA 获取逻辑。
  • 修复了更改 release 名称或 chart 名称时的 ClusterRoleBinding 错误。

v2.7.1

新特性与改进

  • 为 ACP 4.2 及更高版本新增 NVIDIA GPU ResourceQuota 支持。
  • 新增聚合的调度失败事件。
  • 将节点锁超时设为可配置。

已修复问题

  • 修复了从某个 GPU 节点移除 device plugin 后,该节点仍可被调度的问题。

v2.6.1

已修复问题

  • 修复了工作负载使用 cuMallocAsync 分配内存时的设备内存计量问题。
  • 修复了 gpu_burn 的设备内存计量问题。
  • 修复了某些场景下的段错误。
  • 修复了工作负载使用多个设备时的利用率指标问题。
  • 修复了使用张量并行度大于 2 的 vLLM 时的初始化错误。

v2.6.0

新特性与改进

  • 优化了 scheduler 日志。
  • 新增 Enflame GCU 共享支持。
  • 新增 Metax GPU 和 Metax sGPU 支持。
  • 新增 Helm Chart 校验和注解,使 HAMi 组件在 ConfigMap 变更后重启。
  • 新增 NVIDIA 设备的 RuntimeClass 支持。
  • 新增通过 net/http/pprof 的分析功能。
  • 在节点上新增 NVIDIA GPU 拓扑评分注册。
  • 在 vGPU 监控中新增 MIG 信息指标。

已修复问题

  • 修复了与 NVIDIA driver 570+ 的兼容性问题。
  • 修复了 ComfyUI 任务中的设备内存计量问题。
  • 修复了 Cambricon 设备分配问题。
  • 修复了错误日志以及容器请求设备数量错误。
  • 修复了不一致的 vgpu-devices-allocated 注解。
  • 修复了 node manager 中的旧节点设备问题。
  • 修复了动态 GPU partitioning 中缺少单 GPU 粒度的问题。
  • 修复了 cuMallocAsync 上的设备内存计量问题。
  • 修复了 MIG 任务意外运行在 hami-core GPU 上时的 scheduler 崩溃问题。
  • 修复了多进程设备内存计量问题。

Alauda Build of HAMi-WebUI

v1.10.3

发布日期:2026-07-27

Alauda Build of HAMi-WebUI v1.10.3 是面向 HAMi v2.9.x 的补丁发版。它可通过 Customer Portal 和 AC CN/IO 获取,提供 amd64、arm64 和多架构(ALL)集群插件包。该 plugin 使用上游 HAMi-WebUI v1.2.0 应用基线。

已修复问题

  • 将任务列表名称过滤改为搜索每一行所代表的 Pod 或工作负载名称。内部容器名称不作为任务列表名称过滤条件。
  • 修复了包含 init container 的 Pod 的设备分配注解解码问题。现在分配位置会遵循完整的 init-container 加常规 container 顺序。
  • 修正了 MLU 设备分配注解解码。

安全

  • 升级 Go toolchain、gRPC 和 golang.org/x/* 依赖,以清除当前所有可修复的后端发现。
  • 升级了存在漏洞的前端依赖,包括 body-parser,且未改变 plugin 形式或 WebUI 工作流。
  • 已发布的后端和前端镜像通过了 Critical 和 High 漏洞门禁。由于没有可用的上游修复版本,go-kratos/kratos v2.7.3 中的 CVE-2026-6993 仍然是 Medium 级别发现。

升级说明

  • 请通过 ACP 集群插件页面从 v1.10.2 升级。保留 Prometheus 地址和主机端口选择。
  • 请基于当前监控 Secret 重新生成 Prometheus 认证值。插件表单中填写的值必须包含 Basic 前缀。
  • 升级后,请验证后端 Prometheus 查询返回 JSON,并且 Pod 名称任务过滤条件返回预期行。

已知限制

  • HAMi-WebUI v1.10.3 查询的是 HAMi 2.9 的指标名称。请勿与 HAMi 2.8.x 一起使用;否则受影响的利用率视图可能一直显示为 0。
  • 任务列表是 Pod 级别的。名称过滤器有意不搜索内部容器名称。

v1.10.2

Alauda Build of HAMi-WebUI v1.10.2 引入了 HAMi 2.9 指标名称更新,并已被用于新的 HAMi 2.9.x 部署的 v1.10.3 取代。

新特性与改进

  • 新增级联过滤下拉框,使过滤选项限定于当前选择范围。
  • 优化了监控概览图表,并新增了工作负载洞察。
  • 改进了节点详情页图表显示,并修复了时间选择器国际化问题。
  • 更新指标以兼容 HAMi v2.9.0。

已修复问题

  • /metrics 调整为可安全抓取,并减少页面侧查询扇出,以提升大规模集群性能,避免指标超时或内存不足问题。
  • 通过恢复 lodash 4.17.21,修复了由损坏的 lodash 依赖版本导致的空白页面问题。

安全

  • 将后端升级到 Go 1.26.3,以修复 8 个 Go standard library CVE:CVE-2026-33811、CVE-2026-33814、CVE-2026-39820、CVE-2026-39823、CVE-2026-39825、CVE-2026-39826、CVE-2026-39836 和 CVE-2026-42499。
  • 升级前端依赖,包括 axios 1.16.0、follow-redirects 1.16.0、postcss 8.5.10、qs 6.15.2 和 ws 8.20.1,以修复 23 个 Node CVE。

升级说明

  • 支持的升级路径为 v1.10.0 到 v1.10.2。此发版未记录 breaking changes。

Alauda Build of HAMi Ascend Device Plugin

v1.4.0

发布日期:2026-07-29

Alauda Build of HAMi Ascend Device Plugin v1.4.0 是一个 Technical Preview operator 插件,用于部署和管理 HAMi Ascend 整卡分配、硬切分和软切分。

新特性与改进

  • 新增按节点控制,可将设备排除在 HAMi 管理之外,并配置虚拟设备数量。
  • 在配置为软切分的节点上自动启用设备共享。
  • 为软切分工作负载新增内置 Prometheus 监控,并支持可选的 ServiceMonitor 集成。
  • 为 Ascend 910C 新增 vir05_1c_16gvir10_3c_32g 硬切分模板。
  • 改进了多容器 Pod 的设备分配。

已知限制

  • 硬切分 vNPU 可能会在工作负载首次访问设备之前被回收,即使其 Pod 正在运行。对于需要稳定设备访问的工作负载,请使用整卡模式。
  • 部分内存硬切分请求仅支持每个容器一个设备。对于超过一个设备的请求,admission webhook 会返回 vNPU nor supported for multiple devices 并拒绝该请求,且 Pod 可能不会创建。
  • 当前 HAMi 管理的硬切分工作负载不提供工作负载级指标。整卡监控使用 Ascend NPU Exporter 路径,而 HAMi 软切分使用此组件提供的内置 Pod 和 container 指标。
  • 软切分提供 Pod 和 container 内存指标。其计算利用率指标报告的是底层物理设备的利用率,因此共享该设备的工作负载会显示相同的数值。
  • 硬切分需要 driver 支持虚拟设备创建,而软切分需要 driver 支持设备共享。当所需 driver 能力不可用时,请使用整卡模式。
  • 在 v1.4.0 交付默认值 spec.config.create: false 下,仅更改 spec.hamiVnpuCore.enabled 不会更新复用的、由 HAMi 管理的 hami-scheduler-device ConfigMap。请在 spec.nodeConfig 中配置预期目标节点;请参阅 配置 Ascend 切分模式
  • 需要 Ascend Driver 25.5 或更高版本。工作负载镜像中的 CANN libraries 也必须与已安装的 Driver 匹配;对于软切分,还必须与注入的 runtime ABI 匹配。
  • CANN ABI 兼容性约束仅适用于软切分路径,并不定义完整的模型框架支持矩阵;请参阅 兼容性

v1.3.0

Alauda Build of HAMi Ascend Device Plugin v1.3.0 是一个新的由 operator 交付的 device-plugin 组件,适用于 HAMi 管理的 Ascend 分配场景。

新特性与改进

  • 为 HAMi 管理的 Ascend 工作负载新增 Alauda Build of HAMi Ascend Device Plugin
  • 新增通过 HAMi 管理的分配路径支持整卡 Ascend 分配。
  • 新增使用 HAMi scheduler device 模板进行 vNPU 硬切分调度。
  • 新增通过 HAMi Ascend vNPU runtime 路径支持 Ascend vNPU 软切分行为。
  • 为 HAMi 管理的工作负载暴露按型号区分的 Ascend 数量和内存资源。
  • 仅使用已安装的 HAMi 与 HAMi Ascend Device Plugin 包组合所列出的资源名称。不要仅根据芯片型号推断资源名称。

运维说明

  • 在同一组节点上启用 Alauda Build of HAMi Ascend Device Plugin 之前,请先停止原生 Ascend Device Plugin(ascend-device-plugin)。
  • 在节点上更改 device-plugin 所有权后,请在运行工作负载之前确认预期的 Ascend vNPU 资源可被分配。
  • 对于软切分,请为目标节点启用 hamiVnpuCore,并向工作负载添加 huawei.com/vnpu-mode: hami-core。未包含该注解的工作负载将遵循基于模板的 vNPU 路径。
  • 在 v1.3.0 中交付的 Ascend 310P 资源配置下,纯内存请求可能会被规范化为 vir01 3072 MiB 硬切分模板,而不是获得精确请求的配额。