发版日志
请使用 版本和组件 查看当前 Marketplace 版本、组件角色和安装链接。以下章节记录了每个发版的变更和限制。
有关 NVIDIA GPU 指标变更,请参阅 NVIDIA GPU 文档 中 Alauda Build of DCGM-Exporter 的发版日志。有关 Ascend NPU 指标变更,请参阅 Ascend NPU 文档 中的 NPU Exporter 信息。
目录
Alauda Build of HAMiv2.9.0新特性与改进升级说明v2.8.3已修复问题v2.8.1新特性与改进已修复问题v2.7.1新特性与改进已修复问题v2.6.1已修复问题v2.6.0新特性与改进已修复问题Alauda Build of HAMi-WebUIv1.10.3已修复问题安全升级说明已知限制v1.10.2新特性与改进已修复问题安全升级说明Alauda Build of HAMi Ascend Device Pluginv1.4.0新特性与改进已知限制v1.3.0新特性与改进运维说明Alauda Build of HAMi
v2.9.0
Alauda Build of HAMi v2.9.0 是当前用于 HAMi 共享、虚拟化和调度的正式版 Alauda 发版。它以 ACP 集群插件形式交付,提供 amd64、arm64 和多架构(ALL)包。
新特性与改进
- 为需要显式选择 scheduler 镜像的部署添加了完整的自定义 kube-scheduler 镜像路径。
- Alauda 交付包为带污点的加速器节点上的 HAMi scheduler 和 device-plugin 工作负载配置了标准 toleration。
- 从 v2.9.0 release tag 刷新了正式版 HAMi chart、runtime 镜像和 ACP plugin 包。
升级说明
- 升级前,请确认目标 ACP 版本、后端路径、节点 taint,以及当前暴露的 HAMi 资源键。
- 如果需要自定义 scheduler 镜像,请通过 HAMi plugin 参数配置
scheduler.kubeScheduler.customImage;当其为空时,镜像将根据目标集群的 Kubernetes 版本和已配置的镜像仓库生成。 - 升级后,请验证 HAMi scheduler 和 device-plugin 的就绪状态、节点可分配资源键、ACP 配额元数据,以及 验证 中的一个代表性工作负载。
v2.8.3
已修复问题
- 修复了当
GetMemoryInfo返回NOT_SUPPORTED时,对统一内存 GPU 的内存信息处理问题。 - 修复了 v2.8.2 中 HAMi-Core 监控问题。
- 修复了在工作负载未指定
nvidia.com/gpucores时 device utilization watcher 的启动问题。
v2.8.1
新特性与改进
- 新增华为昇腾 NPU 共享支持。
- 新增 NVIDIA 设备 CDI 模式支持。
- 与 NVIDIA Kubernetes Device Plugin v0.18.0 同步。
- 新增
hami_build_infoPrometheus 指标和版本输出。 - 新增 TLS 证书监听和热加载,无需重启 Pod。
- 新增 NVIDIA GPU Operator toolkit 就绪检查。
- 新增 GPUDirect RDMA copy(GDRCopy)和 GPUDirect Storage(GDS)配置支持。
- 新增 mock device plugin 支持,适用于测试环境。
- 为兼容 HAMi v2.8,将 HAMi-WebUI 升级到 v1.10.0。HAMi-WebUI v1.10.0 兼容 HAMi v2.7 和 v2.8。HAMi-WebUI v1.5.0 与 HAMi v2.8 不兼容。
已修复问题
- 更新 HAMi-Core 以修复与 vLLM 相关的问题。
- 修复了在使用多个 GPU 时,vLLM 0.18 之后版本的启动失败问题。
- 修复了配额计算错误。
- 修复了 MIG 实例分配错误,避免 scheduler 选择错误的 MIG 实例。
- 将
nvidia-mig-parted升级到 v0.12.2 以修复安全问题。 - 修复了从 GPU 节点移除 device plugin 后,GPU 节点仍然可见的旧状态问题。
- 修复了并发 map 读写错误。
- 修复了 device NUMA 获取逻辑。
- 修复了更改 release 名称或 chart 名称时的 ClusterRoleBinding 错误。
v2.7.1
新特性与改进
- 为 ACP 4.2 及更高版本新增 NVIDIA GPU ResourceQuota 支持。
- 新增聚合的调度失败事件。
- 将节点锁超时设为可配置。
已修复问题
- 修复了从某个 GPU 节点移除 device plugin 后,该节点仍可被调度的问题。
v2.6.1
已修复问题
- 修复了工作负载使用
cuMallocAsync分配内存时的设备内存计量问题。 - 修复了
gpu_burn的设备内存计量问题。 - 修复了某些场景下的段错误。
- 修复了工作负载使用多个设备时的利用率指标问题。
- 修复了使用张量并行度大于 2 的 vLLM 时的初始化错误。
v2.6.0
新特性与改进
- 优化了 scheduler 日志。
- 新增 Enflame GCU 共享支持。
- 新增 Metax GPU 和 Metax sGPU 支持。
- 新增 Helm Chart 校验和注解,使 HAMi 组件在 ConfigMap 变更后重启。
- 新增 NVIDIA 设备的 RuntimeClass 支持。
- 新增通过
net/http/pprof的分析功能。 - 在节点上新增 NVIDIA GPU 拓扑评分注册。
- 在 vGPU 监控中新增 MIG 信息指标。
已修复问题
- 修复了与 NVIDIA driver 570+ 的兼容性问题。
- 修复了 ComfyUI 任务中的设备内存计量问题。
- 修复了 Cambricon 设备分配问题。
- 修复了错误日志以及容器请求设备数量错误。
- 修复了不一致的
vgpu-devices-allocated注解。 - 修复了 node manager 中的旧节点设备问题。
- 修复了动态 GPU partitioning 中缺少单 GPU 粒度的问题。
- 修复了
cuMallocAsync上的设备内存计量问题。 - 修复了 MIG 任务意外运行在
hami-coreGPU 上时的 scheduler 崩溃问题。 - 修复了多进程设备内存计量问题。
Alauda Build of HAMi-WebUI
v1.10.3
发布日期:2026-07-27
Alauda Build of HAMi-WebUI v1.10.3 是面向 HAMi v2.9.x 的补丁发版。它可通过 Customer Portal 和 AC CN/IO 获取,提供 amd64、arm64 和多架构(ALL)集群插件包。该 plugin 使用上游 HAMi-WebUI v1.2.0 应用基线。
已修复问题
- 将任务列表名称过滤改为搜索每一行所代表的 Pod 或工作负载名称。内部容器名称不作为任务列表名称过滤条件。
- 修复了包含 init container 的 Pod 的设备分配注解解码问题。现在分配位置会遵循完整的 init-container 加常规 container 顺序。
- 修正了 MLU 设备分配注解解码。
安全
- 升级 Go toolchain、gRPC 和
golang.org/x/*依赖,以清除当前所有可修复的后端发现。 - 升级了存在漏洞的前端依赖,包括
body-parser,且未改变 plugin 形式或 WebUI 工作流。 - 已发布的后端和前端镜像通过了 Critical 和 High 漏洞门禁。由于没有可用的上游修复版本,
go-kratos/kratosv2.7.3 中的CVE-2026-6993仍然是 Medium 级别发现。
升级说明
- 请通过 ACP 集群插件页面从 v1.10.2 升级。保留 Prometheus 地址和主机端口选择。
- 请基于当前监控 Secret 重新生成 Prometheus 认证值。插件表单中填写的值必须包含
Basic前缀。 - 升级后,请验证后端 Prometheus 查询返回 JSON,并且 Pod 名称任务过滤条件返回预期行。
已知限制
- HAMi-WebUI v1.10.3 查询的是 HAMi 2.9 的指标名称。请勿与 HAMi 2.8.x 一起使用;否则受影响的利用率视图可能一直显示为 0。
- 任务列表是 Pod 级别的。名称过滤器有意不搜索内部容器名称。
v1.10.2
Alauda Build of HAMi-WebUI v1.10.2 引入了 HAMi 2.9 指标名称更新,并已被用于新的 HAMi 2.9.x 部署的 v1.10.3 取代。
新特性与改进
- 新增级联过滤下拉框,使过滤选项限定于当前选择范围。
- 优化了监控概览图表,并新增了工作负载洞察。
- 改进了节点详情页图表显示,并修复了时间选择器国际化问题。
- 更新指标以兼容 HAMi v2.9.0。
已修复问题
- 将
/metrics调整为可安全抓取,并减少页面侧查询扇出,以提升大规模集群性能,避免指标超时或内存不足问题。 - 通过恢复
lodash4.17.21,修复了由损坏的lodash依赖版本导致的空白页面问题。
安全
- 将后端升级到 Go 1.26.3,以修复 8 个 Go standard library CVE:CVE-2026-33811、CVE-2026-33814、CVE-2026-39820、CVE-2026-39823、CVE-2026-39825、CVE-2026-39826、CVE-2026-39836 和 CVE-2026-42499。
- 升级前端依赖,包括
axios1.16.0、follow-redirects1.16.0、postcss8.5.10、qs6.15.2 和ws8.20.1,以修复 23 个 Node CVE。
升级说明
- 支持的升级路径为 v1.10.0 到 v1.10.2。此发版未记录 breaking changes。
Alauda Build of HAMi Ascend Device Plugin
v1.4.0
发布日期:2026-07-29
Alauda Build of HAMi Ascend Device Plugin v1.4.0 是一个 Technical Preview operator 插件,用于部署和管理 HAMi Ascend 整卡分配、硬切分和软切分。
新特性与改进
- 新增按节点控制,可将设备排除在 HAMi 管理之外,并配置虚拟设备数量。
- 在配置为软切分的节点上自动启用设备共享。
- 为软切分工作负载新增内置 Prometheus 监控,并支持可选的
ServiceMonitor集成。 - 为 Ascend 910C 新增
vir05_1c_16g和vir10_3c_32g硬切分模板。 - 改进了多容器 Pod 的设备分配。
已知限制
- 硬切分 vNPU 可能会在工作负载首次访问设备之前被回收,即使其 Pod 正在运行。对于需要稳定设备访问的工作负载,请使用整卡模式。
- 部分内存硬切分请求仅支持每个容器一个设备。对于超过一个设备的请求,admission webhook 会返回
vNPU nor supported for multiple devices并拒绝该请求,且 Pod 可能不会创建。 - 当前 HAMi 管理的硬切分工作负载不提供工作负载级指标。整卡监控使用 Ascend NPU Exporter 路径,而 HAMi 软切分使用此组件提供的内置 Pod 和 container 指标。
- 软切分提供 Pod 和 container 内存指标。其计算利用率指标报告的是底层物理设备的利用率,因此共享该设备的工作负载会显示相同的数值。
- 硬切分需要 driver 支持虚拟设备创建,而软切分需要 driver 支持设备共享。当所需 driver 能力不可用时,请使用整卡模式。
- 在 v1.4.0 交付默认值
spec.config.create: false下,仅更改spec.hamiVnpuCore.enabled不会更新复用的、由 HAMi 管理的hami-scheduler-deviceConfigMap。请在spec.nodeConfig中配置预期目标节点;请参阅 配置 Ascend 切分模式。 - 需要 Ascend Driver 25.5 或更高版本。工作负载镜像中的 CANN libraries 也必须与已安装的 Driver 匹配;对于软切分,还必须与注入的 runtime ABI 匹配。
- CANN ABI 兼容性约束仅适用于软切分路径,并不定义完整的模型框架支持矩阵;请参阅 兼容性。
v1.3.0
Alauda Build of HAMi Ascend Device Plugin v1.3.0 是一个新的由 operator 交付的 device-plugin 组件,适用于 HAMi 管理的 Ascend 分配场景。
新特性与改进
- 为 HAMi 管理的 Ascend 工作负载新增
Alauda Build of HAMi Ascend Device Plugin。 - 新增通过 HAMi 管理的分配路径支持整卡 Ascend 分配。
- 新增使用 HAMi scheduler device 模板进行 vNPU 硬切分调度。
- 新增通过 HAMi Ascend vNPU runtime 路径支持 Ascend vNPU 软切分行为。
- 为 HAMi 管理的工作负载暴露按型号区分的 Ascend 数量和内存资源。
- 仅使用已安装的 HAMi 与 HAMi Ascend Device Plugin 包组合所列出的资源名称。不要仅根据芯片型号推断资源名称。
运维说明
- 在同一组节点上启用
Alauda Build of HAMi Ascend Device Plugin之前,请先停止原生 Ascend Device Plugin(ascend-device-plugin)。 - 在节点上更改 device-plugin 所有权后,请在运行工作负载之前确认预期的 Ascend vNPU 资源可被分配。
- 对于软切分,请为目标节点启用
hamiVnpuCore,并向工作负载添加huawei.com/vnpu-mode: hami-core。未包含该注解的工作负载将遵循基于模板的 vNPU 路径。 - 在 v1.3.0 中交付的 Ascend 310P 资源配置下,纯内存请求可能会被规范化为
vir013072 MiB 硬切分模板,而不是获得精确请求的配额。