发版日志

请结合 Kubernetes Support MatrixVersion and Lifecycle 以及特性相关文档查看 release notes,以了解发版变更和准确的支持边界。

4.4.0

发布日期:2026-08-18

功能和增强

Kubernetes 1.35 和升级就绪检查

4.4 将平台基线升级到 Kubernetes 1.35。在升级之前,请确认每个生产节点都满足新的 Kubernetes 要求:内核版本必须为 5.8 或更高,并且节点必须使用 cgroup v2。升级预检会阻止升级,直到管理员确认这些检查已完成为止。

有关必需检查和确认操作步骤,请参见 Prepare for an UpgradeUpgrade a Global Cluster

更一致的平台安装和升级

4.4 提升了安装和升级的可靠性。在新的 global 集群上,upgrade-management 组件会自动安装。平台组件也会按固定的依赖顺序安装,从而减少在独立安装可选平台服务时发生的安装和升级失败。

有关升级操作步骤,请参见 Upgrade

日志收集插件更新

以下更新由独立版本发布的 Log Collection 插件提供。匹配的插件版本可能在 ACP 4.4 平台版本之后发布;请在软件包可用时进行安装。其产品文档和 release notes 将提供详细的配置和升级操作步骤。

  • Vector 日志收集 — Log Collection 插件将日志收集器切换为 Vector。Vector 为大日志量场景提供更高性能的收集路径,并提供从先前收集器迁移的路径。
  • OpenSearch 日志存储 — 匹配的插件版本将其内嵌的 Elasticsearch 服务替换为连接到由客户提供的 OpenSearch 服务。新的日志数据将写入 OpenSearch。现有 Elasticsearch 数据不会自动迁移,可作为只读历史数据保留。插件版本文档将说明受支持的历史数据处理方式和升级操作步骤。

平台镜像源

对于新的生产部署, 4.4 更改了推荐的平台镜像源策略:使用外部镜像仓库,可以是贵组织现有的仓库,也可以是单独部署的仓库。将其用作平台、已管理集群和插件的中心镜像源。

平台内置仓库仍受支持,但它不再是新生产环境的推荐默认方案。

有关仓库要求、负载上传、安装、验证、升级准备和故障排查,请参见 Prepare an External Platform Image Registry

ACP 4.4 交付周期中的下一次独立版本组件发布,将允许基于 Alauda OS 的 Workload Cluster 独立使用第三方仓库,而不依赖 Global Cluster 仓库。这使您可以在地理上分离的环境中,将镜像源放置得更靠近 Workload Cluster。相关产品文档和 release notes 将在该组件版本可用后说明受支持的场景和配置。

应用镜像和工作负载操作

  • 用于应用镜像的 Operator-managed Registry v2 — ACP 提供一个由 operator 管理的集成式仓库,供应用开发人员和工作负载推送、拉取和管理应用镜像。管理员可以从 OperatorHub 安装它,并配置存储、命名空间范围访问以及受管理的 ServiceAccount 拉取密钥。工作负载使用集群内的 Registry 服务;在需要时,管理员可以将其暴露给开发人员机器和 CI。它支持按照配置的保留策略定期清理镜像;当您需要回收未引用的存储时,请单独运行 registry 垃圾回收。旧版 Registry Cluster Plugin 对现有旧部署仍可用。有关安装、配置、访问和清理操作步骤,请参见 Registry v2 administration

  • 基于策略的工作负载再平衡 — 当工作负载因利用率、节点配置、亲和性、污点或拓扑发生变化后需要重新平衡时,请安装 Alauda Build of Descheduler 集群插件。该插件会根据已配置的策略驱逐符合条件的 Pod;对于由控制器管理的 Pod,默认调度器会在驱逐后放置替代 Pod。它默认不安装,不会自行调度替代 Pod,并会遵守 PodDisruptionBudgets。有关安装、策略和验证指导,请参见 Workload Rebalancing (Descheduler)

  • 原地调整 Pod 资源大小 — ACP 4.4 提供了在目标集群支持的情况下,使用 Kubernetes Pod resize 子资源调整运行中 Pod 的 CPU 和内存请求及限制的指导。请使用 kubectl 或支持该子资源的 API 客户端。这不是通用的 web 控制台编辑功能,并且 resizePolicy 决定容器是否必须重启;VPA InPlaceOrRecreate 仍然可以回退到重建 Pod。有关前提条件、示例和限制,请参见 Adjust Pod Resource Levels Without Pod Disruption

  • PodDisruptionBudget 运行指导 — 新的操作和 API 指导说明了如何使用 minAvailablemaxUnavailable 在节点 drain、维护和升级等自愿性中断期间保护已复制的工作负载。PodDisruptionBudget 无法保护工作负载免受节点硬件故障等非自愿性故障的影响。有关示例和 API 详情,请参见 Using PodDisruptionBudgets

监控、监控面板和成本管理

  • Perses 监控面板 — 使用 Perses 监控面板体验创建和管理指标监控面板,导入受支持的 Perses 或 Grafana 监控面板 JSON,并在需要时迁移现有的 MonitorDashboard 资源。现有 Monitoring Dashboards 在过渡期间仍可使用。有关详情,请参见 Perses Monitoring Dashboards

  • Fleet Monitoring — 平台管理员可以在一个多集群视图中查看已连接集群、监控数据新鲜度、资源容量和利用率,以及项目配额分配和使用情况。Fleet Monitoring 是对单个集群的详细监控和故障排查的补充,而不是替代。有关详情,请参见 Fleet Monitoring

  • 用于成本管理的 VictoriaMetrics — Cost Management 和计量可使用 VictoriaMetrics 作为指标数据源。查询会限定在相关集群范围内,从而帮助确保在多集群环境中返回的是正确集群的成本和资源使用数据。有关详情,请参见 Cost Management

网络

  • SR-IOV 支持 4.4 支持将 SR-IOV 网络接口直接透传给 Pod,因此网络密集型工作负载,例如运营商核心网应用,可以运行在该平台上。

  • OVN 安全组 FQDN 规则 — SecurityGroup 规则支持域名(FQDN)匹配,因此管理员可以使用域名而不仅仅是静态 IP 或 CIDR 目标来定义出站策略。

  • OVN 数据库 SSL 加密 — 与 OVN 数据库的连接可以使用 SSL 加密,包括基于证书的访问和证书轮换,从而提升控制平面通信安全性。

  • AdminNetworkPolicy GA — AdminNetworkPolicy 已适配新的 API 版本,并正式可用,支持 web 控制台管理。有关详情,请参见 Admin Network Policy

  • IPVLAN CNI binary — Kube-OVN 交付版本现在与 macvlan 一起提供 ipvlan CNI binary,从而支持第二网络接口场景,例如在 underlay BGP fabric 上进行 VIP 出站流量。

  • Gateway 和 Ingress 可观测性 — 新的监控面板覆盖 Ingress Controller 和 Gateway,MetalLB 监控面板增加了 BGP 会话状态和 IP 地址池利用率。ingress-nginx 增加了 OpenTelemetry 支持以及对其指标端点的认证访问。

  • 可视化 IP 池管理 — 可从 web 控制台创建和管理 IP 池,以便在多 VLAN 集群中进行细粒度 IP 管理。

存储

  • 统一的存储组件管理 — Alauda storage operator 成为存储组件的统一入口点,负责管理内置 Ceph、TopoLVM、本地存储和外部 Ceph 的安装、升级、状态和依赖关系。

  • Ceph 传输中和静态加密 — Ceph 支持传输中加密和由 KMS 支持的静态加密。有关详情,请参见 In-Transit EncryptionPersistent Volume Encryption

  • Ceph 多网卡网络 — Ceph 容器网络支持多个网络接口,将客户端流量与复制流量分离。

  • 对象存储可用性 — 可查看、监控和告警 CephObjectStoreUser 的配额使用情况。Bucket claim Secret 暴露标准的 accessKey/secretKey 字段,AWS SDK 和常用工具可直接消费这些字段,并且控制台会显示与每个 bucket claim 关联的 Secret。

虚拟化

  • CPU 和内存热插拔 — 无需关闭虚拟机即可为运行中的虚拟机添加 CPU 和内存。有关操作步骤和 guest OS 支持详情,请参见 CPU and Memory Hotplug

  • 物理 GPU 直通 — 将物理 GPU 直接挂载到虚拟机,以支持 GPU 加速工作负载。

  • 虚拟机迁移(V2V) — 集成 forklift 插件,将传统虚拟化平台上的虚拟机迁移到

Global Cluster 灾难恢复增强

Global Cluster Disaster Recovery 仍然支持传统操作系统部署和基于 Alauda OS 的 Immutable Infrastructure 部署。在 4.4 中,同步路径更具弹性,并覆盖了更多 global 集群生命周期。此能力保护 global 控制平面;它不保护应用数据。

现在,备用集群会保留活动集群的更新顺序,包括当恢复耗时足以让活动 etcd 压缩其历史记录时。DR 配置可以在平台组件发生变化时自适应,而无需替换 DR 服务。备用集群还会接收 global 集群升级状态和 workload cluster 生命周期信息,因此具备更安全接管所需的信息。

在 DR 切换之前,或者在支持 DR 的 global 集群升级移除 synchronizer 之前,请继续验证活动集群和备用集群保持一致。这可以防止过期的备用数据导致错误的恢复操作。

有关详情,请参见 Global Cluster Disaster RecoveryImmutable Infrastructure 上的 Global Cluster Disaster Recovery

Alauda OS 备份和恢复

使用 Alauda OS 的集群现在可以使用 Cluster Enhancer 进行 etcd 备份和恢复。您可以运行定时或按需备份,将其保留在控制平面节点上,并可选择在 S3 兼容对象存储中保留额外副本。这可以保护集群配置数据;etcd 恢复会覆盖现有的 etcd 数据,且必须按照文档化的恢复操作步骤执行。

有关配置和恢复步骤,请参见 etcd Backup and Restore

访问和授权

  • Violet API 令牌发布violet 是用于打包和发布插件的 CLI,现在在向平台发布软件包时接受平台 API 令牌。管理员和自动化流程可以无需交互式登录即可发布。可从 Customer Portal 下载 violet。有关详情,请参见 Upload Packages

  • 平台内 CLI 下载 — 用户可从 web 控制台下载适用于 Linux(amd64arm64)、macOS(amd64arm64)以及 Windows(amd64)的 ACP CLI 软件包。

  • 更安全的角色委派 — 平台会阻止用户授予超过其自身授权边界的权限。控制台还包含相关的 ClusterRole 能力。

Immutable Infrastructure

4.4 继续扩展针对 Alauda OS 的文档化 Immutable Infrastructure 路径,该操作系统是所文档化的提供商场景中不可变节点的受支持操作系统。以下能力在其受支持的提供商场景中可用:

  • Bare Metal 集群生命周期 — 在受支持的 Bare Metal 环境中创建和管理 global 集群和 workload 集群。global 集群路径包含 Global Cluster Disaster Recovery。
  • 控制平面和存储韧性 — 通过提供商放置规则或在没有负载均衡器时自建控制平面 VIP 提升控制平面可用性,并在滚动升级期间节点被替换时保留已声明的本地磁盘。
  • Huawei DCS 上的 Alauda OS 节点存储 — Huawei DCS Provider v1.0.16 或更高版本支持专用的 /var/lib/kubelet/var/lib/containerd 磁盘。当磁盘被声明为持久化时,提供商会在滚动节点替换期间将其卸载并重新挂载,从而降低系统盘上的 Btrfs I/O 压力并保护已声明的节点本地数据。
  • 网络和主机配置 — 在受支持的情况下,可为节点流量隔离配置多个网络接口。在 Huawei Cloud Stack 上,节点可以同时保留其短主机名和 FQDN。
  • Alauda OS 的 Huawei DCS Provider 兼容性 — 对于使用 ACP v4.3.2 或更高版本的 Alauda OS 镜像的 Huawei DCS 集群,包括 ACP v4.4.0 及更高版本,请安装 Huawei DCS Provider v1.0.21 或更高版本。请从同一 ACP 版本的 OS Support Matrix 行中选择 Alauda OS 镜像。不要将 DCS Provider v1.0.21 或更高版本与早于 v4.3.2 的 ACP 版本对应的 Alauda OS 镜像搭配使用。请参见 Huawei DCS 的 Alauda OS 和 Provider 兼容性
  • 更安全的 Huawei DCS 虚拟机操作 — 在删除虚拟机节点之前先停止虚拟机,并在启动后移除启动 CD-ROM 挂载,以免其阻止后续虚拟机迁移。

有关您的提供商和确切受支持版本,请参见 About Immutable Infrastructure 及其提供商 release notes。

即将发布的 Immutable Infrastructure 提供商版本

以下更新计划在 ACP 4.4 交付周期中的独立版本提供商发布中推出。仅升级 ACP 到 4.4.0 不会安装它们;请在相应的提供商版本可用时使用匹配版本。提供商产品文档和 release notes 将发布详细的支持边界和操作步骤。

  • VMware vSphere 固定地址节点生命周期 — VMware vSphere Provider 更新改进了 MachineConfigPool 健康状况和引导诊断、持久盘和临时盘处理,以及固定地址节点的滚动更新保护。管理员有意为了维护而关闭的虚拟机可以保持关闭状态。

弃用和移除

  • 移除 System ALB — 4.4 中移除了平台级系统 ALB。
  • 移除 MinIO Operator — 从 4.4 开始,平台不再随附 MinIO Operator。请使用 Ceph 对象存储作为 S3 兼容对象存储。

已修复问题

  • 修复 metis 组件 storage limit 配置太小,在超出限制后导致 metis 容器重启

已知问题

  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

相关产品站点

以下产品站点提供组件相关文档、兼容性信息、升级指导,以及已发布的 release notes。它们的版本和发布计划独立于 ACP 4.4,因此产品文档和 release notes 可能在 ACP 4.4 平台发布之后发布。