发版日志
目录
4.2.5已修复问题已知问题4.2.4已修复问题已知问题4.2.3已修复问题已知问题4.2.2已修复问题已知问题4.2.1已修复问题已知问题4.2.0功能与增强支持 Kubernetes 1.33ACP CLI (ac)Hosted Control Plane (HCP)增强的用户权限管理借助 Kyverno 增强 Pod 安全策略由 Envoy Gateway 驱动的下一代 Gateway APIEgress Firewall 的基于域名规则新的 Endpoint Health Checker,可实现更快故障切换新的 Local Storage Operator,便于更轻松地管理 Ceph/TopoLVM其他主要变更日志插件生命周期变更命名空间默认安全级别增强MinIO 进入维护模式Calico 进入维护模式Ingress Nginx 已切换为 Operator已弃用和已移除的功能Kubernetes 版本升级策略更新ALB 自 v4.2.0 起弃用Flannel 已完全移除已修复问题已知问题4.2.5
发布日期:2026-06-08
已修复问题
- 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
- 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
- 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
- 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
- captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
- 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
- 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
- metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
已知问题
- 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
- 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
- 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
- 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
- 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
- captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
- 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
- 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
- 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
- metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。
4.2.4
发布日期:2026-03-27
已修复问题
- 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
- image-registry 的 imagePullSecret 以“新建 Secret、删除旧 Secret”的方式自动轮转,仍引用旧 Secret 的存量 Pod 在旧 Secret 失效后重新拉取镜像时会失败。例如 Pod 重建时间超过 1 小时后,其中某个容器异常重启并重新拉取镜像,就会出现拉取失败。该问题已在 v4.2.4 修复。
- 当业务使用自定义 ServiceAccount 时,imagePullSecret 不会被自动注入到该 ServiceAccount,业务无法从集群的镜像仓库拉取镜像。该问题已在 v4.2.4 修复。
- 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。
已知问题
- 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
- 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
- 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
- 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
- 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
- captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
- 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
- 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
- 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
- metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。
4.2.3
发布日期:2026-03-16
已修复问题
- 在4.2.2版本中,平台无法自动同步对接的 LDAP 服务器中的数据,此问题已在4.2.3版本修复。
- 在 4.2.2 版本中,创建项目设置配额以及已有项目更新配额均无法生效,此问题已在4.2.3版本修复。
- 在容器组列表页面批量删除容器组时,操作会提示“权限不足”并删除失败,而逐个删除单个容器组可以成功。该问题已在 v4.2.3 修复,核心管理组件补齐了批量操作所需的 RBAC 权限,批量删除可以正常执行。
- Multus CNI 的服务此前需要以特权用户身份运行,无法满足以非特权用户运行服务的安全加固要求。以非特权用户身份运行 Multus CNI 服务的能力已在 v4.2.3 提供。
- Argo Rollouts 插件在 v4.2.2 上部署失败。该问题已在 v4.2.3 修复。
已知问题
- 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
- 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
- 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
- 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
- metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- image-registry 的 imagePullSecret 以“新建 Secret、删除旧 Secret”的方式自动轮转,仍引用旧 Secret 的存量 Pod 在旧 Secret 失效后重新拉取镜像时会失败。例如 Pod 重建时间超过 1 小时后,其中某个容器异常重启并重新拉取镜像,就会出现拉取失败。该问题已在 v4.2.4 修复。
- 当业务使用自定义 ServiceAccount 时,imagePullSecret 不会被自动注入到该 ServiceAccount,业务无法从集群的镜像仓库拉取镜像。该问题已在 v4.2.4 修复。
- 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。
4.2.2
发布日期:2026-02-11
已修复问题
- 修复了安装 Alauda Container Platform Cluster Enhancer 插件后 etcd 没有定时备份的问题。该问题由升级时创建的 BroadcastJob 缺少 scheduledTimeAnnotation 注解引起,导致 AdvancedCronJob 无法计算下次触发时间。修复后当注解缺失时会使用任务创建时间作为备用方案,确保定时备份正常执行。已在 ACP 4.2.2 修复。
- 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.2.2 修复。
- 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.2.2 修复。
- 本地设备管理的发现设备列表中,系统无法获取存储设备的 DeviceID,符合条件的设备被错误地标记为“不推荐”。该问题已在 v4.2.2 修复,此类设备可以正确展示为“推荐”。
- 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.2.2 修复。
已知问题
- 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
- 在4.2.2版本中,平台无法自动同步对接的 LDAP 服务器中的数据,此问题已在4.2.3版本修复。
- 在 4.2.2 版本中,创建项目设置配额以及已有项目更新配额均无法生效,此问题已在4.2.3版本修复。
- 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
- 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
- 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
- metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。
- 在容器组列表页面批量删除容器组时,操作会提示“权限不足”并删除失败,而逐个删除单个容器组可以成功。该问题已在 v4.2.3 修复,核心管理组件补齐了批量操作所需的 RBAC 权限,批量删除可以正常执行。
- Argo Rollouts 插件在 v4.2.2 上部署失败。该问题已在 v4.2.3 修复。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。
4.2.1
发布日期:2026-01-09
已修复问题
- 在升级 Global 集群时存在一个偶发问题,导致 Web Console 的左侧导航栏中无法看到 Marketplace 菜单。此问题已在 ACP 4.2.1 中修复。
- 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.2.1 中修复。
- 在使用 Global Cluster Disaster Recovery 方案时,安装 Alauda Container Platform etcd Synchronizer 后,Standby Cluster 的 Web Console 无法登录。原因是 etcd Synchronizer 没有正确忽略 k8sadmin-* 相关的 Secret 对象,导致 Standby Cluster 的认证信息被覆盖。此问题已在 ACP 4.2.1 中修复。
- 当 MinIO 使用 HTTPS 协议时,SkipSSLVerify 参数无法跳过 HTTPS 证书校验,选择 MinIO 对象存储类创建的存储桶声明会一直处于不可用状态。该问题已在 v4.2.1 修复。
已知问题
- 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
- 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
- 修复了安装 Alauda Container Platform Cluster Enhancer 插件后 etcd 没有定时备份的问题。该问题由升级时创建的 BroadcastJob 缺少 scheduledTimeAnnotation 注解引起,导致 AdvancedCronJob 无法计算下次触发时间。修复后当注解缺失时会使用任务创建时间作为备用方案,确保定时备份正常执行。已在 ACP 4.2.2 修复。
- 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.2.2 修复。
- 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.2.2 修复。
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
- 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
- 本地设备管理的发现设备列表中,系统无法获取存储设备的 DeviceID,符合条件的设备被错误地标记为“不推荐”。该问题已在 v4.2.2 修复,此类设备可以正确展示为“推荐”。
- 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.2.2 修复。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。
4.2.0
发布日期:2025-12-09
功能与增强
支持 Kubernetes 1.33
ACP 现已支持 Kubernetes 1.33,为您带来来自 Kubernetes 社区的最新上游功能、性能改进和安全增强。
ACP CLI (ac)
新的 ACP CLI (ac) 让您可以通过流畅的命令行体验在 ACP 上开发、构建、部署和运行应用。
主要能力包括:
- 与 kubectl 兼容的命令
- 与 ACP 平台环境集成的认证
- 跨多个环境的统一会话管理
- 用于平台访问和跨环境工作流的 ACP 专属扩展
完整功能详情请参见: ACP CLI (ac)
Hosted Control Plane (HCP)
已发布:
- Alauda Container Platform Kubeadm Provider
- Alauda Container Platform Hosted Control Plane
- Alauda Container Platform SSH Infrastructure Provider
生命周期: Agnostic(与 ACP 异步发布)
Hosted Control Plane 通过将每个集群的控制平面作为容器化组件托管在管理集群中,将控制平面与工作节点解耦。该架构可降低资源消耗,加快集群创建和升级,并为大规模多集群环境提供更好的可扩展性。
更多信息请参见: 关于 Hosted Control Plane
增强的用户权限管理
我们通过以下增强优化了 RBAC 管理,以提升易用性和可维护性:
-
平台角色管理:
- 基于 UI 的权限自定义已弃用: 平台角色不再支持通过 Web 控制台进行自定义权限配置。所有角色权限都必须通过 YAML 文件进行配置。
- 保持向后兼容: 现有的平台预置角色以及旧版本中定义的角色仍可完全正常使用。用户可以继续像以前一样将这些角色分配给用户并授予权限。
-
Kubernetes 角色管理:
- 原生 Kubernetes 角色管理: 平台控制台现已提供专门的 Kubernetes Role 和 ClusterRole 资源管理界面,支持将 Kubernetes 角色直接关联到用户并分配权限。
- 模块化权限定义: 平台插件资源权限将逐步迁移为独立的 Role 和 ClusterRole 资源,从而提供更好的隔离性和更便捷的管理。
借助 Kyverno 增强 Pod 安全策略
我们通过 Kyverno policy engine 增强了工作负载安全能力:
- 即用型安全模板:控制台内置 8 个经过验证的安全策略模板,覆盖 Pod Security Standards 的各个级别,包括 Privileged、Baseline、Nonroot 和 Restricted
- 一键配置:无需手动编写 YAML,即可在业务视图中基于模板快速创建策略,并立即在指定命名空间中生效
由 Envoy Gateway 驱动的下一代 Gateway API
本版本引入了一个基于 Envoy Gateway 的全新 Gateway API 实现。它提供统一的 L7 流量入口,保持与社区 Gateway API 规范一致,并为更丰富的流量策略和生态集成奠定基础。
Egress Firewall 的基于域名规则
Egress Firewall 现已支持基于域名而不仅仅是 IP 地址的允许/拒绝规则。这使得对公共 SaaS 服务以及 IP 地址频繁变化的外部资源可以进行更细粒度的出站访问控制。
新的 Endpoint Health Checker,可实现更快故障切换
我们引入了新的 Endpoint Health Checker,用于更快检测 node 崩溃和网络分区等故障,并及时移除不健康的后端。这显著缩短了流量故障切换时长,并降低了服务中断风险。
新的 Local Storage Operator,便于更轻松地管理 Ceph/TopoLVM
新引入的 Local Storage(Alauda Build of Local Storage)Operator 大幅简化了 Ceph 和 TopoLVM 的部署与磁盘管理。在部署过程中,您可以列出集群中所有可用磁盘,包括型号、容量及其他关键属性,并选择要纳入管理的磁盘。 在磁盘绑定方面,Ceph 和 TopoLVM 现在更倾向于使用 device ID,而不是挂载路径,从而避免因 node 重启或设备重新检测后设备名称变化而导致的存储问题。
其他主要变更
日志插件生命周期变更
日志相关插件的生命周期状态已从 Aligned 更改为 Agnostic(与 ACP 异步发布)。
受影响的插件:
- Alauda Container Platform Log Essentials(本版本新增)
- Alauda Container Platform Log Storage for ClickHouse
- Alauda Container Platform Log Storage for Elasticsearch
- Alauda Container Platform Log Collector
更多信息请参见: 关于 Logging Service
命名空间默认安全级别增强
从 v4.2.0 开始,通过 Web 控制台或 CLI 新建的命名空间,其默认 PSA 策略已从 Baseline 更改为 Restricted。
- Baseline:禁止已知的权限提升,提供中等安全性
- Restricted:遵循 Pod 安全最佳实践,要求最严格
Restricted 策略对 Pod 的配置要求非常严格。如果您的业务需要 privileged 模式、以 root 用户运行、挂载 host 路径或使用 host 网络等能力,这些工作负载将无法在默认策略为 Restricted 的命名空间中运行。
影响分析:
- 此变更仅影响新创建的命名空间
- 需要特权能力的工作负载(例如 root 用户、hostPath 挂载)将无法直接运行
建议的解决方案:
- 修改应用配置,使其满足 Restricted 策略的安全要求
- 如有必要,手动将命名空间策略改回 Baseline
MinIO 进入维护模式
MinIO(Alauda Build of MinIO)已进入 维护模式。未来仅提供安全修复,不再规划新功能。现有 MinIO 集群可以继续运行,而新的对象存储需求建议优先选择 Ceph Object 作为推荐方案。
Calico 进入维护模式
Calico(Alauda Container Platform Networking for Calico)CNI 插件已进入 维护模式。我们将仅处理与安全相关的问题,它也不再是默认推荐的网络选项。现有 Calico 集群仍受支持,而新集群应使用 kube-ovn 作为标准 CNI。
Ingress Nginx 已切换为 Operator
Ingress Nginx(Alauda Build of Ingress Nginx)已从集群插件迁移为基于 Operator 的部署和管理模型。升级后现有 Ingress 资源将继续可用,后续操作预计通过 Operator 完成。尽管上游社区版本的 Ingress Nginx 已不再更新,我们仍将继续为该发行版提供 bug 修复和安全补丁。
已弃用和已移除的功能
Kubernetes 版本升级策略更新
从 ACP 4.2 开始,升级 Kubernetes 版本 不再是可选项。在执行集群升级时,Kubernetes 版本必须与其他平台组件一起升级。 此变更可确保整个集群的版本一致性,并减少未来的维护窗口。
ALB 自 v4.2.0 起弃用
ALB(Alauda Container Platform Ingress Gateway)自 v4.2.0 起标记为弃用。新集群和新用户应优先采用基于 Envoy Gateway 的 Gateway API 作为主要方案。现有使用 ALB 的集群在升级后仍可继续工作,但我们强烈建议尽快规划并执行向 Gateway API 的迁移,以获得长期支持和功能演进。
Flannel 已完全移除
Flannel(Alauda Container Platform Networking for Flannel)CNI 插件已从平台中完全移除。仍在使用 Flannel 的集群必须在升级到此版本或更高版本之前迁移到 kube-ovn。请提前规划并完成迁移,以避免因切换 CNI 而导致的服务中断。
已修复问题
- upmachinepool 资源的 status 字段保存关联的 machine 资源时未做排序,导致每次 reconcile 都被判定为需要更新,审计数据量因此过大。该问题已在 v4.2.0 修复。
- 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.2.0 修复。
- 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
- 因长期未登录而被系统自动禁用的用户,在管理员手动激活后会被再次自动禁用,激活操作无法生效。该问题已在 v4.2.0 修复。
- 从集群卸载 Operator 后,其状态会被错误地显示为 Absent,而实际状态仍为 Ready,需要通过 violet upload 手动重新上传才能恢复。该问题已在 v4.2.0 修复,卸载后 Operator 会正确显示为 Ready。
- 使用 violet upload 上传 Operator 新版本后,偶尔会出现无法选择并安装该新版本的情况。该问题已在 v4.2.0 修复。
- 当 Operator 或 Cluster Plugin 中包含多个前端扩展时,点击这些扩展的左侧导航可能没有任何反应。此前的临时规避方式是为扩展的 ConfigMap 添加注解 cpaas.io/auto-sync: "false"。该问题已在 v4.2.0 修复,不再需要该临时规避方式。
- 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
- 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
- 使用 violet upload 上传文件夹中的多个 package 时,上传会因磁盘空间不足而失败。该问题已在 v4.2.0 修复,violet 会及时自动清理已上传的 package,不再出现该错误。
- 将命名空间导入项目时,在导入过程中调整容器组安全策略级别(例如由 Baseline 改为 Restricted)不会生效,导入完成后命名空间详情页显示的仍是原有级别。该问题已在 v4.2.0 修复,导入时设置的安全策略级别会正确保存。
- 从 v3.x 升级到 v4.x 时,若 global 集群已升级而业务集群未升级,业务集群中 Application、Deployment 等负载的监控面板无法显示。该问题已在 v4.2.0 修复。
- 在 Kubernetes 版本低于 1.30 的环境中进行升级时,KubeVirt Operator 可能部署失败。该问题已在 v4.2.0 修复。
- 在配置管理中创建的 Image Registry 类型凭据只保存了用户名和密码,缺少 kubectl create secret docker-registry 会生成的 auth 认证字段,依赖完整认证信息的镜像构建工具(如 buildah)使用该凭据推送镜像时会提示无权限。该问题已在 v4.2.0 修复,控制台创建的凭据与命令行创建的凭据包含相同的完整认证信息。
已知问题
- 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
- 在升级 Global 集群时存在一个偶发问题,导致 Web Console 的左侧导航栏中无法看到 Marketplace 菜单。此问题已在 ACP 4.2.1 中修复。
- 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.2.1 中修复。
- 在使用 Global Cluster Disaster Recovery 方案时,安装 Alauda Container Platform etcd Synchronizer 后,Standby Cluster 的 Web Console 无法登录。原因是 etcd Synchronizer 没有正确忽略 k8sadmin-* 相关的 Secret 对象,导致 Standby Cluster 的认证信息被覆盖。此问题已在 ACP 4.2.1 中修复。
- 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
- 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
- 当 MinIO 使用 HTTPS 协议时,SkipSSLVerify 参数无法跳过 HTTPS 证书校验,选择 MinIO 对象存储类创建的存储桶声明会一直处于不可用状态。该问题已在 v4.2.1 修复。
- 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
- 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。
解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。 - ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。 - 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。 - 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
- 当 Helm Chart 中设置了 pre-delete post-delete hook。
执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。