发版日志

4.2.5

发布日期:2026-06-08

已修复问题

  • 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
  • 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
  • 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
  • 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
  • captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
  • 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
  • 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。

已知问题

  • 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
  • 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
  • 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
  • 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
  • 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
  • captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
  • 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.2.4

发布日期:2026-03-27

已修复问题

  • 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
  • image-registry 的 imagePullSecret 以“新建 Secret、删除旧 Secret”的方式自动轮转,仍引用旧 Secret 的存量 Pod 在旧 Secret 失效后重新拉取镜像时会失败。例如 Pod 重建时间超过 1 小时后,其中某个容器异常重启并重新拉取镜像,就会出现拉取失败。该问题已在 v4.2.4 修复。
  • 当业务使用自定义 ServiceAccount 时,imagePullSecret 不会被自动注入到该 ServiceAccount,业务无法从集群的镜像仓库拉取镜像。该问题已在 v4.2.4 修复。
  • 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。

已知问题

  • 在包含五个控制平面节点的业务集群上扩容控制平面节点时,部分请求偶发返回 401,导致集群节点列表无法加载。该问题已在 v4.2.5 修复。
  • 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
  • 向内置镜像仓库推送包含超多数据层(100+)的容器镜像时会失败。该问题已在 v4.2.5 修复。
  • 在平台管理的分布式存储页面中,Ceph 存储池的用量监控条按“已使用逻辑存储量 / 理论上 OSD 还能写入的最大逻辑数据量”计算,导致 OSD 实际仍有约 50% 可用空间时监控条已爆红,容易被误判为需要扩容。该问题已在 v4.2.5 修复。
  • 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
  • captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 captain worker 数量的能力已在 v4.2.5 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
  • 在 u2o 模式下,不同 underlay 子网之间可以意外互通。该问题已在 v4.2.5 修复,underlay 子网之间已实现隔离,跨子网访问可交由外部物理网络设备的策略控制。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 向集群添加新节点后,Multus 插件偶现不在该节点上生效。该问题已在 v4.2.5 修复。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.2.3

发布日期:2026-03-16

已修复问题

  • 在4.2.2版本中,平台无法自动同步对接的 LDAP 服务器中的数据,此问题已在4.2.3版本修复。
  • 在 4.2.2 版本中,创建项目设置配额以及已有项目更新配额均无法生效,此问题已在4.2.3版本修复。
  • 在容器组列表页面批量删除容器组时,操作会提示“权限不足”并删除失败,而逐个删除单个容器组可以成功。该问题已在 v4.2.3 修复,核心管理组件补齐了批量操作所需的 RBAC 权限,批量删除可以正常执行。
  • Multus CNI 的服务此前需要以特权用户身份运行,无法满足以非特权用户运行服务的安全加固要求。以非特权用户身份运行 Multus CNI 服务的能力已在 v4.2.3 提供。
  • Argo Rollouts 插件在 v4.2.2 上部署失败。该问题已在 v4.2.3 修复。

已知问题

  • 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
  • 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
  • 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • image-registry 的 imagePullSecret 以“新建 Secret、删除旧 Secret”的方式自动轮转,仍引用旧 Secret 的存量 Pod 在旧 Secret 失效后重新拉取镜像时会失败。例如 Pod 重建时间超过 1 小时后,其中某个容器异常重启并重新拉取镜像,就会出现拉取失败。该问题已在 v4.2.4 修复。
  • 当业务使用自定义 ServiceAccount 时,imagePullSecret 不会被自动注入到该 ServiceAccount,业务无法从集群的镜像仓库拉取镜像。该问题已在 v4.2.4 修复。
  • 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.2.2

发布日期:2026-02-11

已修复问题

  • 修复了安装 Alauda Container Platform Cluster Enhancer 插件后 etcd 没有定时备份的问题。该问题由升级时创建的 BroadcastJob 缺少 scheduledTimeAnnotation 注解引起,导致 AdvancedCronJob 无法计算下次触发时间。修复后当注解缺失时会使用任务创建时间作为备用方案,确保定时备份正常执行。已在 ACP 4.2.2 修复。
  • 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.2.2 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.2.2 修复。
  • 本地设备管理的发现设备列表中,系统无法获取存储设备的 DeviceID,符合条件的设备被错误地标记为“不推荐”。该问题已在 v4.2.2 修复,此类设备可以正确展示为“推荐”。
  • 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.2.2 修复。

已知问题

  • 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
  • 在4.2.2版本中,平台无法自动同步对接的 LDAP 服务器中的数据,此问题已在4.2.3版本修复。
  • 在 4.2.2 版本中,创建项目设置配额以及已有项目更新配额均无法生效,此问题已在4.2.3版本修复。
  • 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 在 underlay 网络中使用 MetalLB + ALB 高可用方案时,新建一个 LoadBalancer 并将其 ExternalTrafficPolicy 设置为 Local 后,OVN Load_Balancer 表中的 ip_port_mapping 字段会被新 Service 覆盖,已有的 ALB 实例随之从集群外部不可达。该问题已在 v4.2.5 修复。
  • 升级到 v4.2.2 后,平台会产生大量 OVN 变更请求的审计记录,导致审计数据过大。该问题已在 v4.2.5 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.2.5 修复,限额已调整为合理值。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • 推送超过 1GB 的大镜像时,Registry Proxy 默认 30 秒的转发超时会中断连接,客户端最终推送失败。该问题已在 v4.2.4 修复,Proxy 组件的 HTTP 转发超时时间已延长并开启流式转发,大数据量传输的效率与稳定性得到提升。
  • 在容器组列表页面批量删除容器组时,操作会提示“权限不足”并删除失败,而逐个删除单个容器组可以成功。该问题已在 v4.2.3 修复,核心管理组件补齐了批量操作所需的 RBAC 权限,批量删除可以正常执行。
  • Argo Rollouts 插件在 v4.2.2 上部署失败。该问题已在 v4.2.3 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.2.1

发布日期:2026-01-09

已修复问题

  • 在升级 Global 集群时存在一个偶发问题,导致 Web Console 的左侧导航栏中无法看到 Marketplace 菜单。此问题已在 ACP 4.2.1 中修复。
  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.2.1 中修复。
  • 在使用 Global Cluster Disaster Recovery 方案时,安装 Alauda Container Platform etcd Synchronizer 后,Standby Cluster 的 Web Console 无法登录。原因是 etcd Synchronizer 没有正确忽略 k8sadmin-* 相关的 Secret 对象,导致 Standby Cluster 的认证信息被覆盖。此问题已在 ACP 4.2.1 中修复。
  • 当 MinIO 使用 HTTPS 协议时,SkipSSLVerify 参数无法跳过 HTTPS 证书校验,选择 MinIO 对象存储类创建的存储桶声明会一直处于不可用状态。该问题已在 v4.2.1 修复。

已知问题

  • 平台对接 IDP 用户认证登录时,若用户名存在大写字母,ArgoCD 将无法正常获取该用户的权限信息。该问题已在 4.2.4 版本解决。
  • 在主备容灾部署中执行升级时,主备两侧可能同时更新基础信息,导致业务集群的模块信息不一致,升级脚本随后报失败。目前没有经过确认的规避方式。
  • 修复了安装 Alauda Container Platform Cluster Enhancer 插件后 etcd 没有定时备份的问题。该问题由升级时创建的 BroadcastJob 缺少 scheduledTimeAnnotation 注解引起,导致 AdvancedCronJob 无法计算下次触发时间。修复后当注解缺失时会使用任务创建时间作为备用方案,确保定时备份正常执行。已在 ACP 4.2.2 修复。
  • 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.2.2 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.2.2 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 在双栈集群中,通过 YAML 为业务 Pod 手动指定了错误的固定 IPv6 地址后,即使随后更新为正确的地址,ovn-controller 仍未正确处理,导致对应子网段后续的 IP 无法正常分配使用。该问题已在 v4.2.5 修复。
  • 本地设备管理的发现设备列表中,系统无法获取存储设备的 DeviceID,符合条件的设备被错误地标记为“不推荐”。该问题已在 v4.2.2 修复,此类设备可以正确展示为“推荐”。
  • 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.2.2 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.2.0

发布日期:2025-12-09

功能与增强

支持 Kubernetes 1.33

ACP 现已支持 Kubernetes 1.33,为您带来来自 Kubernetes 社区的最新上游功能、性能改进和安全增强。

ACP CLI (ac)

新的 ACP CLI (ac) 让您可以通过流畅的命令行体验在 ACP 上开发、构建、部署和运行应用。

主要能力包括:

  • 与 kubectl 兼容的命令
  • 与 ACP 平台环境集成的认证
  • 跨多个环境的统一会话管理
  • 用于平台访问和跨环境工作流的 ACP 专属扩展

完整功能详情请参见: ACP CLI (ac)

Hosted Control Plane (HCP)

已发布:

  • Alauda Container Platform Kubeadm Provider
  • Alauda Container Platform Hosted Control Plane
  • Alauda Container Platform SSH Infrastructure Provider

生命周期: Agnostic(与 ACP 异步发布)

Hosted Control Plane 通过将每个集群的控制平面作为容器化组件托管在管理集群中,将控制平面与工作节点解耦。该架构可降低资源消耗,加快集群创建和升级,并为大规模多集群环境提供更好的可扩展性。

更多信息请参见: 关于 Hosted Control Plane

增强的用户权限管理

我们通过以下增强优化了 RBAC 管理,以提升易用性和可维护性:

  • 平台角色管理:

    • 基于 UI 的权限自定义已弃用: 平台角色不再支持通过 Web 控制台进行自定义权限配置。所有角色权限都必须通过 YAML 文件进行配置。
    • 保持向后兼容: 现有的平台预置角色以及旧版本中定义的角色仍可完全正常使用。用户可以继续像以前一样将这些角色分配给用户并授予权限。
  • Kubernetes 角色管理:

    • 原生 Kubernetes 角色管理: 平台控制台现已提供专门的 Kubernetes Role 和 ClusterRole 资源管理界面,支持将 Kubernetes 角色直接关联到用户并分配权限。
    • 模块化权限定义: 平台插件资源权限将逐步迁移为独立的 Role 和 ClusterRole 资源,从而提供更好的隔离性和更便捷的管理。

借助 Kyverno 增强 Pod 安全策略

我们通过 Kyverno policy engine 增强了工作负载安全能力:

  • 即用型安全模板:控制台内置 8 个经过验证的安全策略模板,覆盖 Pod Security Standards 的各个级别,包括 Privileged、Baseline、Nonroot 和 Restricted
  • 一键配置:无需手动编写 YAML,即可在业务视图中基于模板快速创建策略,并立即在指定命名空间中生效

由 Envoy Gateway 驱动的下一代 Gateway API

本版本引入了一个基于 Envoy Gateway 的全新 Gateway API 实现。它提供统一的 L7 流量入口,保持与社区 Gateway API 规范一致,并为更丰富的流量策略和生态集成奠定基础。

Egress Firewall 的基于域名规则

Egress Firewall 现已支持基于域名而不仅仅是 IP 地址的允许/拒绝规则。这使得对公共 SaaS 服务以及 IP 地址频繁变化的外部资源可以进行更细粒度的出站访问控制。

新的 Endpoint Health Checker,可实现更快故障切换

我们引入了新的 Endpoint Health Checker,用于更快检测 node 崩溃和网络分区等故障,并及时移除不健康的后端。这显著缩短了流量故障切换时长,并降低了服务中断风险。

新的 Local Storage Operator,便于更轻松地管理 Ceph/TopoLVM

新引入的 Local Storage(Alauda Build of Local Storage)Operator 大幅简化了 Ceph 和 TopoLVM 的部署与磁盘管理。在部署过程中,您可以列出集群中所有可用磁盘,包括型号、容量及其他关键属性,并选择要纳入管理的磁盘。 在磁盘绑定方面,Ceph 和 TopoLVM 现在更倾向于使用 device ID,而不是挂载路径,从而避免因 node 重启或设备重新检测后设备名称变化而导致的存储问题。

其他主要变更

日志插件生命周期变更

日志相关插件的生命周期状态已从 Aligned 更改为 Agnostic(与 ACP 异步发布)。

受影响的插件:

  • Alauda Container Platform Log Essentials(本版本新增)
  • Alauda Container Platform Log Storage for ClickHouse
  • Alauda Container Platform Log Storage for Elasticsearch
  • Alauda Container Platform Log Collector

更多信息请参见: 关于 Logging Service

命名空间默认安全级别增强

从 v4.2.0 开始,通过 Web 控制台或 CLI 新建的命名空间,其默认 PSA 策略已从 Baseline 更改为 Restricted。

  • Baseline:禁止已知的权限提升,提供中等安全性
  • Restricted:遵循 Pod 安全最佳实践,要求最严格
WARNING

Restricted 策略对 Pod 的配置要求非常严格。如果您的业务需要 privileged 模式、以 root 用户运行、挂载 host 路径或使用 host 网络等能力,这些工作负载将无法在默认策略为 Restricted 的命名空间中运行。

影响分析

  • 此变更仅影响新创建的命名空间
  • 需要特权能力的工作负载(例如 root 用户、hostPath 挂载)将无法直接运行

建议的解决方案

  • 修改应用配置,使其满足 Restricted 策略的安全要求
  • 如有必要,手动将命名空间策略改回 Baseline

MinIO 进入维护模式

MinIO(Alauda Build of MinIO)已进入 维护模式。未来仅提供安全修复,不再规划新功能。现有 MinIO 集群可以继续运行,而新的对象存储需求建议优先选择 Ceph Object 作为推荐方案。

Calico 进入维护模式

Calico(Alauda Container Platform Networking for Calico)CNI 插件已进入 维护模式。我们将仅处理与安全相关的问题,它也不再是默认推荐的网络选项。现有 Calico 集群仍受支持,而新集群应使用 kube-ovn 作为标准 CNI。

Ingress Nginx 已切换为 Operator

Ingress Nginx(Alauda Build of Ingress Nginx)已从集群插件迁移为基于 Operator 的部署和管理模型。升级后现有 Ingress 资源将继续可用,后续操作预计通过 Operator 完成。尽管上游社区版本的 Ingress Nginx 已不再更新,我们仍将继续为该发行版提供 bug 修复和安全补丁。

已弃用和已移除的功能

Kubernetes 版本升级策略更新

ACP 4.2 开始,升级 Kubernetes 版本 不再是可选项。在执行集群升级时,Kubernetes 版本必须与其他平台组件一起升级。 此变更可确保整个集群的版本一致性,并减少未来的维护窗口。

ALB 自 v4.2.0 起弃用

ALB(Alauda Container Platform Ingress Gateway)自 v4.2.0 起标记为弃用。新集群和新用户应优先采用基于 Envoy Gateway 的 Gateway API 作为主要方案。现有使用 ALB 的集群在升级后仍可继续工作,但我们强烈建议尽快规划并执行向 Gateway API 的迁移,以获得长期支持和功能演进。

Flannel 已完全移除

Flannel(Alauda Container Platform Networking for Flannel)CNI 插件已从平台中完全移除。仍在使用 Flannel 的集群必须在升级到此版本或更高版本之前迁移到 kube-ovn。请提前规划并完成迁移,以避免因切换 CNI 而导致的服务中断。

已修复问题

  • upmachinepool 资源的 status 字段保存关联的 machine 资源时未做排序,导致每次 reconcile 都被判定为需要更新,审计数据量因此过大。该问题已在 v4.2.0 修复。
  • 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.2.0 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 因长期未登录而被系统自动禁用的用户,在管理员手动激活后会被再次自动禁用,激活操作无法生效。该问题已在 v4.2.0 修复。
  • 从集群卸载 Operator 后,其状态会被错误地显示为 Absent,而实际状态仍为 Ready,需要通过 violet upload 手动重新上传才能恢复。该问题已在 v4.2.0 修复,卸载后 Operator 会正确显示为 Ready。
  • 使用 violet upload 上传 Operator 新版本后,偶尔会出现无法选择并安装该新版本的情况。该问题已在 v4.2.0 修复。
  • 当 Operator 或 Cluster Plugin 中包含多个前端扩展时,点击这些扩展的左侧导航可能没有任何反应。此前的临时规避方式是为扩展的 ConfigMap 添加注解 cpaas.io/auto-sync: "false"。该问题已在 v4.2.0 修复,不再需要该临时规避方式。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 使用 violet upload 上传文件夹中的多个 package 时,上传会因磁盘空间不足而失败。该问题已在 v4.2.0 修复,violet 会及时自动清理已上传的 package,不再出现该错误。
  • 将命名空间导入项目时,在导入过程中调整容器组安全策略级别(例如由 Baseline 改为 Restricted)不会生效,导入完成后命名空间详情页显示的仍是原有级别。该问题已在 v4.2.0 修复,导入时设置的安全策略级别会正确保存。
  • 从 v3.x 升级到 v4.x 时,若 global 集群已升级而业务集群未升级,业务集群中 Application、Deployment 等负载的监控面板无法显示。该问题已在 v4.2.0 修复。
  • 在 Kubernetes 版本低于 1.30 的环境中进行升级时,KubeVirt Operator 可能部署失败。该问题已在 v4.2.0 修复。
  • 在配置管理中创建的 Image Registry 类型凭据只保存了用户名和密码,缺少 kubectl create secret docker-registry 会生成的 auth 认证字段,依赖完整认证信息的镜像构建工具(如 buildah)使用该凭据推送镜像时会提示无权限。该问题已在 v4.2.0 修复,控制台创建的凭据与命令行创建的凭据包含相同的完整认证信息。

已知问题

  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.2.5 修复。
  • 在升级 Global 集群时存在一个偶发问题,导致 Web Console 的左侧导航栏中无法看到 Marketplace 菜单。此问题已在 ACP 4.2.1 中修复。
  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.2.1 中修复。
  • 在使用 Global Cluster Disaster Recovery 方案时,安装 Alauda Container Platform etcd Synchronizer 后,Standby Cluster 的 Web Console 无法登录。原因是 etcd Synchronizer 没有正确忽略 k8sadmin-* 相关的 Secret 对象,导致 Standby Cluster 的认证信息被覆盖。此问题已在 ACP 4.2.1 中修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.2.6 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 当 MinIO 使用 HTTPS 协议时,SkipSSLVerify 参数无法跳过 HTTPS 证书校验,选择 MinIO 对象存储类创建的存储桶声明会一直处于不可用状态。该问题已在 v4.2.1 修复。
  • 在双栈集群中部署 Envoy Gateway 后,UDPRoute 的 IPv4 地址无法访问。目前没有可用的规避方式。
  • 如果自定义应用包含告警资源,且该告警资源中的指标表达式使用了自定义指标,那么当将该应用导出为 Chart 或应用 YAML 后,无论是通过导入 Chart 至平台,还是直接使用应用 YAML 创建应用,只要将其部署到与原应用命名空间名称不同的环境中,都会导致应用部署失败。

    解决方法为:手动修改 Chart 或 YAML 文件中告警资源内的指标表达式,将其中的命名空间标签值改为目标部署环境的命名空间。
  • ceph-mgr 创建的默认存储池 .mgr 会使用默认的 Crush Rule,在延伸集群中不能正常选出 osd,所以必须使用 CephBlockPool 创建名为 .mgr 的存储池,但是因为时序上的不确定导致 mgr 可能先于 Rook Operator 去创建 .mgr 存储池导致出现该问题。
    遇到该问题后可以尝试重启 rook-ceph-mgr 的 pod,如果不能恢复需要清理后重新部署。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。