发版日志

4.1.6

发布日期:2026-07-07

已修复问题

  • frontend 组件长时间运行时会持续泄露 HTTP 连接,可能耗尽本地临时 TCP 端口,导致前端页面无法访问。该问题已在 v4.1.6 修复。
  • 在五个控制平面节点的场景下扩容业务集群控制平面节点时,部分请求会偶发返回 401,导致集群节点列表获取失败。该问题已在 v4.1.6 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 在双栈集群中,为 Pod 手动配置了错误的固定 IPv6 地址后,即使随后更正为正确地址,ovn-controller 仍未正确处理,导致该子网段的后续 IP 无法再正常分配使用。该问题已在 v4.1.6 修复。
  • 在应用商店上架 Helm Chart 包时,平台对 Harbor 仓库的探测耗时过长而超时,上架操作因此报错。该问题已在 v4.1.6 修复,平台与 Harbor 的探测交互耗时已缩短。
  • image-registry 在外接 S3 存储的场景下,部分资源通过环境变量引用 Secret,存在敏感信息暴露的风险。该问题已在 v4.1.6 修复,这些资源不再以环境变量方式引用 Secret。

已知问题

  • 证书到期监控指标带有随每次采集变化的标签,每次采集都会产生新的时间序列,序列数量持续增长并推高监控组件的资源占用。该问题已在 v4.1.7 修复。
  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.5

发布日期:2026-02-10

已修复问题

  • 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.1.5 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.1.5 修复。
  • 修复了 marketplace 插件在 workload 集群安装失败的问题。已在 ACP 4.1.5 修复。
  • 使用对接外部 ElasticSearch 功能时,从任意版本升级至 4.1.x 版本,Log Storage for Elasticsearch 组件会升级失败。该问题已在 v4.1.5 修复。
  • Underlay 子网开启 u2o 后,偶现子网内 Pod 无法与子网物理网关通信。该问题已在 v4.1.5 修复。
  • 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.1.5 修复。

已知问题

  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • frontend 组件长时间运行时会持续泄露 HTTP 连接,可能耗尽本地临时 TCP 端口,导致前端页面无法访问。该问题已在 v4.1.6 修复。
  • 在五个控制平面节点的场景下扩容业务集群控制平面节点时,部分请求会偶发返回 401,导致集群节点列表获取失败。该问题已在 v4.1.6 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • 在双栈集群中,为 Pod 手动配置了错误的固定 IPv6 地址后,即使随后更正为正确地址,ovn-controller 仍未正确处理,导致该子网段的后续 IP 无法再正常分配使用。该问题已在 v4.1.6 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.4

发布日期:2026-01-07

已修复问题

  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.1.4 中修复。
  • 因长期未登录而被系统自动禁用的用户,在管理员手动激活后会被再次自动禁用,激活操作无法生效。该问题已在 v4.1.4 修复。
  • 通过 http 地址对接外部 ElasticSearch 时,日志查询可能失败,日志页面报错“cannot assign requested address”。该问题已在 v4.1.4 修复。
  • upmachinepool 资源的 status 字段保存关联的 machine 资源时未做排序,导致每次 reconcile 都被判定为需要更新,审计数据量因此过大。该问题已在 v4.1.4 修复。
  • 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.1.4 修复。
  • 当单个节点上运行的 Pod 超过 100 个时,节点重启后会触发速率限制,该节点上的 Pod 无法正常创建或运行。该问题已在 v4.1.4 修复。
  • Ceph 块存储的灾难恢复文档只说明了如何将备集群切换为主集群,没有说明如何将原主集群降级为备集群,按文档操作后主备之间的数据无法继续同步。该问题已在 v4.1.4 修复,Ceph 灾难恢复文档补充了块存储主备切换的完整分步过程。
  • 将命名空间导入项目时,在导入过程中调整容器组安全策略级别(例如由 Baseline 改为 Restricted)不会生效,导入完成后命名空间详情页显示的仍是原有级别。该问题已在 v4.1.4 修复,导入时设置的安全策略级别会正确保存。
  • 在控制台中为 Deployment 的容器添加 lifecycle 配置并更新后,待 Pod 启动完成再次更新该应用(例如只修改标签),容器的 lifecycle 配置会被意外删除。该问题已在 v4.1.4 修复,后续更新不再影响已有的 lifecycle 配置。
  • 节点重启后,multus-cni 的 init 容器可能因二进制文件被占用而启动失败,导致该节点上的 multus-cni Pod 无法正常启动。该问题已在 v4.1.4 修复。

已知问题

  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.1.5 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.1.5 修复。
  • 修复了 marketplace 插件在 workload 集群安装失败的问题。已在 ACP 4.1.5 修复。
  • 使用对接外部 ElasticSearch 功能时,从任意版本升级至 4.1.x 版本,Log Storage for Elasticsearch 组件会升级失败。该问题已在 v4.1.5 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • Underlay 子网开启 u2o 后,偶现子网内 Pod 无法与子网物理网关通信。该问题已在 v4.1.5 修复。
  • 当出口网关(egress gateway)指定的目标 ipBlocks 落在该网关所使用的内部子网 CIDR 范围内时,对应的 egress 规则不生效,与出口网关处于同一网段的 Pod 流量无法被正确路由。该问题已在 v4.1.5 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.3

发布日期:2025-11-03

已修复问题

  • 未分配任何角色的平台用户访问 Alauda Service Mesh 页面时,页面会一直停留在“加载中”状态,不会返回无权限提示。该问题已在 v4.1.3 修复,此类用户会直接收到无权限的提示。
  • 在开启 u2o 的 underlay 子网中,重启配置了固定 IP 的 Pod 后,该 Pod 访问外部网络可能不通;该现象出现在会依据任意报文更新 ARP 缓存的物理网络环境中。该问题已在 v4.1.3 修复。
  • 从 v3.x 升级到 v4.x 时,若 global 集群已升级而业务集群未升级,在该业务集群的新版自定义监控面板中创建的监控指标无法被 HPA 使用,基于这些指标的弹性伸缩规则不会生效。该问题已在 v4.1.3 修复。

已知问题

  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.1.5 修复。
  • 使用对接外部 ElasticSearch 功能时,从任意版本升级至 4.1.x 版本,Log Storage for Elasticsearch 组件会升级失败。该问题已在 v4.1.5 修复。
  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.1.4 中修复。
  • 通过 http 地址对接外部 ElasticSearch 时,日志查询可能失败,日志页面报错“cannot assign requested address”。该问题已在 v4.1.4 修复。
  • upmachinepool 资源的 status 字段保存关联的 machine 资源时未做排序,导致每次 reconcile 都被判定为需要更新,审计数据量因此过大。该问题已在 v4.1.4 修复。
  • 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.1.4 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • Underlay 子网开启 u2o 后,偶现子网内 Pod 无法与子网物理网关通信。该问题已在 v4.1.5 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 当单个节点上运行的 Pod 超过 100 个时,节点重启后会触发速率限制,该节点上的 Pod 无法正常创建或运行。该问题已在 v4.1.4 修复。
  • Ceph 块存储的灾难恢复文档只说明了如何将备集群切换为主集群,没有说明如何将原主集群降级为备集群,按文档操作后主备之间的数据无法继续同步。该问题已在 v4.1.4 修复,Ceph 灾难恢复文档补充了块存储主备切换的完整分步过程。
  • 在控制台中为 Deployment 的容器添加 lifecycle 配置并更新后,待 Pod 启动完成再次更新该应用(例如只修改标签),容器的 lifecycle 配置会被意外删除。该问题已在 v4.1.4 修复,后续更新不再影响已有的 lifecycle 配置。
  • 节点重启后,multus-cni 的 init 容器可能因二进制文件被占用而启动失败,导致该节点上的 multus-cni Pod 无法正常启动。该问题已在 v4.1.4 修复。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.2

发布日期:2025-10-01

已修复问题

  • 当 Operator 或 Cluster Plugin 中包含多个前端扩展时,点击这些扩展的左侧导航可能没有任何反应。此前的临时规避方式是为扩展的 ConfigMap 添加注解 cpaas.io/auto-sync: "false"。该问题已在 v4.1.2 修复,不再需要该临时规避方式。
  • 使用 violet upload 上传 Operator 新版本后,偶尔会出现无法选择并安装该新版本的情况。该问题已在 v4.1.2 修复。
  • global 集群升级后,未升级的业务集群中所有 Applications 以及各类 Workloads 的监控面板无法显示监控数据。该问题已在 v4.1.2 修复。

已知问题

  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • 使用对接外部 ElasticSearch 功能时,从任意版本升级至 4.1.x 版本,Log Storage for Elasticsearch 组件会升级失败。该问题已在 v4.1.5 修复。
  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.1.4 中修复。
  • 通过 http 地址对接外部 ElasticSearch 时,日志查询可能失败,日志页面报错“cannot assign requested address”。该问题已在 v4.1.4 修复。
  • upmachinepool 资源的 status 字段保存关联的 machine 资源时未做排序,导致每次 reconcile 都被判定为需要更新,审计数据量因此过大。该问题已在 v4.1.4 修复。
  • 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.1.4 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在控制台中为 Deployment 的容器添加 lifecycle 配置并更新后,待 Pod 启动完成再次更新该应用(例如只修改标签),容器的 lifecycle 配置会被意外删除。该问题已在 v4.1.4 修复,后续更新不再影响已有的 lifecycle 配置。
  • 节点重启后,multus-cni 的 init 容器可能因二进制文件被占用而启动失败,导致该节点上的 multus-cni Pod 无法正常启动。该问题已在 v4.1.4 修复。
  • 在开启 u2o 的 underlay 子网中,重启配置了固定 IP 的 Pod 后,该 Pod 访问外部网络可能不通;该现象出现在会依据任意报文更新 ARP 缓存的物理网络环境中。该问题已在 v4.1.3 修复。
  • 从 v3.x 升级到 v4.x 时,若 global 集群已升级而业务集群未升级,在该业务集群的新版自定义监控面板中创建的监控指标无法被 HPA 使用,基于这些指标的弹性伸缩规则不会生效。该问题已在 v4.1.3 修复。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.1

发布日期:2025-09-04

已修复问题

  • 使用 violet upload 上传文件夹中的多个 package 时,上传会因磁盘空间不足而失败。该问题已在 v4.1.1 修复,violet 会及时自动清理已上传的 package,不再出现该错误。
  • 使用 violet upload 上传文件夹中的多个 package 时,上传会因磁盘空间不足而失败。该问题已在 v4.1.1 修复,violet 会及时自动清理已上传的 package,不再出现该错误。
  • 在平台升级前执行 `violet push` 会导致部分功能组件状态异常,从而阻塞升级。该问题已在 v4.1.1 修复,`violet push` 已将推送镜像与创建 CR 分离,用户可以选择仅推送镜像而不创建 CR。
  • 以前在升级集群时,会遗留 CRI(Container Runtime Interface)升级 Pod,从而阻塞集群继续升级到下一个版本。该问题已在 4.1.1 中修复。
  • 从集群卸载 Operator 后,其状态被错误地显示为 Absent,而实际状态仍为 Ready;用户需要通过 violet upload 手动重新上传才能恢复正确状态。该问题已在 v4.1.1 修复,卸载后 Operator 会正确显示为 Ready。

已知问题

  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.1.7 修复。
  • 使用对接外部 ElasticSearch 功能时,从任意版本升级至 4.1.x 版本,Log Storage for Elasticsearch 组件会升级失败。该问题已在 v4.1.5 修复。
  • 通过 http 地址对接外部 ElasticSearch 时,日志查询可能失败,日志页面报错“cannot assign requested address”。该问题已在 v4.1.4 修复。
  • 平台集群数量较多时,若先通过批量设置项目配额功能为项目设置了配额,之后便无法再针对单个集群更新该项目的配额。该问题已在 v4.1.4 修复。
  • 之前在 OperatorHub 中创建集群级别的 Instance 时,由于 web console 自动添加了 metadata.namespace 字段,导致出现 404 报错。此问题已在 ACP 4.2.0 修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.1.6 修复。
  • 当 Operator 或 Cluster Plugin 中包含多个前端扩展时,点击这些扩展的左侧导航可能没有任何反应。此前的临时规避方式是为扩展的 ConfigMap 添加注解 cpaas.io/auto-sync: "false"。该问题已在 v4.1.2 修复,不再需要该临时规避方式。
  • 使用 violet upload 上传 Operator 新版本后,偶尔会出现无法选择并安装该新版本的情况。该问题已在 v4.1.2 修复。
  • 之前当集群中存在 Display Name 为空的节点时,用户在节点详情页面打开面包屑的节点下拉筛选框,会无法通过输入内容来筛选节点。此问题已在 ACP 4.2.0 修复。
  • 日志归档完成后,临时文件未被删除,导致其占用的磁盘空间无法释放。该问题已在 log-v4.2.0 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.1.7 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在控制台中为 Deployment 的容器添加 lifecycle 配置并更新后,待 Pod 启动完成再次更新该应用(例如只修改标签),容器的 lifecycle 配置会被意外删除。该问题已在 v4.1.4 修复,后续更新不再影响已有的 lifecycle 配置。
  • 节点重启后,multus-cni 的 init 容器可能因二进制文件被占用而启动失败,导致该节点上的 multus-cni Pod 无法正常启动。该问题已在 v4.1.4 修复。
  • 在开启 u2o 的 underlay 子网中,重启配置了固定 IP 的 Pod 后,该 Pod 访问外部网络可能不通;该现象出现在会依据任意报文更新 ARP 缓存的物理网络环境中。该问题已在 v4.1.3 修复。
  • 从 v3.x 升级到 v4.x 时,若 global 集群已升级而业务集群未升级,在该业务集群的新版自定义监控面板中创建的监控指标无法被 HPA 使用,基于这些指标的弹性伸缩规则不会生效。该问题已在 v4.1.3 修复。
  • global 集群升级后,未升级的业务集群中所有 Applications 以及各类 Workloads 的监控面板无法显示监控数据。该问题已在 v4.1.2 修复。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 部署或升级集群时,Kube-OVN 的网络控制面组件可能反复重启,集群部署无法完成。目前没有可用的规避方式。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.1.0

发布日期:2025-07-31

新特性与增强

不可变基础设施

已发布:

  • Alauda Container Platform DCS Infrastructure Provider
  • Alauda Container Platform Kubeadm Provider

这两个插件的生命周期均为 Agnostic,并与 Alauda Container Platform(ACP)异步发布。

  • DCS Infrastructure Provider 实现了 Cluster API Infrastructure Provider 接口,并与 Huawei Datacenter Virtualization Solution(DCS)集成。
  • Kubeadm Provider 在由基础设施提供方预配的 VM 上安装并配置 Kubernetes 控制平面和节点。

这两个插件结合使用,可在 DCS 上实现全自动化的集群管理。

相关文档正在准备中,将在发布后同步更新到在线文档中。

机器配置

已发布:Alauda Container Platform Machine Configuration 生命周期:Agnostic,与 ACP 异步发布。

Machine Configuration 用于管理集群节点上的文件更新、systemd 单元和 SSH 公钥,提供以下能力:

  • MachineConfig CRD,用于向主机写入配置。
  • MachineConfigPool CRD,用于基于角色标签对节点配置进行分组和管理。
  • 在集群安装完成后,系统会自动创建两个默认的 MachineConfigPool——一个用于控制平面节点,一个用于 worker 节点。此外,用户也可以按需创建自定义的 MachineConfigPool。

系统会持续监控配置漂移,并将受影响的节点标记为 Degraded,直至问题解决。

有关该特性的详细信息,请参见 机器配置

etcd 加密

已发布:Alauda Container Platform etcd Encryption Manager 生命周期:Agnostic,与 ACP 异步发布。

为工作负载集群提供 etcd 数据加密密钥的周期性轮换,针对 secrets 和 configmaps 使用 AES-GCM。支持无缝重新加密和密钥重新加载,且不会影响工作负载,并保持对最近 8 个密钥的向后兼容。

详细信息请参见 etcd 加密

Kubernetes Certificates Rotator

已发布:Alauda Container Platform Kubernetes Certificates Rotator 生命周期:Agnostic,与 ACP 异步发布。

支持自动轮换 Kubernetes 组件所使用的证书。

详细信息请参见 Automated Kubernetes Certificate Rotation

集群增强

已发布:Alauda Container Platform Cluster Enhancer 生命周期:Aligned

新特性和变更如下:

  • etcd Backup:由于使用场景和实现方式存在差异,将 etcd 备份功能从 Backup & Recovery 迁移至 Cluster Enhancer。优化了部署方式,避免配置变更和升级过程中的冲突。
  • 事件清理:实现对过期 Kubernetes 事件的主动外部清理,防止其在 etcd 中堆积,从而降低 etcd 负载及重启时的不稳定风险。
  • 证书监控:将证书管理转换为证书监控,并提供告警规则和监控面板,替代原有的 Certificates 管理功能。在监控 kube-apiserver 使用的 loopback 证书时,采用了更高效的监控方式。
  • 集群监控面板迁移:将集群监控资源从 chart-cpaas-monitor 迁移至 Cluster Enhancer。
  • 集群详情图表迁移:将集群详情中的监控图表切换为自定义监控监控面板。

中文语言包

中文语言支持已从平台中解耦,并作为 Chinese Language Pack 插件发布。平台安装后默认使用英文;如需中文语言支持,用户可安装该插件。

创建本地集群

从 ACP 4.1 开始,创建本地集群时仅支持平台提供的最新 Kubernetes 版本,不再支持此前可在四个 Kubernetes 版本之间进行选择的方式。

日志

  • 将 ClickHouse 升级到 v25.3。
  • 为应用日志新增 POD IP 标签,支持按 POD IP 进行过滤。
  • 改进标准输出日志采集:时间戳字段现在反映日志的实际打印时间,而不是采集组件的时间,从而确保日志按正确顺序显示。

监控

  • 将 Prometheus 升级到 v3.4.2。
  • 自定义变量现在支持三种类型:Constant、Custom 和 Textbox。
    • Constant: 固定不变的值。
    • Custom: 从预定义列表中选择的值。
    • Textbox: 用户手动输入的值。
  • Stat Chart 现在支持 Graph 模式,可在统计值下方显示所选时间段的趋势曲线。
  • Value Mapping 现在支持正则表达式和特殊值。
  • 图表现在可以复制,允许在当前监控面板中复制图表。

租户管理

  • 项目配额现在支持自定义资源配额和存储类配额。
  • 该插件提供了新的指标:cpaas_project_resourcequotacpaas_project_resourcequota_aggregated,可用于在监控面板中展示项目配额。
    • cpaas_project_resourcequota:在每个集群中均可使用。
    • cpaas_project_resourcequota_aggregated:在 global 集群中可用,并汇总所有集群的数据。
  • 自定义角色现在增加了额外限制,权限只能在对应的角色类型范围内进行分配:
    • 平台角色: 可分配所有权限。
    • 项目角色: 只能分配平台预置 project-admin-system 角色范围内的权限。
    • 命名空间角色: 只能分配平台预置 namespace-admin-system 角色范围内的权限。
    • 当前用户不具备的权限不能被分配。

面向安全 Pod 执行的 UID/GID 自动分配方案

在 Kubernetes 中,你可以为每个命名空间配置专用的 User ID(UID)和 Group ID(GID)范围。当用户在该命名空间中部署 Pod 时,我们会根据命名空间预定义的安全策略,为 Pod 中的所有容器自动设置 RunAsUser 和 fsGroup。这些用户和组会从该命名空间被授权的 UID/GID 范围内动态分配。

核心能力与价值

  • 增强安全性:通过强制容器以非特权用户身份运行,并限制其 UID/GID 范围,该方案可有效缓解容器逃逸和权限提升等安全风险,遵循最小权限原则。

  • 简化管理:开发人员不再需要在每个容器或 Pod 配置中手动指定 UID/GID。一旦完成命名空间配置,部署到其中的所有 Pod 都会自动继承并应用正确的安全设置。

  • 确保合规性:这有助于客户更好地满足内部安全策略和外部合规要求,确保容器化应用运行在受控环境中。

使用方式

  • 为你的 Namespace 添加 security.cpaas.io/enabled 标签。

基于 Argo Rollouts 的产品化方案

我们的产品化方案基于开源 Argo Rollouts 构建,可为用户提供对发布流程的精细化控制。通过实现渐进式和受控的部署策略,它可最大限度减少因上线新特性或新版本而引发的业务中断或故障,显著降低发布风险。

核心能力与价值

  • 蓝绿部署:通过在现有生产环境旁部署新版本,实现零停机更新。经过充分测试后,可将流量立即或快速从旧版本切换到新版本。

  • 金丝雀部署:通过将一小部分生产流量(例如 5%)引导到新版本,逐步引入新版本,以便观察其性能和稳定性。系统可基于预定义指标(例如错误率或延迟)在检测到问题时自动增加流量或回滚,从而将潜在问题的影响降到最低。

  • 平台认证的 Argo Rollouts Chart:你可以直接下载社区开源的 Argo Rollouts,也可以选择通过 Alauda Cloud 提供的平台认证版本。

Alauda Container Platform Registry:与平台用户权限深度集成

为提供更安全、更便捷的镜像管理体验,我们将轻量级镜像仓库与平台现有的用户权限系统进行了更深度的集成。

核心能力与价值

  • 与平台用户系统深度集成:镜像仓库与平台的用户认证和基于角色的访问控制(RBAC)机制无缝集成。开发人员、测试人员和管理员可直接使用现有的平台凭据,无需额外配置或单独管理账号。平台会自动将用户在 Namespace 内的权限映射为其对镜像仓库中镜像的相应访问权限。例如,用户只能在其有访问权限的“特定 Namespace”中执行镜像 pushpull

  • 更顺畅的命令行操作:支持通过 CLI 工具执行镜像 pullpush 操作,显著提升操作效率和便利性。

警告

  • 仅支持通过该方案安装 Alauda Container Platform Registry。

基于 KEDA 的自动伸缩方案

为使应用能够智能响应实际负载,我们的平台提供了基于 KEDA(Kubernetes Event-driven Autoscaling)的自动伸缩方案。

核心能力与价值

  • 事件驱动的弹性伸缩:KEDA 支持 70 多种 scaler 类型,可自动扩缩应用(例如 Deployments、Jobs 等)。除传统的 CPU 和内存利用率外,还可监控消息队列长度(例如 Kafka、RabbitMQ)、数据库连接数、HTTP 请求速率以及自定义指标。

  • 平台认证的 KEDA Operator:可通过 Alauda Cloud 下载并安装平台认证版本。

方案

  • 该产品提供两种方案:基于 Prometheus 指标的自动伸缩,以及缩容至零。

跨集群应用灾备方案(Alpha)

我们的平台现已提供基于 GitOps 的全新跨集群应用灾备(DR)方案,旨在显著提升应用韧性和可用性。

核心能力与价值

  • 多样化的 DR 模式:灵活支持 Active-Active(AA-DR),满足全球化、高并发场景;支持 Active-Standby Dual-Active(AS-DR),优化资源利用率;以及 Active-Passive(AP-DR),严格确保数据一致性。

  • 自动化 GitOps 同步:结合 ApplicationSet 和 Kustomize,利用 GitOps 的能力实现跨集群配置自动同步,确保 DR 环境始终处于就绪状态。

  • 灵活的流量管理:利用第三方提供的 DNS 和 GSLB 功能,实现基于健康检查的智能流量切换和快速故障转移,最大限度降低服务中断。

  • 多维度数据同步:该方案提供了多种同步方式的指导,包括数据库级、存储级和应用级同步,以确保集群间最终数据一致性,为业务连续性奠定基础。

  • 简化的故障切换流程:清晰定义故障检测、流量切换、状态提升和服务恢复的详细步骤,确保在灾难发生时能够高效、有序地完成故障切换。

注意

  • 灾备方案中的数据同步部分与客户的业务特征和数据量密切相关,因此差异可能较大。因此,实际实施时需要结合客户的具体场景进行针对性处理。

依赖组件全面升级,提升稳定性与安全性

本次发布对以下核心组件进行了升级:

  • KubeVirt 升级到 v1.5.2

  • Ceph 升级到 18.2.7

  • MinIO 升级到 RELEASE.2025-06-13T11-33-47Z

其他开源依赖也已同步到其最新社区版本,修复了大量已知问题和安全漏洞,以提升系统稳定性和可靠性。

增强虚拟化特性,提升业务连续性和安全性

基于虚拟化环境中的实际应用需求,本次更新引入了以下关键增强:

  • 高可用迁移:在节点故障时自动将虚拟机迁移到健康节点,确保业务连续不中断。

  • 虚拟机克隆:可基于现有虚拟机快速创建新的虚拟机,显著提升部署效率。

  • 虚拟机模板:支持将现有虚拟机转换为模板,以便快速、批量部署相似配置的环境。

  • 可信计算(vTPM):虚拟机现已支持可信计算能力,提升整体安全性。

有关这些新特性的详细说明和使用指南已更新至用户手册。

基于 COSI v2 的对象存储服务提供更灵活高效的存储管理

Container Object Storage Interface(COSI)已升级到 v2(alpha),带来以下增强:

  • 多集群访问:支持同时访问多个不同的 Ceph 或 MinIO 存储集群,实现更高效的集中管理。

  • 细粒度配额管理:允许针对不同存储类别灵活设置配额,优化资源利用率。

  • 增强的权限管理:支持创建多种用户访问权限,包括读写、只读和只写模式。

  • 匿名访问支持:Ceph COSI Driver 现支持匿名访问,可通过 Ingress 配置快速实现外部 HTTP 程序访问。

ALB 进入维护模式

WARNING

ALB 将停止新功能开发,仅接收维护和安全修复。4.1 版本支持 ingress-nginx,4.2 版本支持 Envoy Gateway。

未来规划

  • 对于 ingress 用户,直接使用 ingress-nginx
  • 未来的新特性将仅在 GatewayAPI 上支持
  • 除非存在 ALB 独占能力的强需求(例如项目端口分配),否则避免提及 ALB

当前在 GatewayAPI 中不支持的 ALB 独占特性

  • 基于端口的 gateway 实例分配

  • 基于 IP 和 IP 范围的流量转发

  • 用于负载均衡的 EWMA 算法

  • WAF 使用

  • 按规则级别的监控视图

使用 ingress-nginx 提供 Ingress 能力

引入社区最主流的 Ingress controller 实现,以替代现有基于 ALB 的 Ingress 场景。

核心能力与价值

  • 与主流社区实践保持兼容,避免沟通歧义

  • Ingress UI 支持自定义 annotations,可充分利用 ingress-nginx 丰富的扩展能力

  • 安全问题修复

Kube-OVN 支持新的高可用多活 Egress Gateway

新的 Egress 机制解决了以往集中式 gateway 的局限性。新的 Egress Gateway 具备以下特性:

  • 通过 ECMP 实现 Active-Active 高可用,支持横向吞吐扩展

  • 通过 BFD 实现低于 1 秒的故障切换

  • 复用 underlay 模式,并将 Egress Gateway IP 与 Nodes 解耦

  • 通过 Namespace selectors 和 Pod selectors 实现精细化路由控制

  • 通过 Node selectors 实现灵活的 Egress Gateway 调度

支持 AdminNetworkPolicy 类型的集群网络策略

Kube-OVN 支持社区新的 Cluster Network Policy API。该 API 允许集群管理员在无需为每个 Namespace 单独配置的情况下实施网络策略。

相较于以往集群网络策略的优势

  • 社区标准 API(替代内部 API)

  • 与 NetworkPolicy 不冲突(优先级高于 NetworkPolicy)

  • 支持优先级设置

更多信息: Red Hat Blog on AdminNetworkPolicy

弃用和移除的特性

移除 Docker Runtime

  • 之前,平台虽然不是新集群的默认 runtime,但仍提供 Docker runtime 镜像。从 ACP 4.1 开始,将不再默认提供 Docker runtime 镜像。

移除模板应用

  • 原生应用模板应用 入口已正式移除。请确保在升级前将所有模板应用升级为 "Helm Chart Application"。