发版日志

4.3.3

Issued: 2026-09-03

已修复问题

  • ACP CLI(ac)的登录会话不支持更新。当会话 token 过期后,使用同一会话名称重新执行 ac login 时,认证会显示成功,但写入 kubeconfig 失败并提示 session already exists,命令行仍处于未登录状态。

    规避方法:先执行 ac logout 删除该会话,再重新执行 ac login;或使用其他会话名称登录。使用规避方法后,需要重新设置该会话的 context 与命名空间。
  • 证书到期监控指标带有随每次采集变化的标签,每次采集都会产生新的时间序列,序列数量持续增长并推高监控组件的资源占用。该问题已在 v4.3.3 修复。
  • 为运行传统操作系统的旧版本业务集群新增节点时,下发的 containerd 配置版本与该集群上较旧的 containerd 不兼容,节点无法加入集群。该问题已在 v4.3.3 修复。
  • 启用双因子认证后,成员集群的告警服务因所需的回调凭据未下发而无法启动,告警功能不可用。该问题已在 v4.3.3 修复。
  • 失败的备份任务未被及时清理,etcd 备份 Pod 在节点上持续累积,可能达到节点的 Pod 数量上限。该问题已在 v4.3.3 修复。
  • 在启用多副本 VPC Egress Gateway 的场景下,部分命名空间可能完全无法访问集群外部网络,且连接中断后不会自动恢复,需要重启业务容器才能恢复通信。该问题已在 v4.3.3 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.3.3 修复。
  • 在 MetalLB、ALB 与 underlay 组合场景下,当 ALB 使用多副本时,集群内 Pod 通过 LoadBalancer VIP 访问集群内 backend 可能失败。该问题已在 v4.3.3 修复。
  • 删除对象存储池后再次创建,新建的存储池状态异常,且再次删除会一直停留在“删除中”。可由集群管理员从存储组件日志中确认残留的存储池并手动删除。

已知问题

  • 在 DCS 模式下部署 global 集群时,安装可能停滞在 restartImagePullBackOffPods 步骤且无法继续:cert-manager 命名空间下的全部 Pod 处于 ImagePullBackOff,cert-manager AppRelease 持续停留在 Synced/WaitReady,后续组件不再创建。

    原因是 global 集群 ClusterCredential(cc-global)中的镜像仓库用户名与密码在安装写入后被清空,负责同步各命名空间镜像拉取凭据的组件因取不到凭据而静默跳过同步。cert-manager 与 data-services-system 命名空间下的 global-registry-auth 因此保留了旧的镜像仓库地址,与 Pod 实际拉取的地址不匹配,镜像拉取退化为匿名访问并被仓库拒绝(401)。

    规避方法:将 global 集群 ClusterCredential(cc-global)中的镜像仓库用户名与密码恢复为正确值,同步组件会在下一次 reconcile 刷新上述命名空间的 global-registry-auth,cert-manager Pod 随之恢复。该操作需要 global 集群的管理员命令行权限;若凭据再次被周期性的令牌轮换清空,则需要手工修正相关命名空间下的 global-registry-auth。
  • 在仅部署了日志存储、未部署日志采集组件的集群上再部署监控时,监控可能没有任何数据。该问题已在 v4.4.0 修复,该场景下监控可正常采集并展示数据。
  • 使用 violet push 推送 chart package 时,虽然 push 显示成功,但该 package 在 public-charts 仓库中可能无法看到。
    临时解决方案: 重新 push 一次。
  • 当 VPC Egress Gateway 的内部子网为双栈而外部子网仅支持 IPv4 时,网关初始化容器会反复重启,网关始终无法就绪。该问题已在 v4.4.0 修复。
  • 当 VPC Egress Gateway 的内部子网为双栈而外部子网仅支持 IPv4 时,网关初始化容器会反复重启,网关始终无法就绪。该问题已在 v4.4.0 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.3.2

Issued: 2026-07-04

重要兼容性通知

Huawei DCS Provider 和 Alauda OS

对于使用 Alauda OS 镜像的 Huawei DCS 集群,如果 ACP 为 v4.3.2 或更高版本,请安装 Huawei DCS Provider v1.0.21 或更高版本。此要求同样适用于 ACP v4.4.0 及更高版本。

从 OS Support Matrix 中同一 ACP 版本对应的行选择 Alauda OS 镜像。请勿将 DCS Provider v1.0.21 或更高版本与 ACP 早于 v4.3.2 版本的 Alauda OS 镜像配对。完整兼容性要求请参阅 Alauda OS and Provider Compatibility for Huawei DCS

已修复问题

  • 当 CAS 服务端的登录接口与验票接口使用不同的路径前缀时,CAS 连接器的验票请求未发往所配置的验票地址,导致验票失败、无法完成单点登录。该问题已在 v4.3.2 修复。
  • 在使用 containerd 2.x 的节点上,NVIDIA runtime 配置仍引用旧版 runtime,GPU 工作负载因此无法创建。该问题已在 v4.3.2 修复。
  • frontend 组件长时间运行时会持续泄露 HTTP 连接,可能耗尽本地临时 TCP 端口,导致前端页面无法访问。该问题已在 v4.3.2 修复。
  • 在大规模业务集群中,VictoriaMetrics vmselect 执行 recording rule 查询时可能产生较高的磁盘读写,增加磁盘使用压力并影响监控查询性能。该问题已在 ACP v4.3.2 修复。
  • 在五个控制平面节点的场景下扩容业务集群控制平面节点时,部分请求会偶发返回 401,导致集群节点列表获取失败。该问题已在 v4.3.2 修复。
  • Image Registry 使用 NFS RWX 共享存储时,Pod 被删除或重建后,新 Pod 会因整卷递归处理文件属主和权限而长时间停留在 ContainerCreating,Registry 长时间不可用,高可用恢复时间远超预期。该问题已在 v4.3.2 修复。
  • 通过 YAML 安装 Image Registry 并启用 S3 存储时,如果同一份 YAML 中仍保留 persistence 配置,global 集群不会生成对应的 ModuleInfo,安装流程无法继续。该问题已在 v4.3.2 修复。
  • Image Registry 以多副本部署、使用 NFS RWX 共享存储并通过 ALB2 或 nginx Ingress 暴露时,若入口层未启用会话保持,同一次 push 的请求会被分发到不同的 Registry 副本,导致镜像 push 随机失败并报 blob upload unknown 或 manifest blob unknown。该问题已在 v4.3.2 修复。

已知问题

  • 在仅部署了日志存储、未部署日志采集组件的集群上再部署监控时,监控可能没有任何数据。该问题已在 v4.4.0 修复,该场景下监控可正常采集并展示数据。
  • 使用 violet push 推送 chart package 时,虽然 push 显示成功,但该 package 在 public-charts 仓库中可能无法看到。
    临时解决方案: 重新 push 一次。
  • 在启用多副本 VPC Egress Gateway 的场景下,部分命名空间可能完全无法访问集群外部网络,且连接中断后不会自动恢复,需要重启业务容器才能恢复通信。该问题已在 v4.3.3 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.3.3 修复。
  • 当 VPC Egress Gateway 的内部子网为双栈而外部子网仅支持 IPv4 时,网关初始化容器会反复重启,网关始终无法就绪。该问题已在 v4.4.0 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 删除对象存储池后再次创建,新建的存储池状态异常,且再次删除会一直停留在“删除中”。可由集群管理员从存储组件日志中确认残留的存储池并手动删除。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.3.1

Issued: 2026-05-20

已修复问题

  • 用户使用 kubectl top node 命令查询节点用量时会返回报错,该问题已在 4.3.1 版本解决。
  • 升级场景中生成的 apiserver.crt 缺少 Authority Key Identifier (AKI) 扩展,新版本 Go TLS 校验可能拒绝该证书,导致 Jenkins 流水线连接 kube-apiserver 失败。此问题已在 v4.3.1 修复,升级生成的 apiserver.crt 会携带 AKI 信息。
  • 容器平台左侧导航「可观测」下的入口中文名称翻译不准确,显示为「记录」而非正确的「日志」。该问题已在 v4.3.1 修复。
  • Captain 对每个集群只用一个 worker 处理 HelmRequest,个别异常或处理耗时较长的 Chart 会阻塞队列,拖慢该集群上其他 Chart 的部署和更新。按集群配置 HelmRequest worker 数量的能力已在 v4.3.1 提供,可减少此类队列阻塞,提升 Chart 部署和更新效率。
  • 在应用商店上架 Helm Chart 包时,平台对 Harbor 仓库的探测耗时过长而超时,上架操作因此报错。该问题已在 v4.3.1 修复,平台与 Harbor 的探测交互耗时已缩短。

已知问题

  • 当 CAS 服务端的登录接口与验票接口使用不同的路径前缀时,CAS 连接器的验票请求未发往所配置的验票地址,导致验票失败、无法完成单点登录。该问题已在 v4.3.2 修复。
  • 在使用 containerd 2.x 的节点上,NVIDIA runtime 配置仍引用旧版 runtime,GPU 工作负载因此无法创建。该问题已在 v4.3.2 修复。
  • frontend 组件长时间运行时会持续泄露 HTTP 连接,可能耗尽本地临时 TCP 端口,导致前端页面无法访问。该问题已在 v4.3.2 修复。
  • 在大规模业务集群中,VictoriaMetrics vmselect 执行 recording rule 查询时可能产生较高的磁盘读写,增加磁盘使用压力并影响监控查询性能。该问题已在 ACP v4.3.2 修复。
  • 在五个控制平面节点的场景下扩容业务集群控制平面节点时,部分请求会偶发返回 401,导致集群节点列表获取失败。该问题已在 v4.3.2 修复。
  • 在仅部署了日志存储、未部署日志采集组件的集群上再部署监控时,监控可能没有任何数据。该问题已在 v4.4.0 修复,该场景下监控可正常采集并展示数据。
  • 使用 violet push 推送 chart package 时,虽然 push 显示成功,但该 package 在 public-charts 仓库中可能无法看到。
    临时解决方案: 重新 push 一次。
  • 在启用多副本 VPC Egress Gateway 的场景下,部分命名空间可能完全无法访问集群外部网络,且连接中断后不会自动恢复,需要重启业务容器才能恢复通信。该问题已在 v4.3.3 修复。
  • 在使用 NFSv3 服务端且节点未运行 rpc.statd 的环境中,删除 PVC 可能失败,导致后端目录和存储空间无法回收,并持续累积僵尸进程。该问题已在 v4.3.3 修复。
  • 当 VPC Egress Gateway 的内部子网为双栈而外部子网仅支持 IPv4 时,网关初始化容器会反复重启,网关始终无法就绪。该问题已在 v4.4.0 修复。
  • Image Registry 使用 NFS RWX 共享存储时,Pod 被删除或重建后,新 Pod 会因整卷递归处理文件属主和权限而长时间停留在 ContainerCreating,Registry 长时间不可用,高可用恢复时间远超预期。该问题已在 v4.3.2 修复。
  • 通过 YAML 安装 Image Registry 并启用 S3 存储时,如果同一份 YAML 中仍保留 persistence 配置,global 集群不会生成对应的 ModuleInfo,安装流程无法继续。该问题已在 v4.3.2 修复。
  • Image Registry 以多副本部署、使用 NFS RWX 共享存储并通过 ALB2 或 nginx Ingress 暴露时,若入口层未启用会话保持,同一次 push 的请求会被分发到不同的 Registry 副本,导致镜像 push 随机失败并报 blob upload unknown 或 manifest blob unknown。该问题已在 v4.3.2 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 删除对象存储池后再次创建,新建的存储池状态异常,且再次删除会一直停留在“删除中”。可由集群管理员从存储组件日志中确认残留的存储池并手动删除。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。

4.3.0

Issued: 2026-04-16

功能和增强

支持 Kubernetes 1.34

ACP 4.3 为平台管理的集群场景增加了对 Kubernetes 1.34 的支持。

升级到 ACP 4.3 时,业务集群兼容版本为 1.34、1.33、1.32 和 1.31。此兼容版本要求决定 global 集群是否可以升级,并且独立于第三方集群管理范围。

更多信息请参阅 Kubernetes Support Matrix

基于 CVO 的集群升级工作流

ACP 4.3 为 global 和业务集群引入了基于 Cluster Version Operator (CVO) 的升级工作流。

主要功能包括:

  • 使用 bash upgrade.sh 准备升级构件和升级控制器
  • 执行前运行预检
  • 从 Web Console 请求升级,或更新 ClusterVersionShadow.spec.desiredUpdate
  • cvsh.status 查看条件、预检结果、阶段和历史记录

ACP CLI 还引入了面向升级的管理员命令,例如 ac adm upgradeac adm upgrade status--to-latest--to--allow-explicit-upgrade,用于从当前上下文请求业务集群升级并进行故障排查。

有关操作指南,请参阅 Upgrade

独立集群插件升级

ACP 4.3 增加了对使用 AlignedAgnostic 生命周期的集群插件进行独立升级的支持。

Cluster Plugins 页面现在会显示插件生命周期,符合条件的插件可以从列表页面或详情页面独立升级。Core 插件仍会随集群升级。

Huawei DCS 上基于 Alauda OS 的 global 集群

ACP 4.3 允许管理员在 Huawei DCS 上使用基于 Alauda OS 的不可变基础设施创建 global 集群。这将不可变操作模型从业务集群扩展到了 DCS 上的平台安装场景。

更多信息请参阅 About Immutable Infrastructure

不可变基础设施支持 Huawei Cloud Stack

ACP 4.3 增加了对 Huawei Cloud Stack (HCS) 的 Immutable Infrastructure 支持。HCS provider 文档现在涵盖 provider 概览、安装、集群创建、节点管理、集群升级和 provider API,均归入 Immutable Infrastructure 文档集。

更多信息请参阅 About Immutable Infrastructure

4.3 周期中的 VMware vSphere 支持

ACP 4.3 开始引入对 VMware vSphere 的 Immutable Infrastructure 支持。provider 相关工作现已在 Immutable Infrastructure 文档集中跟踪,公开安装详情和最终插件命名仍在发布中。

更多信息请参阅 About Immutable Infrastructure

新版 Web Console 预览入口

ACP Core 现在提供下一代 Web Console 体验所需的顶部导航锚点。在 global 集群上安装 Alauda Container Platform Web Console Base 后,Container PlatformAdministrator 视图中的用户可以通过 Preview Next-Gen Console 入口打开新控制台,新控制台会在独立的浏览器标签页中打开。

该体验面向渐进式迁移而设计,并与 global 集群上的 Web Console Base 插件以及业务集群上的 Web Console Collector 插件配合使用。

Containerd 2.0 基线

ACP 4.3 将平台运行时基线升级到 containerd 2.0。对于依赖自定义 containerd 配置的环境,请在升级前检查依赖运行时的操作流程。

扩展第三方集群管理范围

对于第三方集群,ACP 4.3 现在接受范围为 >=1.19.0 <1.35.0 的 Kubernetes 版本。

此管理范围独立于用于确定 global 集群是否可以升级的 Kubernetes 兼容版本。

产品文档仍只发布已通过产品验证的第三方集群支持 Kubernetes 版本,以及默认 Extend 基线支持的版本。

Extend 基线的产品验证涵盖以下功能领域:

  • 安装和使用 Operators
  • 安装和使用 Cluster Plugins
  • 基于 ClickHouse 的日志记录
  • 基于 VictoriaMetrics 的监控

这并不意味着所有特定的 Operators 或 Cluster Plugins 都经过了产品验证。

对于超出此基线的特定 Operators 或 Cluster Plugins,请参阅相关产品文档或联系技术支持。

更多信息请参阅 Kubernetes Support MatrixImport Standard Kubernetes Cluster

扩展监控插件配置

ACP 4.3 扩展了监控插件的配置选项,使监控部署更容易适配 infra 节点放置方式和不同的存储布局。

对于使用 VictoriaMetrics 的 ACP Monitoring,管理员现在可以:

  • 配置插件级别的节点选择器和容忍度,以便将工作负载放置到专用 infra 节点
  • Storage TypeLocalVolume 时,配置 VictoriaMetrics 的数据存储目录
  • 移除 VictoriaMetrics 部署原有的三节点限制

对于使用 Prometheus 的 ACP Monitoring,管理员现在可以配置插件级别的节点选择器和容忍度,从而通过插件配置将监控负载调度到专用 infra 节点。

WARNING

如果之前使用 patch 资源或基于 override 的自定义配置分别定义节点选择器或容忍度,则升级到 ACP 4.3 后需要更新插件配置。更新后的插件配置生效后,必须删除相关 patch 资源或 override 设置。

有关操作指南,请参阅 InstallationPlanning Infra Nodes for Monitoring

StatefulSet 跨集群应用灾难恢复解决方案

此版本引入了有状态应用的跨集群灾难恢复能力。该方案基于 Active-Passive 双中心架构,结合 Alauda Build of VolSync 异步数据同步和 GitOps 配置分发,实现分钟级 RTO 故障转移。

主要亮点:

  • 主集群处理所有 read/write 流量;备用集群通过定期 rsync 快照维护温备数据副本(RPO > 0)。
  • 支持三种运行场景:计划迁移、紧急故障转移和故障恢复切换。
  • 备用集群默认以 replicas=0 运行;存储和计算资源保持冷备用,不处理任何业务流量。
  • 适用于不要求严格零数据丢失的工作负载(RPO = 0)。对于金融或事务核心应用,请改用原生数据库复制。

更多详情请参阅:Cross-Cluster Application Disaster Recovery for Stateful Applications

Alauda Container Platform Registry - 镜像管理增强

此版本引入 ac imagesac adm prune images 命令,实现从命令行对 Registry 镜像进行完整生命周期管理。

  • ac get images:列出 Registry 中的镜像。结果限定为当前用户有权限访问的命名空间,并支持命名空间过滤和多种输出格式(tablejsonyamlwide)。
  • ac delete images:按 Registry 路径删除一个或多个镜像标签。内置命名空间权限检查;默认以 dry-run 模式运行以预览影响,实际删除需要 --confirm
  • ac adm prune images:用于清理未被任何集群 Pod 引用的镜像 manifest 的管理员命令。灵活的清理策略包括保留时长、保留数量、允许列表和 --all 范围。清理后可选触发 Registry GC。还支持通过 CronJob 定期清理。

更多详情请参阅:Cluster Image Registry Cleanup: Administrator Guide for Manual and Scheduled Tasks

Alauda Container Platform Project Application Essential(Alpha)

此版本引入 Alauda Container Platform Project Application Essential 插件,该插件基于全新的 Next-Gen Console 前端框架构建。它部署在 global 集群上,以项目为中心提供跨集群应用编排和完整生命周期管理,并充分遵循用户权限。

主要亮点:

  • 跨集群编排:在单个项目中将应用统一部署到多个成员集群。
  • 完整生命周期管理:支持 createupdatescalerollbackdelete,并实时同步跨集群的应用状态。
  • 项目隔离:所有操作均限定在项目边界内,确保项目之间实现自然隔离。
  • 权限感知:严格执行 RBAC 权限,仅显示用户有权访问的资源。

Underlay 和 Egress Gateway 增强

ACP 4.3 围绕 underlay 访问和 egress gateway 操作扩展了核心 CNI 网络能力。

主要增强包括:

  • 改进 egress gateway 工作负载的高可用和快速切换设计,减少节点维护或故障转移期间对服务的影响。
  • 提供 egress gateway Pod 的资源保护指南和平台支持,帮助降低流量突增或副本增长时节点资源争用的风险。
  • 支持为 egress gateway 工作负载配置污点,从而更好地在专用节点上实现放置隔离。
  • 支持管理 underlay NIC 的 VLAN 子接口。
  • 增加对子网资源的 YAML 编辑支持。
  • 增加对集中式 gateway 节点选择器设置的支持。
  • 增加对集中式 gateway 场景子网 CRD 的支持。

这些增强使 ACP 更能适应复杂的企业网络环境,并简化从早期暴露模型迁移到基于 underlay 的设计。

Gateway API 增强

ACP 4.3 强化了 Gateway API,使其成为平台中的关键 Layer 7 负载均衡能力。

主要增强包括:

  • 支持基于 host network 的 gateway 部署场景。
  • 支持通过 metalLB + Envoy Gateway proxy + underlay 暴露服务,使业务流量可以避开管理网络。
  • 支持为 Gateway API 配置自定义 VIP 地址,有助于在重建或生命周期变更期间保持服务暴露地址稳定。

基于 PVC 保护的有状态应用灾难恢复

ACP 4.3 引入了更强的有状态工作负载灾难恢复能力,包括 基于 PVC 的灾难恢复,以及对 MinIO 等存储后端应用的 基于 VolSync 的备份和恢复工作流支持。

此增强提高了有状态应用的跨集群恢复准备度,为存储密集型生产环境提供了更实用的保护路径。

Ceph 存储管理增强

ACP 4.3 改进了存储操作和基于 Ceph 的工作负载支持。

主要增强包括:

  • 增加从 UI 将磁盘放入不同 Ceph pool 的支持。
  • 改进对 Ceph 磁盘替换场景的操作支持。

这些变更改善了 day-2 存储操作,使基于 Ceph 的环境更易于在生产中管理。

虚拟化平台增强

ACP 4.3 提供了多项重要的虚拟化相关改进。

主要增强包括:

  • 改进 VM 创建和显示工作流。
  • 增加虚拟化相关场景对 Astra Linux 的支持。
  • 增加对虚拟机多 NIC 和 NIC 热插拔能力的支持。

这些增强改善了虚拟化易用性,并扩展了企业环境中的来宾工作负载兼容性。

已弃用和移除的功能

停用 Operation Statistics

计量和计费插件现已正式发布,并完全覆盖之前由 Operation Statistics 功能提供的能力。因此,Platform Management 下顶层的 Operations Statistics 入口将被移除。

  • 对于新部署的平台,不再安装 Operations Statistics 组件。如果需要计量或计费能力,请使用 Cost Management 插件。
  • 对于升级的平台,升级后 Operations Statistics 将停止收集计量数据,而历史数据仍可用。如果需要清理或迁移数据,请提交支持请求。

旧版监控和告警 API

/v2/metrics/v2/alerts/v1/alerthistories 端点已在 ACP 4.3.3 中弃用。本版本中仍提供这些端点,并计划在未来版本中移除。请迁移到对应的 /platform 端点,这些端点会对每个请求应用平台的角色和权限模型。

已弃用端点替代端点
GET /v2/metrics/{cluster}/indicatorsGET /platform/monitoring.alauda.io/v1beta1/clusters/{cluster}/indicators
POST /v2/metrics/{cluster}/query
POST /v2/metrics/{cluster}/query_range
GET /platform/monitoring.alauda.io/v1beta1/clusters/{cluster}/metrics
GET /v2/metrics/{cluster}/prometheus/query
GET /v2/metrics/{cluster}/prometheus/query_range
GET /platform/monitoring.alauda.io/v1beta1/clusters/{cluster}/metrics
GET /v2/metrics/{cluster}/prometheus/label/{labelName}/valuesGET /platform/monitoring.alauda.io/v1beta1/clusters/{cluster}/variables
GET /v2/alerts/{cluster}/alertstatusGET /platform/alerts.alauda.io/v1beta1/clusters/{cluster}/alerts
GET /v2/alerts/{cluster}/silencestatusGET /platform/alerts.alauda.io/v1beta1/clusters/{cluster}/silences
GET /v1/alerthistoriesGET /platform/alerts.alauda.io/v1beta1/histories
GET /v1/alerthistories/{name}/messagesGET /platform/alerts.alauda.io/v1beta1/histories/{name}/messages

替代端点的命名空间范围变体位于 projects/{project}/clusters/{cluster}/namespaces/{namespace} 下。监控端点和告警历史端点的项目范围变体位于 projects/{project} 下。有关监控端点参考,请参阅 Monitoring APIs

已修复问题

  • 修复了 olm-registry pod 持续重启导致 OperatorHub 无法正常使用的问题。该问题由 CIS 合规加固时添加的 `seccompProfile: RuntimeDefault` 安全配置引起,该配置拦截了 CGO 操作所需的 `clone` 系统调用。已调整 seccomp 配置以允许必要的系统调用,同时保持安全合规性。已在 ACP 4.3.0 修复。
  • 修复了当集群安装 60+ 个 Operator 时,原生应用创建接口权限校验极慢(10秒以上)的性能问题。已在 ACP 4.3.0 修复。
  • 当使用 Alauda Container Platform Cluster Enhancer 提供的 etcd 备份功能时,如果用户配置将 etcd 备份到 S3 存储,插件无法获取 secretRef 中引用的 Secret 对象。原因是插件缺少读取 Secret 的 RBAC 权限,导致 S3 认证信息获取失败。此问题已在 ACP 4.3.0 中修复。
  • 当使用 Alauda Container Platform Monitoring for VictoriaMetrics 且多个集群共享同一个 Storage 时,告警策略 cpaas-certificates-rule 存在两个问题:告警触发时无法区分来自哪个集群,以及该策略会监控客户的 secret 而非仅监控平台证书。该问题已在 v4.3.0 修复。
  • metis 组件的临时存储(ephemeral-storage)限额配置过小,运行中用量超出限额后会导致 metis 容器反复重启。该问题已在 v4.3.0 修复,限额已调整为合理值。
  • 业务应用使用自定义 ServiceAccount 时,平台不会自动为该 ServiceAccount 注入 imagePullSecret,导致应用无法从集群镜像仓库拉取镜像。该问题已在 v4.3.0 修复。
  • 当 image-registry 的 imagePullSecret 以“新建 Secret + 删除旧 Secret”的方式自动轮转后,仍引用旧 Secret 的历史 Pod 在旧 Secret 失效之后启动时无法拉取镜像。该问题已在 v4.3.0 修复。
  • 进入创建命名空间页面时,如果页面请求返回较慢,可能出现没有默认选中集群信息的情况,进而触发页面其它接口报错;反复刷新页面时会偶尔出现项目配额无法正常展示的现象。该问题已在 v4.3.0 修复。
  • 在定时任务执行记录的实时日志页面,日志结束时显示的英文提示 Logging has ended 表意不够清晰。该问题已在 v4.3.0 修复,该提示已调整为 End of logs。
  • 在 Windows 上编辑 ConfigMap 时,换行符的处理与 macOS 上不一致,复制粘贴进来的内容格式会出现错乱。该问题已在 v4.3.0 修复,两个平台上的换行行为保持一致。

已知问题

  • 在大规模业务集群中,VictoriaMetrics vmselect 执行 recording rule 查询时可能产生较高的磁盘读写,增加磁盘使用压力并影响监控查询性能。该问题已在 ACP v4.3.2 修复。
  • 用户使用 kubectl top node 命令查询节点用量时会返回报错,该问题已在 4.3.1 版本解决。
  • 升级场景中生成的 apiserver.crt 缺少 Authority Key Identifier (AKI) 扩展,新版本 Go TLS 校验可能拒绝该证书,导致 Jenkins 流水线连接 kube-apiserver 失败。此问题已在 v4.3.1 修复,升级生成的 apiserver.crt 会携带 AKI 信息。
  • 使用 violet push 推送 chart package 时,虽然 push 显示成功,但该 package 在 public-charts 仓库中可能无法看到。
    临时解决方案: 重新 push 一次。
  • 在启用多副本 VPC Egress Gateway 的场景下,部分命名空间可能完全无法访问集群外部网络,且连接中断后不会自动恢复,需要重启业务容器才能恢复通信。该问题已在 v4.3.3 修复。
  • 通过 YAML 安装 Image Registry 并启用 S3 存储时,如果同一份 YAML 中仍保留 persistence 配置,global 集群不会生成对应的 ModuleInfo,安装流程无法继续。该问题已在 v4.3.2 修复。
  • Image Registry 以多副本部署、使用 NFS RWX 共享存储并通过 ALB2 或 nginx Ingress 暴露时,若入口层未启用会话保持,同一次 push 的请求会被分发到不同的 Registry 副本,导致镜像 push 随机失败并报 blob upload unknown 或 manifest blob unknown。该问题已在 v4.3.2 修复。
  • 本地存储的设备发现组件以较高频率更新资源,在节点数量较多的集群上会持续产生大量审计日志。目前没有可用的规避方式。
  • 删除对象存储池后再次创建,新建的存储池状态异常,且再次删除会一直停留在“删除中”。可由集群管理员从存储组件日志中确认残留的存储池并手动删除。
  • 通过 YAML 创建应用时使用 defaultMode 字段导致应用创建失败。
    操作路径:容器平台 → 应用管理 → 应用列表 → 通过 YAML 创建(Create from YAML),当提交的 YAML 文件中包含 defaultMode 字段(通常用于 ConfigMap/Secret 的卷挂载权限配置)时,应用创建会失败并返回校验错误。
    解决方案:创建应用前手动移除 YAML 中所有 defaultMode 声明。
  • 当 Helm Chart 中设置了 pre-delete post-delete hook。
    执行删除模板应用,卸载 Chart 时,遇到某些原因导致 hook 执行失败,进而导致应用无法删除。需要排查原因,并优先解决 hook 执行失败的问题。