发版日志

Alauda AI 2.8.0

Alauda AI 2.8.x 总结了 Alauda AI 2.3.x 之后引入的主要平台、模型服务、训练和 MLOps 变更。

升级支持

Alauda AI 2.8.x 支持从现有的 Alauda AI 2.3.x 环境升级。开始升级之前,请先阅读升级文档和各组件特定的迁移要求。

自 Alauda AI 2.3.x 起新增和优化的功能

平台架构和管理

  • 单集群应用架构 简化了 Alauda AI 2.6.x 及更高版本的部署模型。原有的 Alauda AI Essentialsaml-global)组件已移除,Alauda AI 产品入口通过平台内置的产品配置进行配置。
  • Namespace 管理和权限 允许管理员创建或导入 namespace,并分配 namespace 级别的 owner、editor 和 viewer 权限。原有的平台角色 aml-namespace-editorownerviewer 已弃用。
  • 认证和访问oauth2-proxy 集成,并支持独立的 OIDC provider 和访问入口。
  • 监控 与 Prometheus 集成,并包含基于 Perses 的 dashboard。
  • Alauda AI Platform Control Plane 通过 Alauda AI Operator 提供对受支持 AI 组件的集中管理。

模型服务和推理

  • Image Based Model Catalog 提供集中式目录,用于部署可直接使用的模型镜像,并支持可配置的持久化存储。
  • vLLM-ascend 通过自定义推理 runtime,支持在 Ascend NPU 上进行模型服务。
  • vLLM Expert Parallel 支持使用 expert parallelism 提供兼容的 Mixture-of-Experts 模型服务。
  • vLLM speculative decoding 支持 N-gram 和 EAGLE-3 配置路径,以降低推理延迟。
  • Alauda Build of InferNex Bridge 为推理工作负载提供弹性编排能力,包括 InferNexService 和多节点推理场景。
  • Model as a Service (MaaS) 提供基于 Alauda Build of Envoy Gateway 和 Alauda Build of Envoy AI Gateway 的托管模型服务网关。管理员可以通过 subscription 发布 LLMInferenceService 和外部模型服务,配置令牌限制,为用户分配 subscription,并查看流量和使用情况报告。

训练和分布式工作负载

  • Kubeflow 组件 已升级到 Kubeflow 1.11 发行线。Kubeflow Trainer v2 支持在 GPU 和 Ascend NPU 环境中运行分布式训练工作流。
  • JobSet Operator 支持用于分布式训练、批处理和 HPC 工作负载的协调 Kubernetes Job 组。
  • TrainingHub 增强 为单 GPU、多 GPU、多节点和 Ascend NPU 场景增加了 QLoRA 和 CPT 微调工作流。
  • Kueue 增强 增加了配额管理、fair sharing、gang scheduling、抢占、cohort,以及带有 checkpoint 和恢复工作流的可抢占 TrainJobs。
  • Dynamic Resource Allocation (DRA) 支持 GPU 切分和共享 GPU 资源分配,适用于训练工作负载。
  • ARM 支持 已扩展到 Kubeflow Pipelines 和训练 runtime。

MLOps 和开发体验

  • MLflow 增强 增加了 AI-agent tracing、外部 PostgreSQL 元数据存储和 object-storage 配置,同时保留了平台 SSO 和 Kubernetes RBAC 集成。
  • MLflow Operator 3.13.0 从 Alauda AI 2.8.x 开始通过 OperatorHub 提供。安装 Operator 并创建一个 MLflow custom resource 即可部署和管理 tracking server。
  • Alauda AI Workbench v0.2.0 在 Alauda AI 2.8.x 中通过 default AmlCluster 中的 workbench 组件进行管理。Alauda AI 会安装并协调 Workbench Operator 及其资源。
  • Elyra Pipeline Editor 使用户能够从 notebooks 和 scripts 以可视化方式组合 Kubeflow Pipelines 工作流。
  • 可复用 pipeline 组件 和扩展的 Kubeflow Pipeline 机制简化了 pipeline 工作流的编写和复用。
  • Llama Stack 为 agent 和检索工作流增加了 PGVector 和 Milvus vector store。
  • Alauda Build of Spark Operator 支持将 Spark 应用作为 Kubernetes 原生分布式工作负载运行。
  • coding-agent 和 agentic MLOps 工作流 为将 coding agent 连接到本地推理服务提供指导。

硬件和模型优化

  • Alauda Build of NPU Operator 通过 Alauda AI Operator 进行管理,并支持 Ascend 910B 和不可变操作系统环境。
  • Ascend NPU 微调 支持 MindSpeed-LLM 和 Kubeflow Trainer v2 工作流,包括 checkpoint 转换、数据集预处理和监督微调。
  • ModelSlim 集成 为 Ascend NPU 环境提供模型压缩和量化工作流。

Alauda AI 2.8.x 中的部署形式变更

Alauda AI Workbench、MLflow 和 Alauda Build of LeaderWorkerSet 通过 2.8.x 基于 Operator 的部署模型交付。Workbench 和 MLflow 作为独立的 Operator 从 OperatorHub 安装,而 LWS 通过 default AmlCluster 中的 lws 组件进行安装和协调:

组件Alauda AI 2.8.x 部署形式迁移说明
MLflowMLflow OLM Operator安装 MLflow Operator,并创建一个 MLflow custom resource。
Alauda Build of LeaderWorkerSet (LWS)由 Alauda AI 和 AmlCluster 管理的 Operatordefault AmlCluster 中启用 lws 组件;Alauda AI 会安装并协调 LWS。
Alauda AI WorkbenchWorkbench OLM Operator安装 Workbench Operator,并创建一个 Workbench custom resource。

这些部署形式变更并不意味着应删除现有用户数据。请遵循各组件的迁移说明,并在迁移期间保留适用的 PVC 和 custom resource。

已弃用功能

  • 原有的平台角色 aml-namespace-editorownerviewer 已弃用。请改用 namespace 级别权限。
  • 基于 GitLab 的 Model Catalog 已弃用。对于新的模型交付工作流,请使用带有 OCI 模型制品的 Image Based Model Catalog。
  • 原有的 Alauda AI Model Serving operator 已弃用。对于受支持的 serverless 推理场景,请使用 Knative Operator。

破坏性变更

部署和配置

  • Alauda AI 2.8.x 使用单集群应用架构。Alauda AI Essentialsaml-global)组件不再交付。
  • AI header 中移除了 project 和 cluster 切换功能。请使用 namespace 切换来更改工作上下文。
  • 登录和登出通过 oauth2-proxy 处理。
  • MLflow、Alauda Build of LeaderWorkerSet 和 Alauda AI Workbench 从其先前的部署形式改为 Operator。现有安装需要按组件进行迁移,而不是原地包升级。

自 Alauda AI 2.3.x 起修复的问题

以下问题在 Alauda AI 2.3.0 中被记录为已知问题,并在后续版本中修复:

  • vLLM Ascend: 修复了多卡 Ascend 推理部署可能无法变为 Ready 的问题,因为 HCCL 初始化不支持 root 和 non-root 两种模式。

已知问题

  • 当使用 VictoriaMetrics 收集以 Serverless 模式运行的推理服务监控数据时,推理服务可能不会缩容到零。