发版日志
目录
Alauda AI 2.8.0升级支持自 Alauda AI 2.3.x 起新增和优化的功能平台架构和管理模型服务和推理训练和分布式工作负载MLOps 和开发体验硬件和模型优化Alauda AI 2.8.x 中的部署形式变更已弃用功能破坏性变更部署和配置自 Alauda AI 2.3.x 起修复的问题已知问题Alauda AI 2.8.0
Alauda AI 2.8.x 总结了 Alauda AI 2.3.x 之后引入的主要平台、模型服务、训练和 MLOps 变更。
升级支持
Alauda AI 2.8.x 支持从现有的 Alauda AI 2.3.x 环境升级。开始升级之前,请先阅读升级文档和各组件特定的迁移要求。
自 Alauda AI 2.3.x 起新增和优化的功能
平台架构和管理
- 单集群应用架构 简化了 Alauda AI 2.6.x 及更高版本的部署模型。原有的 Alauda AI Essentials(
aml-global)组件已移除,Alauda AI 产品入口通过平台内置的产品配置进行配置。 - Namespace 管理和权限 允许管理员创建或导入 namespace,并分配 namespace 级别的 owner、editor 和 viewer 权限。原有的平台角色
aml-namespace-editor、owner和viewer已弃用。 - 认证和访问 与
oauth2-proxy集成,并支持独立的 OIDC provider 和访问入口。 - 监控 与 Prometheus 集成,并包含基于 Perses 的 dashboard。
- Alauda AI Platform Control Plane 通过 Alauda AI Operator 提供对受支持 AI 组件的集中管理。
模型服务和推理
- Image Based Model Catalog 提供集中式目录,用于部署可直接使用的模型镜像,并支持可配置的持久化存储。
- vLLM-ascend 通过自定义推理 runtime,支持在 Ascend NPU 上进行模型服务。
- vLLM Expert Parallel 支持使用 expert parallelism 提供兼容的 Mixture-of-Experts 模型服务。
- vLLM speculative decoding 支持 N-gram 和 EAGLE-3 配置路径,以降低推理延迟。
- Alauda Build of InferNex Bridge 为推理工作负载提供弹性编排能力,包括
InferNexService和多节点推理场景。 - Model as a Service (MaaS) 提供基于 Alauda Build of Envoy Gateway 和 Alauda Build of Envoy AI Gateway 的托管模型服务网关。管理员可以通过 subscription 发布
LLMInferenceService和外部模型服务,配置令牌限制,为用户分配 subscription,并查看流量和使用情况报告。
训练和分布式工作负载
- Kubeflow 组件 已升级到 Kubeflow 1.11 发行线。Kubeflow Trainer v2 支持在 GPU 和 Ascend NPU 环境中运行分布式训练工作流。
- JobSet Operator 支持用于分布式训练、批处理和 HPC 工作负载的协调 Kubernetes Job 组。
- TrainingHub 增强 为单 GPU、多 GPU、多节点和 Ascend NPU 场景增加了 QLoRA 和 CPT 微调工作流。
- Kueue 增强 增加了配额管理、fair sharing、gang scheduling、抢占、cohort,以及带有 checkpoint 和恢复工作流的可抢占 TrainJobs。
- Dynamic Resource Allocation (DRA) 支持 GPU 切分和共享 GPU 资源分配,适用于训练工作负载。
- ARM 支持 已扩展到 Kubeflow Pipelines 和训练 runtime。
MLOps 和开发体验
- MLflow 增强 增加了 AI-agent tracing、外部 PostgreSQL 元数据存储和 object-storage 配置,同时保留了平台 SSO 和 Kubernetes RBAC 集成。
- MLflow Operator 3.13.0 从 Alauda AI 2.8.x 开始通过 OperatorHub 提供。安装 Operator 并创建一个
MLflowcustom resource 即可部署和管理 tracking server。 - Alauda AI Workbench v0.2.0 在 Alauda AI 2.8.x 中通过
defaultAmlCluster中的workbench组件进行管理。Alauda AI 会安装并协调 Workbench Operator 及其资源。 - Elyra Pipeline Editor 使用户能够从 notebooks 和 scripts 以可视化方式组合 Kubeflow Pipelines 工作流。
- 可复用 pipeline 组件 和扩展的 Kubeflow Pipeline 机制简化了 pipeline 工作流的编写和复用。
- Llama Stack 为 agent 和检索工作流增加了 PGVector 和 Milvus vector store。
- Alauda Build of Spark Operator 支持将 Spark 应用作为 Kubernetes 原生分布式工作负载运行。
- coding-agent 和 agentic MLOps 工作流 为将 coding agent 连接到本地推理服务提供指导。
硬件和模型优化
- Alauda Build of NPU Operator 通过 Alauda AI Operator 进行管理,并支持 Ascend 910B 和不可变操作系统环境。
- Ascend NPU 微调 支持 MindSpeed-LLM 和 Kubeflow Trainer v2 工作流,包括 checkpoint 转换、数据集预处理和监督微调。
- ModelSlim 集成 为 Ascend NPU 环境提供模型压缩和量化工作流。
Alauda AI 2.8.x 中的部署形式变更
Alauda AI Workbench、MLflow 和 Alauda Build of LeaderWorkerSet 通过 2.8.x 基于 Operator 的部署模型交付。Workbench 和 MLflow 作为独立的 Operator 从 OperatorHub 安装,而 LWS 通过 default AmlCluster 中的 lws 组件进行安装和协调:
这些部署形式变更并不意味着应删除现有用户数据。请遵循各组件的迁移说明,并在迁移期间保留适用的 PVC 和 custom resource。
已弃用功能
- 原有的平台角色
aml-namespace-editor、owner和viewer已弃用。请改用 namespace 级别权限。 - 基于 GitLab 的 Model Catalog 已弃用。对于新的模型交付工作流,请使用带有 OCI 模型制品的 Image Based Model Catalog。
- 原有的 Alauda AI Model Serving operator 已弃用。对于受支持的 serverless 推理场景,请使用 Knative Operator。
破坏性变更
部署和配置
- Alauda AI 2.8.x 使用单集群应用架构。Alauda AI Essentials(
aml-global)组件不再交付。 - AI header 中移除了 project 和 cluster 切换功能。请使用 namespace 切换来更改工作上下文。
- 登录和登出通过
oauth2-proxy处理。 - MLflow、Alauda Build of LeaderWorkerSet 和 Alauda AI Workbench 从其先前的部署形式改为 Operator。现有安装需要按组件进行迁移,而不是原地包升级。
自 Alauda AI 2.3.x 起修复的问题
以下问题在 Alauda AI 2.3.0 中被记录为已知问题,并在后续版本中修复:
- vLLM Ascend: 修复了多卡 Ascend 推理部署可能无法变为
Ready的问题,因为 HCCL 初始化不支持 root 和 non-root 两种模式。
已知问题
- 当使用 VictoriaMetrics 收集以 Serverless 模式运行的推理服务监控数据时,推理服务可能不会缩容到零。