Alauda Build of KubeRay Operator
Alauda Build of KubeRay Operator 是一个 Kubernetes 原生 operator,提供在 Kubernetes 上运行 Ray 应用程序的完整解决方案。它基于开源 KubeRay 项目构建,使用 Kubernetes Custom Resource Definitions (CRDs) 简化了 Ray 集群、作业和服务的部署与管理。
概述
Alauda Build of KubeRay Operator 提供三个核心 CRD:
- RayCluster:完全管理 Ray 集群的生命周期,包括集群创建/删除、自动扩缩容和故障容错。
- RayJob:在集群就绪时自动创建 RayCluster 并提交作业。支持作业完成后的自动清理。
- RayService:管理 Ray Serve 部署,支持零停机升级以及用于生产环境 ML 模型服务的高可用性。
关键特性
- 自动扩缩容:根据工作负载需求自动调整 worker 节点数量。
- 异构计算:支持 GPU 和其他加速器资源,用于分布式训练和推理。
- 多 Ray 版本:在同一个 Kubernetes 集群中运行不同版本的 Ray。
- 故障容错:提供用于处理节点故障和作业重试的内置机制。
- Kubernetes 集成:与现有 Kubernetes 工具和工作流无缝集成。
- 生态系统支持:可与可观测性工具(Prometheus、Grafana)、队列系统(Kueue、Volcano)以及 ingress controller 配合使用。
使用场景
- 分布式机器学习:在多个节点之间扩展 ML 训练工作负载。
- 模型服务:使用 Ray Serve 以大规模方式部署和提供 ML 模型服务。
- 批量推理:使用并行推理工作负载处理大型数据集。
- 超参数调优:使用 Ray Tune 运行分布式超参数优化。
- LLM 推理:部署大语言模型以进行在线推理。
更多详情,请参阅 Ray on Kubernetes。