Kubeflow Trainer 快速入门
在 Alauda AI 上使用 Kubeflow Trainer v2 进行最小化分布式 PyTorch 训练的配置:自定义运行时镜像、ClusterTrainingRuntime 和一个 MNIST 示例 notebook。
运行时镜像
使用预构建镜像 alaudadockerhub/torch-distributed:v2.9.1-aml2,或者基于此 torch_distributed.Containerfile 构建你自己的镜像:
ClusterTrainingRuntime
请以集群管理员身份应用此 kf-torch-distributed.yaml。该 Pod spec 针对 Alauda AI 的默认 PSA 进行了收紧。
运行示例 notebook
该 notebook 会安装 Python 包并下载 MNIST,因此工作台需要具备出站网络访问能力。
下载 kubeflow-trainer-mnist.ipynb 并上传到你的工作台,然后按照其中的步骤提交 TrainJob。
有关 Trainer v2 功能的背景信息,请参阅上游 Kubeflow Trainer 文档。