从 Kubeflow 监控面板部署推理服务

简介

Kubeflow 中央监控面板中的 KServe Endpoints 页面可在不离开 Kubeflow 的情况下部署、管理和监控推理服务。它会创建与 使用 CLI 创建推理服务 以及 Alauda AI 控制台相同的 serving.kserve.io/v1beta1 InferenceService 对象,因此在此处创建的服务可被这三者共同看到。

如果你的团队已经在使用 Kubeflow 监控面板,请使用此页面。对于平台自身的部署体验——模型仓库集成、推理服务模板和批量操作——请参阅 管理推理服务

前提条件

访问 Endpoints 界面

  1. 在中央监控面板侧边栏中单击 KServe Endpoints
  2. 在页面顶部选择你的命名空间。
  3. 你将看到已部署的推理服务列表,以及它们的状态和 URL。

部署新模型

  1. New Endpoint: 单击 New Endpoint

  2. InferenceService YAML

    • 提供你的 InferenceService 的 YAML 定义。你可以将下面的示例 YAML 作为模板。
  3. Deploy: 单击 Create

    apiVersion: serving.kserve.io/v1beta1
    kind: InferenceService
    metadata:
      name: my-model
      namespace: my-namespace
    spec:
      predictor:
        model:
          modelFormat:
            name: "transformers"
          runtime: aml-vllm-0.9.2-cuda-12.6
          storageUri: "hf://model-repo/model-name"

验证

部署完成后,等待状态变为 Ready

  • 检查:单击模型名称以查看 YAML 详细信息和日志。
  • 获取 URL:复制提供的端点 URL(例如,http://model-name.namespace.svc.cluster.local/v1/models/model-name:predict 或外部 URL)。
  • 测试:使用 curl 或 Python 客户端发送预测请求。