快速开始

本文旨在帮助新用户快速了解如何在 Alauda AI 中部署推理服务。通过部署一个简单的“文本生成”推理服务并进行体验,您可以快速掌握平台的主要功能和使用方法。

预计阅读时间

预计完成本文的阅读和操作大约需要 20 分钟。

注意事项

本文仅演示基础流程。有关详细的参数配置,请参考完整文档。

前提条件

  • 您已经拥有一个平台管理员账号(用于创建和管理命名空间)。
  • 您已准备好待部署的模型文件(可提前从 Hugging Face 或 ModelScope 等网站下载)。
  • 如果您需要使用 GPU 推理,请确保已安装 GPU 插件。如果未安装,请在平台管理的插件中心安装 GPU 插件。
  • 您了解 Kubernetes 和机器学习模型的基本概念。

步骤概览

步骤操作描述备注
1创建命名空间在 Alauda AI 或容器平台中创建一个命名空间如果您已经有命名空间,可跳过此步骤
2管理命名空间并添加用户将命名空间纳入 Alauda AI 管理,并向命名空间中添加用户如果命名空间已被管理且用户权限已配置,可跳过此步骤
3上传模型将模型文件上传到模型仓库如果您已经上传过模型,或者使用的是平台共享模型,可跳过此步骤
4发布推理服务将模型发布为在线推理服务
5调用推理服务通过 API 或“体验”功能调用推理服务

操作步骤

步骤 1:创建命名空间

注意:如果您已经有命名空间,可跳过此步骤

命名空间是 Alauda AI 中多租户隔离的基础,每个项目都应使用独立的命名空间。您可以直接在 Alauda AI 中创建命名空间,也可以从容器平台导入已有命名空间。

  1. 进入 Alauda AI,并在顶部导航切换到 Admin View
  2. 点击左侧导航栏中的 Namespaces
  3. 点击 Create Namespace,输入名称,例如 "text-classification-demo"。
  4. 点击 Create 完成命名空间创建。

如果该命名空间已存在于容器平台中,请在 Namespaces 页面点击 Import Namespace,并选择要导入到 Alauda AI 的命名空间。

步骤 2:管理命名空间并添加用户

注意:如果命名空间已被管理且用户权限已配置,可跳过此步骤

将已创建的命名空间纳入 Alauda AI 管理,并向命名空间中添加用户:

  1. 进入 Alauda AI,并在顶部导航切换到 Admin View
  2. 点击左侧导航栏中的 Namespaces
  3. 如果该命名空间尚未被 Alauda AI 管理,请点击 Import Namespace,选择新建的 "text-classification-demo" 命名空间,并完成导入。
  4. 打开命名空间编辑页面,点击 Member Management
  5. 导入需要使用该命名空间的用户,并为该用户分配以下角色之一:
    • Owner:可管理该命名空间,并将其他成员导入为 editor 或 viewer。Owner 不能导入另一个 Owner。
    • Editor:可使用该命名空间创建和管理 AI 资源。
    • Viewer:可查看该命名空间中的资源。

步骤 3:上传模型

注意:如果您已经上传过模型,或者使用的是平台共享模型,可跳过此步骤

将文本分类模型上传到模型仓库:

  1. 进入 Alauda AI,在顶部导航选择 User View,并选择上一步中已管理的命名空间。
  2. 点击左侧导航栏中的 Model Repository,点击 Create Model Repository,并输入准备好的模型名称,例如 "Meta-Llama-3-8B-Instruct"。
  3. 完成模型上传请参考 Create Model Repository
  4. File Management 选项卡中,点击 Update metadata,并根据大模型的属性选择正确的 "Task Type" 和 "Framework"。
    • Task Type:这是模型本身的属性,可以通过查看模型下载详情页面上的标签获取。它分为 "Text Generation"、"Image Generation" 等。
    • Framework:这也是模型本身的属性,可以通过查看模型下载详情页面上的标签获取。它分为 "Transformers"、"MLflow" 等。大多数流行的开源 Large Language Models 都属于 "Transformers" 类型。

步骤 4:发布推理服务

将模型发布为在线推理服务:

  1. 在模型详情页面,点击 Publish inference API > Custom publishing
  2. 配置服务参数:
    • Name: meta-llama-3-8b-service
    • Model: Meta-Llama-3-8B-Instruct
    • Version: Branch-main
    • Inference Runtimes: 需要根据 GPU 节点上安装的 cuda 版本进行选择。例如,如果安装了 cuda12.6 或更高版本,请选择 "vllm-cuda12.6-x86"。
    • Resource Requests: 2CPU/20Gi Memory
    • Resource Limits: 2CPU/20Gi Memory
    • GPU Acceleration: HAMi NVIDIA
      • gpu number: 1
      • vgpu cores: 50
      • GPU vmemory: 23552
    • Storage: Mount existing PVC/Capacity 10Gi
    • Auto Scaling: Off
    • Number of instances: 1
  3. 点击 Publish,等待服务启动。
  4. Inference Services 页面查看服务状态。

步骤 5:调用推理服务

测试已发布的推理服务:

  1. 点击左侧导航栏中的 Inference Services,点击 "Published Inference Service" 的名称,并在推理服务详情页面点击 Experience
  2. 输入测试文本,例如 "Recommend a few good books"。
  3. 查看模型返回的生成文本和生成参数。