快速开始
本文旨在帮助新用户快速了解如何在 Alauda AI 中部署推理服务。通过部署一个简单的“文本生成”推理服务并进行体验,您可以快速掌握平台的主要功能和使用方法。
预计阅读时间
预计完成本文的阅读和操作大约需要 20 分钟。
注意事项
本文仅演示基础流程。有关详细的参数配置,请参考完整文档。
前提条件
- 您已经拥有一个平台管理员账号(用于创建和管理命名空间)。
- 您已准备好待部署的模型文件(可提前从 Hugging Face 或 ModelScope 等网站下载)。
- 如果您需要使用 GPU 推理,请确保已安装 GPU 插件。如果未安装,请在平台管理的插件中心安装 GPU 插件。
- 您了解 Kubernetes 和机器学习模型的基本概念。
步骤概览
操作步骤
步骤 1:创建命名空间
注意:如果您已经有命名空间,可跳过此步骤
命名空间是 Alauda AI 中多租户隔离的基础,每个项目都应使用独立的命名空间。您可以直接在 Alauda AI 中创建命名空间,也可以从容器平台导入已有命名空间。
- 进入 Alauda AI,并在顶部导航切换到 Admin View。
- 点击左侧导航栏中的 Namespaces。
- 点击 Create Namespace,输入名称,例如 "text-classification-demo"。
- 点击 Create 完成命名空间创建。
如果该命名空间已存在于容器平台中,请在 Namespaces 页面点击 Import Namespace,并选择要导入到 Alauda AI 的命名空间。
步骤 2:管理命名空间并添加用户
注意:如果命名空间已被管理且用户权限已配置,可跳过此步骤
将已创建的命名空间纳入 Alauda AI 管理,并向命名空间中添加用户:
- 进入 Alauda AI,并在顶部导航切换到 Admin View。
- 点击左侧导航栏中的 Namespaces。
- 如果该命名空间尚未被 Alauda AI 管理,请点击 Import Namespace,选择新建的 "text-classification-demo" 命名空间,并完成导入。
- 打开命名空间编辑页面,点击 Member Management。
- 导入需要使用该命名空间的用户,并为该用户分配以下角色之一:
- Owner:可管理该命名空间,并将其他成员导入为 editor 或 viewer。Owner 不能导入另一个 Owner。
- Editor:可使用该命名空间创建和管理 AI 资源。
- Viewer:可查看该命名空间中的资源。
步骤 3:上传模型
注意:如果您已经上传过模型,或者使用的是平台共享模型,可跳过此步骤
将文本分类模型上传到模型仓库:
- 进入 Alauda AI,在顶部导航选择 User View,并选择上一步中已管理的命名空间。
- 点击左侧导航栏中的 Model Repository,点击 Create Model Repository,并输入准备好的模型名称,例如 "Meta-Llama-3-8B-Instruct"。
- 完成模型上传请参考 Create Model Repository。
- 在 File Management 选项卡中,点击 Update metadata,并根据大模型的属性选择正确的 "Task Type" 和 "Framework"。
- Task Type:这是模型本身的属性,可以通过查看模型下载详情页面上的标签获取。它分为 "Text Generation"、"Image Generation" 等。
- Framework:这也是模型本身的属性,可以通过查看模型下载详情页面上的标签获取。它分为 "Transformers"、"MLflow" 等。大多数流行的开源 Large Language Models 都属于 "Transformers" 类型。
步骤 4:发布推理服务
将模型发布为在线推理服务:
- 在模型详情页面,点击 Publish inference API > Custom publishing。
- 配置服务参数:
- Name: meta-llama-3-8b-service
- Model: Meta-Llama-3-8B-Instruct
- Version: Branch-main
- Inference Runtimes: 需要根据 GPU 节点上安装的 cuda 版本进行选择。例如,如果安装了 cuda12.6 或更高版本,请选择 "vllm-cuda12.6-x86"。
- Resource Requests: 2CPU/20Gi Memory
- Resource Limits: 2CPU/20Gi Memory
- GPU Acceleration: HAMi NVIDIA
- gpu number: 1
- vgpu cores: 50
- GPU vmemory: 23552
- Storage: Mount existing PVC/Capacity 10Gi
- Auto Scaling: Off
- Number of instances: 1
- 点击 Publish,等待服务启动。
- 在 Inference Services 页面查看服务状态。
步骤 5:调用推理服务
测试已发布的推理服务:
- 点击左侧导航栏中的 Inference Services,点击 "Published Inference Service" 的名称,并在推理服务详情页面点击 Experience。
- 输入测试文本,例如 "Recommend a few good books"。
- 查看模型返回的生成文本和生成参数。