硬件配置文件管理
为了为您的数据科学家和工程师配置特定的硬件配置和约束,以便他们在平台上部署模型推理服务时使用,您必须创建并管理关联的硬件配置文件。硬件配置文件将节点亲和性、容忍度和资源约束封装为一个可复用的实体。
创建硬件配置文件
前提条件
- 您已使用具有管理员权限的用户登录平台。
- 您已确认底层 Kubernetes 集群中可用的目标计算资源,包括 CPU、内存以及任何专用加速器(例如 GPU 型号)。
- 您熟悉 Kubernetes 调度概念,例如 Node Selectors、Taints 和 Tolerations。
操作步骤
步骤 1:导航到硬件配置文件
在主导航菜单中,进入 Hardware Profile。将打开 Hardware Profiles 页面,显示系统中现有的硬件配置文件。
步骤 2:开始创建硬件配置文件
在右上角单击 Create hardware profile。将打开 Create hardware profile 配置页面。
步骤 3:配置基本详情
在 Basic Details 部分,为该配置文件提供标识信息:
- Name:为硬件配置文件输入一个唯一且具有描述性的名称(例如,
gpu-high-performance-profile)。 - Description:(可选)输入清晰的硬件配置文件描述,以帮助其他用户理解其预期用途。
步骤 4:配置资源标识符(requests 和 limits)
您可以为计算资源定义约束,例如 CPU、内存或特定加速器(例如 nvidia.com/gpu)。单击 Add Identifier 或修改已存在的资源字段。您可以添加两类标识符:
- Built-in Identifiers:从平台配置的标准资源类型下拉列表中选择(例如
cpu、memory、nvidia.com/gpu)。对于这些内置类型,Identifier、Display Name 和 Resource Type 由平台严格预定义,且不可更改。 - Custom Identifiers:输入您自己的唯一资源参数。您必须手动定义:
- Identifier:精确的 Kubernetes 资源键(例如
nvidia.com/a100或某个自定义厂商 ASIC)。 - Display Name:将在 UI 中显示的、便于阅读的资源名称(例如
NVIDIA A100 GPU)。 - Resource Type:为集群准确地对资源分类:
CPU/Memory:选择此项以定义标准计算边界。Accelerator:主要用于任何专用 AI 芯片(例如 NVIDIA GPU、AMD GPU 或 Intel Gaudi 加速器),这些芯片用于模型训练或高负载推理任务。将类型设置为 Accelerator 后,平台会明确将该依赖识别为核心 AI 计算引擎。Other:用于附加到节点上的非 AI 辅助设备(例如用于 RDMA 的高速网络接口、infiniband 或独特的存储参数)。
- Identifier:精确的 Kubernetes 资源键(例如
对于内置标识符和自定义标识符,您都必须配置精确的分配边界:
- Default:设置要分配的该资源的基础数量。当用户选择该配置文件时,这一值会最初注入到其工作负载中。
- Minimum allowed:定义可接受的最小请求量。它作为硬性下限,用于防止用户为关键模型请求不足的资源。
- Maximum allowed:(可选)指定绝对最大限制。这将严格防止用户预留超出已定义容量阈值的过多集群资源。
步骤 5:配置节点调度规则
为了严格控制推理工作负载可以调度到哪些节点,请设置 Node Selectors 和 Tolerations。这可确保高性能工作负载落到物理上正确的节点池中。
- Node Selectors:在 Node Selectors 部分,单击 Add Node Selector。输入 Key 和 Value 约束。平台会自动注入这些键值对,以将工作负载限制到仅匹配标签的节点上。
- Tolerations:在 Tolerations 部分,单击 Add Toleration,以显式允许工作负载调度到具有匹配 taint 的节点上。定义 Key、Operator(例如
Equal、Exists)、Value、Effect(例如NoSchedule、NoExecute)以及可选的 Toleration Seconds。与原生 Kubernetes tolerations 一样,您可以为单个硬件配置文件添加多个 toleration。
步骤 6:完成创建
检查您输入的配置,确保准确无误。单击 Create,完成硬件配置文件的创建。
更新硬件配置文件
您可以更新部署中的现有硬件配置文件,以适应新的基础设施变化、硬件升级或逐步修订的资源策略。您可以可靠地更改重要的标识信息、最小和最大资源约束,或者通过节点选择器和容忍度调整集群节点放置。
步骤 1:定位硬件配置文件
在导航菜单中,单击 Hardware Profile。从列表中找到要更新的硬件配置文件。
步骤 2:编辑硬件配置文件
在相关硬件配置文件所在行的右侧,单击操作菜单(⋮),然后选择 Update。
步骤 3:修改配置
对硬件配置文件配置进行必要的修改:
- 安全地调整 Description。
- 更新特定资源标识符的 Default、Minimum 或 Maximum allowed 阈值,使其与当前集群容量严格匹配。
- 修改 Node Selectors 以匹配不同的节点标签,或更新 Tolerations 以适配新设置 taint 的工作节点。
步骤 4:应用更改
单击 Update,永久应用您的更改。
注意:更新硬件配置文件通常只会影响后续新配置的工作负载。之前使用此硬件配置文件创建的正在运行的部署将严格保留最初注入的约束。若要将新的硬件配置文件设置强制应用到已运行的工作负载上,您必须显式编辑或重新部署对应的推理服务。
删除硬件配置文件
当某个特定硬件配置已过时或涉及已废弃的 Kubernetes 节点时,您可以安全地删除其硬件配置文件。这样可确保未来没有数据科学家错误地选择过时的节点配置或无法管理的限制。
步骤 1:定位硬件配置文件
在主导航菜单中,单击 Hardware Profile。找到要删除的硬件配置文件。
步骤 2:删除
单击相关硬件配置文件行最右侧的操作菜单(⋮),然后谨慎选择 Delete。
步骤 3:确认删除
将出现一个警告对话框,要求您确认删除操作。单击 Delete。
注意:删除硬件配置文件不会删除或主动中断之前使用该配置文件部署的正在运行的推理服务。它们将继续在平台 webhook 最初注入的资源限制和拓扑约束下正常运行。不过,已删除的硬件配置文件将立即从所有新建部署的配置文件选择下拉列表中消失。
将硬件配置文件用于推理服务
当用户(例如数据科学家、AI 工程师和开发者)动态创建或配置模型推理服务(包括 InferenceService 和 LLMInferenceService)时,他们可以高效利用预定义的硬件配置文件。
硬件配置文件可无缝简化手动配置复杂节点调度规则和设置显式资源限制的繁琐任务。根据您的工作负载具体需求,您既可以采用严格的默认配置,也可以在所选配置文件正式授权的边界内精细自定义限制。
步骤 1:启动部署表单
在导航菜单中,进入 Service Manage。单击 Create,启动一个全新模型推理服务的部署表单。
步骤 2:选择硬件配置文件
在部署表单中,向下滚动并进入 Deployment Resources 部分。在这里,您可以先选择一个 Config Type 来定义资源限制:
- 默认设置为 Hardware Profile。随后,您可以单击 Profile 下拉菜单,选择一个当前由平台管理员为您目标计算环境启用的特定硬件配置文件。
- 或者,如果您希望绕过预定义配置文件并手动提供原始 Kubernetes 资源限制,也可以选择 Custom。
步骤 3:查看并自定义资源分配
选定硬件配置文件后,表单会安全地锁定管理员整理的对应基础定义。不过,您仍然可以优化精确的资源限制:
- 要查看管理员指定的边界,请单击配置文件下拉菜单旁的 View Detail 按钮。这将打开一个信息抽屉或模态框,明确展示硬件配置文件的详细信息,包括已配置的节点规则以及 CPU、Memory 和 GPUs 的绝对限制。
- 根据您的具体工作负载需求,单击硬件配置文件部分下方动态显示的 Custom Configuration 按钮。自定义 requests 和 limits 必须在概念上严格保持在硬件配置文件定义的最小和最大约束范围内。
- 通过执行此自定义操作,您将能够直接修改推理服务最终的 Requests 和 Limits 配置。如果您提交了无效的 request 参数,校验引擎会优雅地捕获该偏差并向您显示验证错误。
步骤 4:部署
填写服务的其余参数,然后单击 Deploy。