监控指标和视图

功能概述

Alauda AI 的 Monitoring & Ops 模块中的资源监控可为您的推理服务提供 CPU、内存、GPU、令牌使用情况以及请求指标的实时洞察。此功能可帮助您识别性能瓶颈、优化资源分配,并确保服务稳定运行。它尤其适用于以下场景:

  • 性能调优:诊断高资源使用情况并调整资源限制。
  • 异常检测:监控资源消耗和请求模式的突发峰值。
  • 容量规划:分析历史趋势,以高效扩展资源。
  • 成本优化:跟踪令牌使用情况和 GPU 利用率,以便进行预算管理。

主要特性

  • 资源监控
    • CPU Usage:显示 CPU 的绝对使用量(例如,已使用的 cores)。
    • CPU Utilization:以分配资源的百分比显示 CPU 使用率。
    • Memory Usage:跟踪实际内存消耗(例如,GB)。
    • Memory Utilization:以分配资源的百分比显示内存使用率。
  • 计算监控
    • GPU Usage:跟踪 GPU 计算资源消耗。
    • GPU Utilization:以分配资源的百分比显示 GPU 使用率。
    • GPU Memory Usage:监控 GPU 内存消耗。
    • GPU Memory Utilization:以分配资源的百分比显示 GPU 内存使用率。
    • 注意:MPS 部署模式不支持 GPU 计算和内存监控。
  • 其他监控
    • Token Metrics:跟踪 prompt 和 generation tokens(适用于 'vllm' runtime 服务)。
    • Request Metrics:监控响应时间(avg/tp50/p90/p95)、QPS(success/fail)以及流量(in/out)。
  • 时间范围选择:可按自定义周期分析指标(从 30 分钟到 7 天)。

访问资源监控

步骤 1:进入推理服务详情页

  1. 在左侧导航栏中点击 Inference Services
  2. 点击目标 Inference Service 名称,打开其详情页。

步骤 2:打开监控 dashboard

  1. 选择 Monitor 选项卡。
  2. 确保 Resource Monitor 区域已展开(默认视图)。

步骤 3:选择时间范围

使用右上角的时间选择器选择预设范围或自定义范围:

预设选项自定义范围
最近 30 分钟开始/结束日期时间
最近 1 小时
最近 6 小时
最近 24 小时
最近 2 天
最近 7 天

监控指标

CPU Usage

  • 描述:显示服务实际消耗的 CPU cores。
  • 数据格式cores(float)

CPU Utilization

  • 描述:已使用的分配 CPU 资源百分比。
  • 计算方式(Used Cores / Allocated Cores) × 100%
  • 解读
    • 持续 >90%:考虑扩展 CPU 分配
    • <20%:可能存在资源过度分配

Memory Usage

  • 描述:服务消耗的物理内存。
  • 数据格式GiBMiB
  • 重要提示:当使用量超过分配内存时,Kubernetes 会触发 OOM kill。

Memory Utilization

  • 描述:已使用的分配内存资源百分比。
  • 计算方式(Used Memory / Allocated Memory) × 100%

GPU Usage

  • 描述:服务消耗的 GPU 计算资源。
  • 数据格式:计算单元
  • 注意:MPS 部署模式下不可用。

GPU Utilization

  • 描述:已使用的分配 GPU 计算资源百分比。
  • 计算方式(Used GPU / Allocated GPU) × 100%
  • 注意:MPS 部署模式下不可用。

GPU Memory Usage

  • 描述:服务消耗的 GPU 内存。
  • 数据格式GiBMiB
  • 注意:MPS 部署模式下不可用。

GPU Memory Utilization

  • 描述:已使用的分配 GPU 内存百分比。
  • 计算方式(Used GPU Memory / Allocated GPU Memory) × 100%
  • 注意:MPS 部署模式下不可用。

Token Metrics

  • Token Prompt:跟踪已处理的 prompt tokens 数量。
  • Token Generation:监控模型生成的 tokens 数量。
  • 可用性:仅适用于使用 'vllm' runtime 的推理服务。

Request Metrics

  • Response Time:衡量服务响应延迟(avg/tp50/p90/p95)。
  • QPS (Queries Per Second):跟踪每秒成功和失败请求数。
  • Traffic:监控入站和出站数据传输。