监控指标和视图
目录
功能概述主要特性访问资源监控监控指标CPU UsageCPU UtilizationMemory UsageMemory UtilizationGPU UsageGPU UtilizationGPU Memory UsageGPU Memory UtilizationToken MetricsRequest Metrics功能概述
Alauda AI 的 Monitoring & Ops 模块中的资源监控可为您的推理服务提供 CPU、内存、GPU、令牌使用情况以及请求指标的实时洞察。此功能可帮助您识别性能瓶颈、优化资源分配,并确保服务稳定运行。它尤其适用于以下场景:
- 性能调优:诊断高资源使用情况并调整资源限制。
- 异常检测:监控资源消耗和请求模式的突发峰值。
- 容量规划:分析历史趋势,以高效扩展资源。
- 成本优化:跟踪令牌使用情况和 GPU 利用率,以便进行预算管理。
主要特性
- 资源监控:
- CPU Usage:显示 CPU 的绝对使用量(例如,已使用的 cores)。
- CPU Utilization:以分配资源的百分比显示 CPU 使用率。
- Memory Usage:跟踪实际内存消耗(例如,GB)。
- Memory Utilization:以分配资源的百分比显示内存使用率。
- 计算监控:
- GPU Usage:跟踪 GPU 计算资源消耗。
- GPU Utilization:以分配资源的百分比显示 GPU 使用率。
- GPU Memory Usage:监控 GPU 内存消耗。
- GPU Memory Utilization:以分配资源的百分比显示 GPU 内存使用率。
- 注意:MPS 部署模式不支持 GPU 计算和内存监控。
- 其他监控:
- Token Metrics:跟踪 prompt 和 generation tokens(适用于 'vllm' runtime 服务)。
- Request Metrics:监控响应时间(avg/tp50/p90/p95)、QPS(success/fail)以及流量(in/out)。
- 时间范围选择:可按自定义周期分析指标(从 30 分钟到 7 天)。
访问资源监控
步骤 1:进入推理服务详情页
- 在左侧导航栏中点击 Inference Services。
- 点击目标 Inference Service 名称,打开其详情页。
步骤 2:打开监控 dashboard
- 选择 Monitor 选项卡。
- 确保 Resource Monitor 区域已展开(默认视图)。
步骤 3:选择时间范围
使用右上角的时间选择器选择预设范围或自定义范围:
监控指标
CPU Usage
- 描述:显示服务实际消耗的 CPU cores。
- 数据格式:
cores(float)
CPU Utilization
- 描述:已使用的分配 CPU 资源百分比。
- 计算方式:
(Used Cores / Allocated Cores) × 100% - 解读:
- 持续 >90%:考虑扩展 CPU 分配
- <20%:可能存在资源过度分配
Memory Usage
- 描述:服务消耗的物理内存。
- 数据格式:
GiB或MiB - 重要提示:当使用量超过分配内存时,Kubernetes 会触发 OOM kill。
Memory Utilization
- 描述:已使用的分配内存资源百分比。
- 计算方式:
(Used Memory / Allocated Memory) × 100%
GPU Usage
- 描述:服务消耗的 GPU 计算资源。
- 数据格式:计算单元
- 注意:MPS 部署模式下不可用。
GPU Utilization
- 描述:已使用的分配 GPU 计算资源百分比。
- 计算方式:
(Used GPU / Allocated GPU) × 100% - 注意:MPS 部署模式下不可用。
GPU Memory Usage
- 描述:服务消耗的 GPU 内存。
- 数据格式:
GiB或MiB - 注意:MPS 部署模式下不可用。
GPU Memory Utilization
- 描述:已使用的分配 GPU 内存百分比。
- 计算方式:
(Used GPU Memory / Allocated GPU Memory) × 100% - 注意:MPS 部署模式下不可用。
Token Metrics
- Token Prompt:跟踪已处理的 prompt tokens 数量。
- Token Generation:监控模型生成的 tokens 数量。
- 可用性:仅适用于使用 'vllm' runtime 的推理服务。
Request Metrics
- Response Time:衡量服务响应延迟(avg/tp50/p90/p95)。
- QPS (Queries Per Second):跟踪每秒成功和失败请求数。
- Traffic:监控入站和出站数据传输。