介绍
Resource Monitoring 是 Alauda AI 的 Monitoring & Ops 模块的核心组件,专门用于跟踪和分析推理服务的资源利用率指标。作为全栈 MLOps 平台的一部分,它可提供基础设施资源消耗的实时可视性,帮助用户优化模型部署、避免资源瓶颈,并确保 AI 工作负载稳定运行。Resource Monitoring 与 Alauda AI 统一的监控生态系统集成,将可操作的洞察直接提供到您的 MLOps 工作流中,从而消除对分散工具的依赖。
目录
使用限制使用限制
使用 Resource Monitoring 时,请注意以下限制:
-
数据采集间隔
- 最小指标抓取间隔:60 秒
- 历史数据保留时间:默认 7 天
-
依赖要求
- 需要在目标集群中部署 Prometheus/VictoriaMetrics 监控栈
- Node exporter 必须运行在所有工作节点上
- DCGM exporter 必须运行在所有 GPU 节点上
-
版本要求
- Hami 的 GPU 仪表板仅在 Alauda AI 1.4 及更高版本中支持