介绍

Resource Monitoring 是 Alauda AI 的 Monitoring & Ops 模块的核心组件,专门用于跟踪和分析推理服务的资源利用率指标。作为全栈 MLOps 平台的一部分,它可提供基础设施资源消耗的实时可视性,帮助用户优化模型部署、避免资源瓶颈,并确保 AI 工作负载稳定运行。Resource Monitoring 与 Alauda AI 统一的监控生态系统集成,将可操作的洞察直接提供到您的 MLOps 工作流中,从而消除对分散工具的依赖。

使用限制

使用 Resource Monitoring 时,请注意以下限制:

  • 数据采集间隔

    • 最小指标抓取间隔:60 秒
    • 历史数据保留时间:默认 7 天
  • 依赖要求

    • 需要在目标集群中部署 Prometheus/VictoriaMetrics 监控栈
    • Node exporter 必须运行在所有工作节点上
    • DCGM exporter 必须运行在所有 GPU 节点上
  • 版本要求

    • Hami 的 GPU 仪表板仅在 Alauda AI 1.4 及更高版本中支持