部署 TrustyAI Service
TrustyAI Service (TAS) 会与 KServe 模型一起部署,并收集其推理数据,漂移检测和偏差指标就是基于这些数据计算的。本页面会创建 TrustyAIService 资源;有关数据摄取以及为其注册指标的内容,请参阅 Monitor 章节中的 Bias and Drift Monitoring。
前提条件
- 已安装 TrustyAI Operator(请参阅 Install TrustyAI)。
- 如果使用
storage.format: DATABASE,则需要一个 MySQL 8.x 数据库。 - 如果使用
storage.format: PVC,请确保集群具有可用的默认StorageClass(由 CSI driver 提供支持),用于动态卷供应,这样 operator 创建的 PVC 才能成功绑定。
部署 TrustyAIService
请选择一种存储布局:DATABASE(MySQL)或 PVC(卷上的本地文件存储)。下面两个小节是替代方案,不是同一流程中的步骤。
DATABASE 模式
MySQL 凭据 Secret
在使用 storage.format: DATABASE 时,创建一个包含 TAS 部署所需键值的 secret:
说明:
databaseName引用的 MySQL schema(database)必须预先创建。TAS 不会自行创建数据库。- 数据库必须能够从 TAS pod 访问到。
databaseGeneration控制 TAS 启动时如何处理 schema 变更。
TrustyAIService CR
示例:
在 DATABASE 模式下,storage.databaseConfigurations 必须设置为上面创建的 MySQL 凭据 Secret 的名称,并且该 Secret 需要与 TrustyAIService 位于同一 namespace 中。
metadata.annotations 是可选的,用于允许 operator 创建 ServiceMonitor,以供 Prometheus 抓取(从而使平台能够自动收集监控数据)。
- 当设置
trustyai.cpaas.io/monitor-enable: "true"时,operator 会生成一个ServiceMonitor。 trustyai.cpaas.io/monitor-interval和trustyai.cpaas.io/monitor-metric-regex是可选项;未提供时,operator 会使用默认值。
trustyai.cpaas.io/monitor-interval 控制 Prometheus 抓取 TAS 指标的频率(默认值:30s)。
trustyai.cpaas.io/monitor-metric-regex 控制抓取后保留哪些指标名称(默认值:^trustyai_.*)。
spec.metrics 字段:
schedule(必填):TAS 执行指标计算的频率(例如每5s一次)。该值为持续时间字符串。batchSize(可选):TAS 在每次指标计算中包含多少条推理记录(值越大,每次运行使用的数据越多)。如果未设置,operator 会使用默认值5000。
PVC 模式
当 storage.format 为 PVC(无需 MySQL Secret)时,使用此路径。示例:
在 PVC 模式下:
storage.folder:TAS 在已挂载 PVC 中存储和读取数据的路径。storage.size:请求的 PVC 容量(例如1Gi)。- operator 会自动在与
TrustyAIService相同的 namespace 中创建名为<tas-name>-pvc的 PVC。由于该 PVC 使用集群默认StorageClass(未显式设置storageClassName),因此集群应提供可用的默认StorageClass(否则 PVC 可能会一直处于Pending状态)。
当所选模式的 TrustyAIService manifest 准备就绪后,应用它(同一命令适用于 DATABASE 或 PVC YAML):
验证部署就绪情况
预期的 status.phase 应为 Ready。
同时检查 pods:
下一步
当服务处于 Ready 状态后,继续阅读 Bias and Drift Monitoring,以摄取 reference 和 live 推理数据、注册漂移和偏差指标,并将其暴露给 Prometheus。