Envoy AI Gateway 的 Alauda 版本

Envoy AI Gateway

Envoy AI Gateway 的 Alauda 版本 基于 Envoy AI Gateway 项目构建。
Envoy AI Gateway 是构建在 Envoy Gateway 之上的 Kubernetes 原生、面向 AI 的网关层,为 AI 推理工作负载提供智能流量管理、路由和策略执行能力。

主要组件和功能包括:

  • AI 感知路由:根据请求内容、模型名称和后端可用性,将推理请求路由到合适的后端模型服务,从而在单一端点后实现透明的多模型服务。
  • OpenAI 兼容 API:为所有下游推理服务提供统一的、与 OpenAI 兼容的 API 接口(/v1/chat/completions/v1/completions/v1/models),而不受底层运行时影响。
  • 按模型速率限制和策略:在单个模型级别执行细粒度的速率限制、令牌配额和流量策略,防止资源被耗尽,并确保多租户之间公平使用。
  • 后端负载均衡:使用可配置的负载均衡策略,将推理请求分配到同一模型的多个副本,并支持健康检查和自动故障转移。
  • Envoy Gateway 集成:作为 Envoy Gateway 的扩展运行,继承其 Kubernetes Gateway API 原生控制平面、TLS 终止和可观测性功能(指标、访问日志、分布式追踪)。
  • Gateway API Inference Extension (GIE):与 Kubernetes SIG Gateway API Inference Extension 集成,基于实时后端状态提供高级、感知推理的调度和负载均衡决策。

Envoy AI Gateway 是 Alauda Build of KServe 用于暴露推理服务的必需依赖项。

Envoy AI Gateway 由 Alauda AI 通过 default AmlCluster 中的 envoyAIGateway 组件安装和管理。有关 Alauda AI 的安装和组件配置,请参见 安装 Alauda AI

指南

以下指南将 Envoy AI Gateway 配置为多租户模型服务控制平面:

  • 认证消费者 — 验证 SSO 令牌或 API key,并传播调用方身份。
  • 配置令牌配额 — 对每个用户、每个部门和每个层级执行令牌预算限制。
  • 令牌用量计量 — 报告每个租户的消耗情况,并提供计费回传数据。
  • 路由到 LLM 提供商 — 通过凭证注入和故障转移为外部提供商提供前置接入。
  • 对令牌用量计费 — 使用 Cost Management 将令牌用量按价格计入每个命名空间的账单。
在专用命名空间中创建网关

请在专用命名空间中创建 Gateway 及其 AIGatewayRoute,例如 maas-system,而不是在 Envoy Gateway 控制平面命名空间 envoy-gateway-system 中创建。这样可以将租户网关与控制平面隔离,并避免某些版本中的一个问题:如果网关放置在控制平面命名空间中,则不会将 AI Gateway 请求处理(ext_proc)过滤器或 SecurityPolicy 规则应用到其监听器——这会悄无声息地破坏模型路由、令牌配额和认证。数据平面代理 Pod 无论如何都会在 envoy-gateway-system 中创建;这里唯一重要的是 Gateway 资源的命名空间。

文档

Envoy AI Gateway 上游文档及相关资源: