LLM Gateway 是位于多个 LLM 提供方之前的 HTTP API。它处理路由、重试、跨提供方故障转移、熔断、响应缓存、按租户限流和成本跟踪,并包含实时用量仪表盘和 Prometheus 指标。它面向在生产中运行 LLM 的团队,这些团队希望无需重新部署客户端就能切换模型、在提供方故障时继续运行、防止某个租户占用共享配额,并了解开支。 客户端调用 smart、fast 或 balanced 之类的路由别名,而不是模型 ID。路由策略包括有序回退、成本最低优先、EWMA 延迟,以及加权金丝雀或 A-B 分流。网关用指数退避重试暂时性错误,将不可重试的错误移交给下一个目标,并使用带半开探测的熔断器。它用 SHA-256 键缓存完全匹配的请求,设置 REDIS_URL 时使用内存 LRU 或 Redis,且从不缓存拒绝响应。 按租户的限流使用两个令牌桶,分别针对每分钟请求数和每分钟 token 数,预先预留 max_tokens,并根据实际用量对账。API 密钥以 SHA-256 哈希存储,并以恒定时间比较。流式传输使用 Server-Sent Events,在第一个字节之前故障转移是透明的。可观测性包括 Prometheus 计数器和直方图、x-request-id 头以及 /dashboard 页面。项目提供使用模拟提供方的快速入门,涵盖聊天、路由、管理用量、熔断器、指标和健康检查的 API 端点,以及用于 AWS App Runner 部署的 Terraform。
团队用 LLM Gateway 通过调用路由别名而非模型 ID,无需重新部署客户端即可切换模型。
团队用 LLM Gateway 通过重试和跨提供方故障转移,在提供方故障时继续运行。
团队用 LLM Gateway 通过按租户的请求和 token 限额,防止某个租户占用共享配额。
团队用 LLM Gateway 缓存相同的请求,减少上游调用。
团队用 LLM Gateway 通过 Prometheus 指标和仪表盘监控用量、成本和回退情况。
团队用 LLM Gateway 通过 Server-Sent Events 流式传输响应,并在第一个字节之前实现透明的故障转移。
团队用 LLM Gateway 通过实现 complete() 和 stream() 并注册来添加新的提供方。
团队用 LLM Gateway 通过 Terraform 配置的 App Runner、自动扩缩容和 Secrets Manager 部署到 AWS。