Relay – a self-hosted LLM gateway with smart routing and request pacing logo

Relay – a self-hosted LLM gateway with smart routing and request pacing

2

Show HN:Relay——一款自托管的大模型(LLM)网关,支持智能路由与请求限速

速览信息

定价
见官网
0
浏览
0
收藏
收录时间
2026年9月
官方网址
github.com

工具概览

概览

Relay 是自托管的 AI 网关,位于应用与模型提供方之间。它连接 OpenAI、Anthropic、Bedrock、Vertex AI、Groq、Together AI、Fireworks、Ollama、LM Studio 等,并通过一个 API 路由请求。该项目称自己是为智能体及其背后的人打造的 AI 网关。 Relay 提供路由、排队、节流与模型冷却、回退、护栏、限额、用量跟踪、成本跟踪、日志,以及每个请求的实时视图。它可以对请求节流以避开提供方的 RPM 和 token 限制,通过排队优先的路由吸收突发流量,并让首选模型持续参与,而不是立刻降级到较弱的备用模型。 自己运行即可,无需管理单独的数据库或队列。Relay 以单个 Go 应用发布,内置仪表盘。应用通过一个兼容 OpenAI 的 API 与 Relay 通信,请求到达模型之前,由 Relay 处理路由、容量、回退、护栏和可见性。 社区版可以对请求分类,并结合其可用的路由能力使用这些上下文。托管版 Relay 增加了更强的请求分类,以及可根据意图、领域、复杂度和已配置的模型分配自动路由的 Smart Groups。

功能特点

  • AI 助手
  • 自然语言交互界面
  • 工作流自动化

相关标签

show-hn
LLM
ai
ai assistant
automation

应用场景

  • 团队用 Relay 通过一个兼容 OpenAI 的 API 连接云提供方和本地部署的模型。

  • 团队用 Relay 针对提供方的 RPM 和 token 限制对请求节流,同时吸收突发流量。

  • 团队用 Relay 把多个模型放在同一个名称之后,并控制 Relay 尝试它们的顺序。

  • 团队用 Relay 检查任务意图、领域和复杂度,以辅助路由决策。

  • 团队用 Relay 通过请求、token、成本和并发限额,控制共享容量和支出。

  • 团队用 Relay 通过分发前和响应后的检查,拦截敏感提示词并检查输出。

  • 团队用 Relay 按配置的模型价格跟踪 token 和资金的去向。

  • 团队用 Relay 实时观察请求在队列和模型之间的流转。

用户评论

还没有评论,来分享你的使用体验吧