thriftllm logo

thriftllm

新上架免费

LLM 成本路由,按请求精确计费:输出长度预测、感知缓存的分层定价,以及每美元质量排名。

速览信息

定价
Free
0
浏览
0
收藏
收录时间
2026年10月
官方网址
github.com

工具概览

概览

argrouter 是一个面向大语言模型(LLM)请求的成本感知路由层。它为每个查询同时选择模型和推理强度,目标是最大化“答对的概率减去成本惩罚”,其中成本以模型在类似请求上实际计费的金额为准,包括隐藏的推理 token。项目写道:“argrouter routes each request to the model and reasoning effort that maximise P(correct) − λ · expected cost , where the cost is what that model actually bills on similar requests (hidden reasoning tokens included), not its list price.” 它是处于 alpha 阶段的 Python 包,可通过 pip 安装,只有一个运行时依赖(httpx)。 该包包含一个可独立使用的成本引擎。文档称:“The cost engine underneath is usable on its own”,并支持离线、SHA 固定的价格快照。成本引擎根据输入 token、预期输出 token 和缓存的输入 token 计算预期成本,返回以美元计的总额和各组成部分明细。项目强调,输出 token 通常在 LLM 账单中占大头,而常见的成本估算失误包括:把输入和输出费率相加、使用固定的预期输出 token 数,以及把未定价的模型当作免费。 argrouter 把提示缓存视为一等成本项。它在决策时对缓存状态定价,遵守最小可缓存阈值,并利用会话亲和性让对话保持在原模型上,除非实测节省超过实测的缓存损失。项目还提供 /v1/decision 旁路服务和面向现有网关的插件,而不是重新实现 OpenAI 的线上格式。它采用 Apache-2.0 许可,并承诺遵循供应链实践,如带 PEP 740 证明的 PyPI Trusted Publishing,以及安装时不执行代码。

功能特点

  • AI 助手
  • 自然语言界面
  • 工作流自动化

相关标签

generative-ai
ai
anthropic
claude
cost-optimization
ai assistant
automation

应用场景

  • 团队用 argrouter 把每个 LLM 请求路由到使“正确率减预期成本”最大化的模型和推理强度。

  • 开发者用独立的成本引擎,根据输入、输出和缓存 token 预测来计算 LLM 调用的预期成本。

  • 团队用 argrouter 核算提示缓存成本,避免在切换模型时丢掉缓存折扣。

  • 组织通过 /v1/decision 旁路服务和插件,把 argrouter 作为现有网关旁的决策层使用。

  • 团队用 argrouter 基于考虑混合比例的排名和质量下限,在同一模型的多个提供商之间做选择。

用户评论

还没有评论,来分享你的使用体验吧