argrouter 是一个面向大语言模型(LLM)请求的成本感知路由层。它为每个查询同时选择模型和推理强度,目标是最大化“答对的概率减去成本惩罚”,其中成本以模型在类似请求上实际计费的金额为准,包括隐藏的推理 token。项目写道:“argrouter routes each request to the model and reasoning effort that maximise P(correct) − λ · expected cost , where the cost is what that model actually bills on similar requests (hidden reasoning tokens included), not its list price.” 它是处于 alpha 阶段的 Python 包,可通过 pip 安装,只有一个运行时依赖(httpx)。 该包包含一个可独立使用的成本引擎。文档称:“The cost engine underneath is usable on its own”,并支持离线、SHA 固定的价格快照。成本引擎根据输入 token、预期输出 token 和缓存的输入 token 计算预期成本,返回以美元计的总额和各组成部分明细。项目强调,输出 token 通常在 LLM 账单中占大头,而常见的成本估算失误包括:把输入和输出费率相加、使用固定的预期输出 token 数,以及把未定价的模型当作免费。 argrouter 把提示缓存视为一等成本项。它在决策时对缓存状态定价,遵守最小可缓存阈值,并利用会话亲和性让对话保持在原模型上,除非实测节省超过实测的缓存损失。项目还提供 /v1/decision 旁路服务和面向现有网关的插件,而不是重新实现 OpenAI 的线上格式。它采用 Apache-2.0 许可,并承诺遵循供应链实践,如带 PEP 740 证明的 PyPI Trusted Publishing,以及安装时不执行代码。
团队用 argrouter 把每个 LLM 请求路由到使“正确率减预期成本”最大化的模型和推理强度。
开发者用独立的成本引擎,根据输入、输出和缓存 token 预测来计算 LLM 调用的预期成本。
团队用 argrouter 核算提示缓存成本,避免在切换模型时丢掉缓存折扣。
组织通过 /v1/decision 旁路服务和插件,把 argrouter 作为现有网关旁的决策层使用。
团队用 argrouter 基于考虑混合比例的排名和质量下限,在同一模型的多个提供商之间做选择。