独立模型榜

模型能力排行榜

把人类偏好、推理、编程与开放权重评测分开呈现,提供可追溯的模型选型参考。

正式模型
8
公开来源
5
审核池
2
多来源公开快照 · 不把不同 benchmark 原始分数直接相加快照时间: 2026/8/14

至少两个独立来源后才计算 ToolCenter 综合参考分。

暂无可核验快照

该维度已注册公开来源;同步到可核验数据后才会进入正式榜单。

数据来源与可信度

每条成绩都保留原始排名、原始分数、来源更新时间和方法论链接。过期快照会明确标注,不会伪装成实时数据。

综合参考分怎么计算

综合参考分使用标准化百分位,不替代任何官方榜单,也不代表某个来源的官方总分。

人类偏好35%
推理能力25%
编程与 Agent25%
知识与稳定性15%

至少两个独立来源后才计算 ToolCenter 综合参考分。