独立模型榜
模型能力排行榜
把人类偏好、推理、编程与开放权重评测分开呈现,提供可追溯的模型选型参考。
正式模型
8
公开来源
5
审核池
2
多来源公开快照 · 不把不同 benchmark 原始分数直接相加快照时间: 2026/8/14
至少两个独立来源后才计算 ToolCenter 综合参考分。
暂无可核验快照
该维度已注册公开来源;同步到可核验数据后才会进入正式榜单。
数据来源与可信度
每条成绩都保留原始排名、原始分数、来源更新时间和方法论链接。过期快照会明确标注,不会伪装成实时数据。
综合参考分怎么计算
综合参考分使用标准化百分位,不替代任何官方榜单,也不代表某个来源的官方总分。
人类偏好35%
推理能力25%
编程与 Agent25%
知识与稳定性15%
至少两个独立来源后才计算 ToolCenter 综合参考分。