LMSYS Chatbot Arena Leaderboard logo

LMSYS Chatbot Arena Leaderboard

新上架免费

LMSEARCH Chatbot Arena是一个众包开放平台.

速览信息

定价
Free
3.4k
浏览
1
收藏
热度排名
第 2 名 / 共 680 个 · 按浏览量
收录时间
2025年11月
官方网址
lmarena.ai

LMArena 文本榜

来源:lmarena.ai

基于 LMArena Chatbot Arena 真人盲测投票 + Bradley–Terry / Elo 算法的当前 Top 10 大模型。点击模型名查看 ToolHub 上对应的家族页;旁边 ↗ 图标跳官方页面。

#模型Elo 分数
1Anthropic1509
2Anthropic1504
3Anthropic1502
4Anthropic1499
5Anthropic1494
6Meta1487
7Google1486
8Google1486
9Anthropic1484
10OpenAI1481
注:本表为人工同步快照,最新实时数据请访问官方 LMArena。
ToolHub 视角
  • 第 1 到第 10 的 Elo 差距只有 28 分。10 分以内的差距在统计上往往不显著——前 10 基本是一个梯队,差异更多体现在 擅长场景和成本,而不是“谁更聪明”。
  • 按任务挑模型,不要按总榜挑:写代码 / 重构 / 长文档分析优先 Claude; 日常通用 + 语音 + 图像优先 ChatGPT; Workspace 集成 / 多模态优先 Gemini; 自部署 / 免费首选 Meta AI / Llama
  • “thinking” 变体值不值得用?带 thinking 后缀的模型在硬推理上更强,但延迟和成本明显更高。日常对话用普通版, 遇到棘手编程 / 数学 / 多步推理再切到 thinking 版。
  • 本表只看文本榜。编程实战、网页搭建、视觉理解、长上下文各有专门子榜—— 访问官方 LMArena 查 WebDev、Vision、Coding 等分项。

如何看懂 Chatbot Arena 排行榜

LMArena(原 LMSYS)Chatbot Arena 是大模型「真人偏好」评测的事实标准。真实用户在盲测对战里投票,平台用 Bradley–Terry 模型 + Elo 评分算出你在上方快照里看到的排名。

文本榜代表通用对话表现。WebDev、Vision、Coding 等子榜专测特定领域能力——如果你的需求是写代码或处理图像,直接看相应子榜比看总榜更准。

几个看榜要点:Elo 差距 10 分以内不一定有显著差异;带 "thinking" 后缀的版本通常分数更高但延迟和成本也更高;新加入的模型在投票样本稳定前排名波动较大。

可以一起参考的模型排行榜资源

LMSYS 官方 Arena

如果你的核心需求就是直接看官方榜单、获取最新实时结果,官方 Arena 仍然是首选。

OpenRouter Rankings

如果你除了排名之外,还想结合可用性、价格和生态支持一起看,OpenRouter 更偏产品决策视角。

Hugging Face 开源模型榜单

如果你更重视 benchmark 指标而不是用户对战偏好,这类榜单会更适合做技术向比较。

产品截图

LMSYS Chatbot Arena Leaderboard screenshot 1

功能特点

  • 基于真实用户投票评测
  • Elo 风格大模型评分体系
  • Bradley–Terry 统计排名模型
  • 双模型匿名对话对战体验
  • 汇总开源与商用模型表现
  • 排行榜数据持续滚动更新
  • 完全免费网页版评测入口
  • 按任务类型细分能力洞察

相关标签

AI
artificial-intelligence
lmsys
chatbot

如何高效使用 Chatbot Arena

  • 重点查看“编程 (Coding)”或“高难度提示词 (Hard Prompts)”分类榜单,如果您正在寻找处理复杂逻辑或软件开发任务的最佳模型。

  • 参与“匿名对战 (Side-by-side)”,在为 ELO 排名贡献数据的同时,用您的极端测试用例亲身验证不同模型的表现。

  • 关注“风格控制”和“长文本 (Long Context)”专项更新,了解哪些模型在遵循严格格式或处理超大规模文档时表现更优。

常见问题

用户评论

还没有评论,来分享你的使用体验吧