LMSYS Chatbot Arena Leaderboard logo

LMSYS Chatbot Arena Leaderboard

已認證
新上架免費

LMSEARCH Chatbot Arena是一個眾包開放平臺.

toolDetailPage.fastFactsTitle

定價
Free
3.6k
瀏覽
1
收藏
分類
ais
toolDetailPage.categoryRankLabel
toolDetailPage.categoryRankValue
收錄時間
Nov 2025
官方網址
arena.ai

LMArena 文本榜

来源:lmarena.ai

基于 LMArena Chatbot Arena 真人盲测投票 + Bradley–Terry / Elo 算法的当前 Top 10 大模型。点击模型名查看 ToolHub 上对应的家族页;旁边 ↗ 图标跳官方页面。

#模型Elo 分数
1Anthropic1509
2Anthropic1504
3Anthropic1502
4Anthropic1499
5Anthropic1494
6Meta1487
7Google1486
8Google1486
9Anthropic1484
10OpenAI1481
注:本表为人工同步快照,最新实时数据请访问官方 LMArena。
ToolHub 视角
  • 第 1 到第 10 的 Elo 差距只有 28 分。10 分以内的差距在统计上往往不显著——前 10 基本是一个梯队,差异更多体现在 擅长场景和成本,而不是“谁更聪明”。
  • 按任务挑模型,不要按总榜挑:写代码 / 重构 / 长文档分析优先 Claude; 日常通用 + 语音 + 图像优先 ChatGPT; Workspace 集成 / 多模态优先 Gemini; 自部署 / 免费首选 Meta AI / Llama
  • “thinking” 变体值不值得用?带 thinking 后缀的模型在硬推理上更强,但延迟和成本明显更高。日常对话用普通版, 遇到棘手编程 / 数学 / 多步推理再切到 thinking 版。
  • 本表只看文本榜。编程实战、网页搭建、视觉理解、长上下文各有专门子榜—— 访问官方 LMArena 查 WebDev、Vision、Coding 等分项。

工具概览

概览

LMSYS Chatbot Arena 排行榜是一個基於真實用戶偏好的大模型評測平臺,通過“人類對戰投票”而不是傳統合成測評來排序各類大語言模型(LLM)。用戶同時與兩個匿名模型對話,只需選擇回答更好的那一方,即可形成一條真實的對比數據。平臺利用超過百萬條人工成對比較記錄,結合 Bradley–Terry 統計建模與 Elo 評分體系,為開源與商用模型生成穩定可靠的綜合排名。 排行榜覆蓋聊天問答、代碼生成、邏輯推理、寫作創作等多種場景,幫助研究者、開發者和產品團隊客觀瞭解不同模型的實際表現,用於選型、對比新版本以及追蹤模型能力演進。隨著持續新增的對戰數據和模型版本,排行榜能夠動態反映行業最新進展,而不是一組靜態的單次測分結果。 LMSYS Chatbot Arena 排行榜完全免費,通過網頁即可訪問,讓個人用戶、小團隊和企業都能方便獲取一線大模型評測信息。無論你是要為產品選型、驗證自研模型能力,還是單純想看看各家聊天機器人“誰更強”,這裡都提供了基於大規模人類偏好的公開、公正參考。

產品截圖

LMSYS Chatbot Arena Leaderboard screenshot 1

功能特點

  • 基於真實用戶投票評測
  • Elo 風格大模型評分體系
  • Bradley–Terry 統計排名模型
  • 雙模型匿名對話對戰體驗
  • 彙總開源與商用模型表現
  • 排行榜數據持續滾動更新
  • 完全免費網頁版評測入口
  • 按任務類型細分能力洞察

相關標籤

AI
artificial-intelligence
lmsys
chatbot

應用場景

  • 產品與應用模型選型:根據排行榜對比主流大模型表現,為客服機器人、智能助手、生成創作等場景挑選更合適的底層模型。

  • 科研與研發效果驗證:將 Arena 排名視作人類偏好基線,用於評估新模型、微調版本或提示工程方案的實際改進幅度。

  • 市場與競品能力洞察:持續關注開源與商用模型在榜上的變化趨勢,為技術路線規劃、供應商選擇和遷移決策提供依據。

常見問題

用戶評論

還沒有評論,來分享你的使用體驗吧