工具概覽
LMSYS Chatbot Arena 排行榜是一個基於真實用戶偏好的大模型評測平臺,通過“人類對戰投票”而不是傳統合成測評來排序各類大語言模型(LLM)。用戶同時與兩個匿名模型對話,只需選擇回答更好的那一方,即可形成一條真實的對比數據。平臺利用超過百萬條人工成對比較記錄,結合 Bradley–Terry 統計建模與 Elo 評分體系,為開源與商用模型生成穩定可靠的綜合排名。
排行榜覆蓋聊天問答、代碼生成、邏輯推理、寫作創作等多種場景,幫助研究者、開發者和產品團隊客觀瞭解不同模型的實際表現,用於選型、對比新版本以及追蹤模型能力演進。隨著持續新增的對戰數據和模型版本,排行榜能夠動態反映行業最新進展,而不是一組靜態的單次測分結果。
LMSYS Chatbot Arena 排行榜完全免費,通過網頁即可訪問,讓個人用戶、小團隊和企業都能方便獲取一線大模型評測信息。無論你是要為產品選型、驗證自研模型能力,還是單純想看看各家聊天機器人“誰更強”,這裡都提供了基於大規模人類偏好的公開、公正參考。
LMArena 文本榜
基于 LMArena Chatbot Arena 真人盲测投票 + Bradley–Terry / Elo 算法的当前 Top 10 大模型。点击模型名查看 ToolHub 上对应的家族页;旁边 ↗ 图标跳官方页面。
| # | 模型 | Elo 分数 |
|---|---|---|
| 1 | Anthropic | 1509 |
| 2 | Anthropic | 1504 |
| 3 | Anthropic | 1502 |
| 4 | Anthropic | 1499 |
| 5 | Anthropic | 1494 |
| 6 | Meta | 1487 |
| 7 | 1486 | |
| 8 | 1486 | |
| 9 | Anthropic | 1484 |
| 10 | OpenAI | 1481 |
- 第 1 到第 10 的 Elo 差距只有 28 分。10 分以内的差距在统计上往往不显著——前 10 基本是一个梯队,差异更多体现在 擅长场景和成本,而不是“谁更聪明”。
- 按任务挑模型,不要按总榜挑:写代码 / 重构 / 长文档分析优先 Claude; 日常通用 + 语音 + 图像优先 ChatGPT; Workspace 集成 / 多模态优先 Gemini; 自部署 / 免费首选 Meta AI / Llama。
- “thinking” 变体值不值得用?带 thinking 后缀的模型在硬推理上更强,但延迟和成本明显更高。日常对话用普通版, 遇到棘手编程 / 数学 / 多步推理再切到 thinking 版。
- 本表只看文本榜。编程实战、网页搭建、视觉理解、长上下文各有专门子榜—— 访问官方 LMArena 查 WebDev、Vision、Coding 等分项。
定價
價格與限制可能變動,請以官網為準,並確認幣別、付款週期、最低席位數和用量上限。
應用場景
- 產品與應用模型選型:根據排行榜對比主流大模型表現,為客服機器人、智能助手、生成創作等場景挑選更合適的底層模型。
- 科研與研發效果驗證:將 Arena 排名視作人類偏好基線,用於評估新模型、微調版本或提示工程方案的實際改進幅度。
- 市場與競品能力洞察:持續關注開源與商用模型在榜上的變化趨勢,為技術路線規劃、供應商選擇和遷移決策提供依據。
功能特色
基於真實用戶投票評測
Elo 風格大模型評分體系
Bradley–Terry 統計排名模型
雙模型匿名對話對戰體驗
彙總開源與商用模型表現
排行榜數據持續滾動更新
完全免費網頁版評測入口
按任務類型細分能力洞察
使用者評論
還沒有評論,來分享你的使用體驗吧
常見問題
什麼是 LMSYS Chatbot Arena 排行榜?
LMSYS Chatbot Arena 排行榜是一個免費開放的平臺,通過超過一百萬條用戶對戰投票數據,對各類大語言模型進行排序,並使用 Bradley–Terry 模型和 Elo 評分來給出更貼近真實使用場景的綜合表現排名。
排行榜上的模型分數和名次是如何計算的?
平臺收集用戶在雙模型匿名對戰中“選出更好回答”的結果,將這些成對比較輸入 Bradley–Terry 統計模型,並轉換為類似 Elo 的評分體系,從而在眾多模型和任務之間構建可比、統一的排名。
使用 LMSYS Chatbot Arena 排行榜需要付費嗎?
不需要。排行榜通過網頁免費開放,你可以直接查看模型排名和詳情,並參與對戰評測,無需訂閱或支付任何費用。
我可以用排行榜為自己的產品選擇大模型嗎?
可以。很多開發者和團隊都會參考排行榜進行模型選型。實際落地時仍需結合業務領域、延遲、成本、安全等因素綜合評估,但 Arena 的人類偏好評分是非常有價值的起點。
我可以把自己的模型接入平臺進行評測嗎?
LMSYS 會不定期在 Arena 中加入新模型。如果你維護自己的大語言模型並希望參與評測,可以通過 LMSYS 官網或 GitHub 上的官方文檔和提交流程,提出接入申請。