基于 LMArena Chatbot Arena 真人盲测投票 + Bradley–Terry / Elo 算法的当前 Top 10 大模型。点击模型名查看 ToolHub 上对应的家族页;旁边 ↗ 图标跳官方页面。
| # | 模型 | Elo 分数 |
|---|---|---|
| 1 | Anthropic | 1509 |
| 2 | Anthropic | 1504 |
| 3 | Anthropic | 1502 |
| 4 | Anthropic | 1499 |
| 5 | Anthropic | 1494 |
| 6 | Meta | 1487 |
| 7 | 1486 | |
| 8 | 1486 | |
| 9 | Anthropic | 1484 |
| 10 | OpenAI | 1481 |
LMSYS Chatbot Arena 排行榜是一個基於真實用戶偏好的大模型評測平臺,通過“人類對戰投票”而不是傳統合成測評來排序各類大語言模型(LLM)。用戶同時與兩個匿名模型對話,只需選擇回答更好的那一方,即可形成一條真實的對比數據。平臺利用超過百萬條人工成對比較記錄,結合 Bradley–Terry 統計建模與 Elo 評分體系,為開源與商用模型生成穩定可靠的綜合排名。 排行榜覆蓋聊天問答、代碼生成、邏輯推理、寫作創作等多種場景,幫助研究者、開發者和產品團隊客觀瞭解不同模型的實際表現,用於選型、對比新版本以及追蹤模型能力演進。隨著持續新增的對戰數據和模型版本,排行榜能夠動態反映行業最新進展,而不是一組靜態的單次測分結果。 LMSYS Chatbot Arena 排行榜完全免費,通過網頁即可訪問,讓個人用戶、小團隊和企業都能方便獲取一線大模型評測信息。無論你是要為產品選型、驗證自研模型能力,還是單純想看看各家聊天機器人“誰更強”,這裡都提供了基於大規模人類偏好的公開、公正參考。

產品與應用模型選型:根據排行榜對比主流大模型表現,為客服機器人、智能助手、生成創作等場景挑選更合適的底層模型。
科研與研發效果驗證:將 Arena 排名視作人類偏好基線,用於評估新模型、微調版本或提示工程方案的實際改進幅度。
市場與競品能力洞察:持續關注開源與商用模型在榜上的變化趨勢,為技術路線規劃、供應商選擇和遷移決策提供依據。
Official website restored from the pre-incident audit; product details pending editorial verification.
Official website restored from the pre-incident audit; product details pending editorial verification.
Check if your image has been used to train popular AI art models.
Official website restored from the pre-incident audit; product details pending editorial verification.