讀懂AI時代 Read AI Time 讀懂AI時代 Read AI Time 简体

大模型能力榜

📊 全部資料 · 總覽

LMArena 競技場(Chatbot Arena)的真人盲測對戰評分,排出大模型的綜合能力高下(overall 全球總榜)。Arena 分越高,代表在真人匿名對比中越受偏好——它反映的是偏好、非絕對能力,且頭部幾名的分差常落在置信區間內(見下表「置信區間」列),更宜看作近似並列資料歸因 LMArena,客觀呈現、不構成投資或採購建議榜單釋出於 2026-08-27

排名模型機構Arena 分置信區間投票數
1claude-opus-5-maxanthropic1505±615.4K
2claude-opus-5-highanthropic1504±531.6K
3claude-opus-4-6-highanthropic1503±372.1K
4claude-opus-4-6anthropic1497±376.1K
5claude-fable-5anthropic1495±525.8K
6gemini-3.7-flash-highgoogle1490±85.7K
7claude-opus-4-7-highanthropic1490±460.1K
8muse-spark-1.2 (xHigh)meta1488±103.2K
9gemini-3.5-flash-highgoogle1483±432.2K
10claude-opus-4-7anthropic1483±461.3K
11gemini-3.1-pro-previewgoogle1480±3101.2K
12qwen3.8-maxalibaba1480±611.8K
13gemini-3-progoogle1480±440.7K
14muse-spark-1.1meta1478±522.2K
15gemini-3.6-flash-highgoogle1477±520.2K
16kimi-k3-maxmoonshot1476±616.6K
17gemini-3.5-flash-mediumgoogle1475±530.6K
18glm-5.3-maxzai1475±85.8K
19qwen3.7-max-previewalibaba1474±103.7K
20muse-sparkmeta1474±613.6K
21gpt-5.5-highopenai1471±461.6K
22qwen3.5-max-previewalibaba1471±521.5K
23gpt-5.4-highopenai1470±460.6K
24ernie-5.1baidu1468±537.1K
25glm-5.2-maxzai1467±532.5K
26gemini-3-flashgoogle1467±430.2K
27gpt-5.5openai1466±463.0K
28glm-5.3-flashzai1466±122.4K
29mimo-v2.5-proxiaomi1465±456.0K
30glm-5.1zai1463±444.0K
31claude-opus-4-8-highanthropic1461±446.8K
32claude-sonnet-4-6anthropic1458±466.4K
33gemini-2.5-progoogle1458±2122.6K
34kimi-k2.6moonshot1455±537.5K
35qwen3.7-plusalibaba1455±536.3K
36gpt-5.6-sol-xhighopenai1454±521.5K
37gpt-5.4openai1453±463.6K
38claude-opus-4-8anthropic1452±447.5K
39grok-4.5xai1451±524.2K
40deepseek-v4-prodeepseek1451±454.2K
41grok-4.20-beta-0309-reasoningxai1451±462.2K
42claude-opus-4-5-20251101anthropic1450±370.0K
43grok-4.20-multi-agent-beta-0309xai1450±460.8K
44dola-seed-2.0-probytedance1448±374.3K
45amazon-nova-experimental-chat-26-02-10amazon1448±103.4K
46claude-opus-4-5-20251101-high-32kanthropic1447±436.3K
47gpt-5.6-terra-xhighopenai1447±522.3K
48qwen3.6-max-previewalibaba1446±85.2K
49glm-5zai1446±427.6K
50kimi-k2.5-thinkingmoonshot1446±370.6K
51deepseek-v4-pro-high-previewdeepseek1445±451.6K
52nvidia-nemotron-3-ultra-550b-a55b-nvfp4nvidia1445±710.7K
53grok-4.20-beta1xai1445±526.6K
54ernie-5.0-0110baidu1444±434.9K
55grok-4.6-highxai1444±103.5K
56gemini-3-flash (thinking-minimal)google1442±385.9K
57ernie-5.0-preview-1203baidu1442±79.6K
58claude-sonnet-5-highanthropic1442±529.5K
59gpt-5.1-highopenai1442±440.3K
60gemma-4-31bgoogle1442±85.9K
61deepseek-v4-pro-high-20260813deepseek1441±94.2K
62hy3tencent1441±86.5K
63glm-4.6zai1440±435.1K
64qwen3-max-previewalibaba1439±527.2K
65gpt-5.2-chat-latest-20260210openai1439±434.2K
66inklingthinky1439±520.4K
67claude-sonnet-4-5-20250929anthropic1438±379.7K
68qwen3.5-397b-a17balibaba1438±371.9K
69glm-5v-turbozai1437±79.4K
70gemini-3.5-flash-litegoogle1437±520.1K
71qwen3.6-plusalibaba1437±445.4K
72grok-4.1-thinkingxai1437±364.2K
73qwen3.8-27balibaba1437±95.0K
74mimo-v2-proxiaomi1437±524.4K
75grok-4.1xai1436±366.4K
76glm-4.7zai1436±611.9K
77gemma-4-26b-a4bgoogle1435±85.8K
78minimax-m3minimax1434±443.0K
79claude-sonnet-4-5-20250929-high-32kanthropic1434±381.0K
80deepseek-v4-flashdeepseek1432±448.9K
81ernie-5.0-preview-1022baidu1430±94.7K
82glm-4.5zai1430±523.7K
83gpt-5.6-luna-xhighopenai1429±522.9K
84chatgpt-4o-latest-20250326openai1429±380.7K
85mistral-large-3mistral1428±364.0K
86mimo-v2.5xiaomi1428±444.5K
87deepseek-r1-0528deepseek1427±618.1K
88longcat-flash-chat-2602-expmeituan1426±528.0K
89grok-3-preview-02-24xai1425±432.4K
90deepseek-v3.2deepseek1425±446.5K
91deepseek-v3.2-exp-thinkingdeepseek1425±78.9K
92mistral-medium-2508mistral1425±392.8K
93deepseek-v4-flash-high-previewdeepseek1424±448.7K
94longcat-flash-chatmeituan1423±611.2K
95mimo-v2-omnixiaomi1423±619.4K
96deepseek-v3.2-expdeepseek1423±611.8K
97gpt-5.1openai1423±443.0K
98mistral-medium-3.5mistral1421±711.0K
99amazon-nova-experimental-chat-12-10amazon1421±103.6K
100qwen3-vl-235b-a22b-instructalibaba1420±711.2K

中文能力評測參考

LMArena 總榜以英文對戰為主;想看中文場景,可切到上方「中文榜」(LMArena 中文競技場),或參考國內權威榜單(本站不轉載其資料,僅外鏈):

能力評分資料來自 LMArena(原 LMSYS Chatbot Arena)公開發布的 排行榜資料集,許可 CC-BY-4.0,本站署名引用、未作修改。 Arena 分由真人匿名盲測對戰經統計模型(Bradley-Terry)估算,反映相對偏好、非絕對能力,可能滯後或隨樣本波動,僅供參考。 本欄目僅作資訊整理,不構成任何投資或採購建議。本站不自建評測跑分。榜單釋出於 2026-08-27。