讀懂AI時代 Read AI Time 讀懂AI時代 Read AI Time 简体

中文大模型能力榜

📊 全部資料 · 總覽

LMArena 中文競技場(Chinese Arena)的真人中文盲測對戰評分,排出大模型在中文場景的能力高下。它只統計中文對話裡的偏好勝負,和上方「總榜」(以英文為主)可能明顯不同——國產模型在這裡通常更靠前。評分反映偏好、非絕對能力,頭部分差常落在置信區間內(見下表),宜看作近似並列。資料歸因 LMArena,不構成投資或採購建議榜單釋出於 2026-08-27

排名模型機構Arena 分置信區間投票數
1claude-opus-5-maxanthropic1590±191.1K
2claude-opus-5-highanthropic1580±142.2K
3gemini-3.7-flash-highgoogle1561±31389
4claude-opus-4-6-highanthropic1551±104.5K
5claude-opus-4-6anthropic1547±104.5K
6claude-fable-5anthropic1544±161.6K
7qwen3.8-maxalibaba1539±22732
8gpt-5.5openai1536±113.4K
9claude-opus-4-7-highanthropic1534±113.4K
10gemini-3.6-flash-highgoogle1533±171.3K
11gemini-3.5-flash-highgoogle1533±142.0K
12qwen3.5-max-previewalibaba1532±161.4K
13gemini-3.1-pro-previewgoogle1531±96.1K
14kimi-k2.6moonshot1529±141.9K
15grok-4.6-highxai1528±34293
16qwen3.7-max-previewalibaba1526±37263
17claude-opus-4-7anthropic1526±113.5K
18gemini-3-progoogle1525±113.2K
19gpt-5.5-highopenai1524±113.5K
20gpt-5.6-sol-xhighopenai1524±161.4K
21muse-spark-1.1meta1523±161.5K
22glm-5.3-maxzai1520±31369
23glm-5.1zai1518±122.7K
24gemini-3.5-flash-mediumgoogle1518±141.9K
25gpt-5.4-highopenai1517±113.5K
26muse-spark-1.2 (xHigh)meta1516±38260
27glm-5.2-maxzai1516±142.0K
28kimi-k3-maxmoonshot1515±181.1K
29gpt-5.6-terra-xhighopenai1514±161.5K
30qwen3.8-27balibaba1513±34291
31glm-5zai1510±141.7K
32ernie-5.0-preview-1022baidu1509±30381
33gemini-2.5-progoogle1509±78.8K
34gemini-3-flashgoogle1509±132.3K
35gpt-5.4openai1508±113.7K
36qwen3.7-plusalibaba1508±142.0K
37mimo-v2.5-proxiaomi1503±113.0K
38muse-sparkmeta1503±21850
39claude-opus-4-8anthropic1503±122.7K
40hy3tencent1502±28434
41ernie-5.1baidu1502±151.8K
42grok-4.5xai1502±161.6K
43glm-4.6zai1500±122.6K
44ernie-5.0-0110baidu1499±132.2K
45claude-opus-4-8-highanthropic1498±122.7K
46kimi-k2.5-thinkingmoonshot1498±103.9K
47qwen3.5-397b-a17balibaba1497±104.3K
48ernie-5.0-preview-1203baidu1497±21792
49glm-4.7zai1495±19961
50inklingthinky1495±161.5K
51gpt-5.1-highopenai1493±113.1K
52nvidia-nemotron-3-ultra-550b-a55b-nvfp4nvidia1491±23631
53glm-5v-turbozai1491±24605
54qwen3.6-max-previewalibaba1489±33320
55dola-seed-2.0-probytedance1489±104.4K
56claude-sonnet-4-6anthropic1489±103.8K
57deepseek-v4-prodeepseek1485±122.9K
58claude-sonnet-5-highanthropic1483±142.0K
59deepseek-v4-pro-high-previewdeepseek1483±122.8K
60gemma-4-26b-a4bgoogle1483±26469
61qwen3-235b-a22b-thinking-2507alibaba1483±26540
62grok-4.20-beta-0309-reasoningxai1481±113.6K
63deepseek-v4-pro-high-20260813deepseek1481±35268
64qwen3-max-previewalibaba1479±132.1K
65grok-4.20-multi-agent-beta-0309xai1478±113.4K
66grok-4.20-beta1xai1477±161.5K
67gemini-3-flash (thinking-minimal)google1477±95.1K
68qwen3.6-plusalibaba1473±132.2K
69qwen3.5-27balibaba1472±141.8K
70gemma-4-31bgoogle1472±26465
71mimo-v2.5xiaomi1470±132.1K
72deepseek-v3.1-thinkingdeepseek1470±181.2K
73gpt-5.1openai1469±103.3K
74claude-opus-4-5-20251101anthropic1469±94.8K
75gpt-5.6-luna-xhighopenai1468±161.6K
76gemini-3.5-flash-litegoogle1468±171.4K
77mimo-v2-omnixiaomi1467±20859
78deepseek-v4-flash-high-previewdeepseek1467±122.5K
79glm-4.5zai1466±141.8K
80amazon-nova-experimental-chat-11-10amazon1466±141.8K
81qwen3.5-122b-a10balibaba1466±141.9K
82longcat-flash-chat-2602-expmeituan1465±151.7K
83grok-4.1xai1465±94.8K
84mimo-v2-flash (non-thinking)xiaomi1465±113.0K
85deepseek-v4-flashdeepseek1465±122.5K
86claude-opus-4-5-20251101-high-32kanthropic1465±112.8K
87qwen3-235b-a22b-instruct-2507alibaba1465±86.8K
88deepseek-v3.2-expdeepseek1463±18997
89gemini-3.1-flash-lite-previewgoogle1463±103.6K
90qwen3-vl-235b-a22b-instructalibaba1462±24701
91qwen3-next-80b-a3b-instructalibaba1462±141.7K
92gpt-5.2-chat-latest-20260210openai1461±132.1K
93qwen3.5-35b-a3balibaba1461±141.8K
94kimi-k2.5-instantmoonshot1461±27454
95deepseek-v3.2-exp-thinkingdeepseek1460±26500
96claude-sonnet-4-5-20250929anthropic1459±95.3K
97claude-sonnet-4-5-20250929-high-32kanthropic1458±95.3K
98grok-4.1-thinkingxai1458±94.6K
99grok-4-fast-chatxai1457±28463
100Inkling Smallthinky1457±19955

能力評分資料來自 LMArena(原 LMSYS Chatbot Arena)公開發布的 排行榜資料集「中文(chinese)」切片,許可 CC-BY-4.0,本站署名引用、未作修改。 Arena 分由真人匿名中文盲測對戰經統計模型(Bradley-Terry)估算,反映相對偏好、非絕對能力,可能滯後或隨樣本波動,僅供參考。 本欄目僅作資訊整理,不構成任何投資或採購建議。本站不自建評測跑分。榜單釋出於 2026-08-27。