中文大模型能力榜
📊 全部資料 · 總覽按 LMArena 中文競技場(Chinese Arena)的真人中文盲測對戰評分,排出大模型在中文場景的能力高下。它只統計中文對話裡的偏好勝負,和上方「總榜」(以英文為主)可能明顯不同——國產模型在這裡通常更靠前。評分反映偏好、非絕對能力,頭部分差常落在置信區間內(見下表),宜看作近似並列。資料歸因 LMArena,不構成投資或採購建議。榜單釋出於 2026-08-27
| 排名 | 模型 | 機構 | Arena 分 | 置信區間 | 投票數 |
|---|---|---|---|---|---|
| 1 | claude-opus-5-max | anthropic | 1590 | ±19 | 1.1K |
| 2 | claude-opus-5-high | anthropic | 1580 | ±14 | 2.2K |
| 3 | gemini-3.7-flash-high | 1561 | ±31 | 389 | |
| 4 | claude-opus-4-6-high | anthropic | 1551 | ±10 | 4.5K |
| 5 | claude-opus-4-6 | anthropic | 1547 | ±10 | 4.5K |
| 6 | claude-fable-5 | anthropic | 1544 | ±16 | 1.6K |
| 7 | qwen3.8-max | alibaba | 1539 | ±22 | 732 |
| 8 | gpt-5.5 | openai | 1536 | ±11 | 3.4K |
| 9 | claude-opus-4-7-high | anthropic | 1534 | ±11 | 3.4K |
| 10 | gemini-3.6-flash-high | 1533 | ±17 | 1.3K | |
| 11 | gemini-3.5-flash-high | 1533 | ±14 | 2.0K | |
| 12 | qwen3.5-max-preview | alibaba | 1532 | ±16 | 1.4K |
| 13 | gemini-3.1-pro-preview | 1531 | ±9 | 6.1K | |
| 14 | kimi-k2.6 | moonshot | 1529 | ±14 | 1.9K |
| 15 | grok-4.6-high | xai | 1528 | ±34 | 293 |
| 16 | qwen3.7-max-preview | alibaba | 1526 | ±37 | 263 |
| 17 | claude-opus-4-7 | anthropic | 1526 | ±11 | 3.5K |
| 18 | gemini-3-pro | 1525 | ±11 | 3.2K | |
| 19 | gpt-5.5-high | openai | 1524 | ±11 | 3.5K |
| 20 | gpt-5.6-sol-xhigh | openai | 1524 | ±16 | 1.4K |
| 21 | muse-spark-1.1 | meta | 1523 | ±16 | 1.5K |
| 22 | glm-5.3-max | zai | 1520 | ±31 | 369 |
| 23 | glm-5.1 | zai | 1518 | ±12 | 2.7K |
| 24 | gemini-3.5-flash-medium | 1518 | ±14 | 1.9K | |
| 25 | gpt-5.4-high | openai | 1517 | ±11 | 3.5K |
| 26 | muse-spark-1.2 (xHigh) | meta | 1516 | ±38 | 260 |
| 27 | glm-5.2-max | zai | 1516 | ±14 | 2.0K |
| 28 | kimi-k3-max | moonshot | 1515 | ±18 | 1.1K |
| 29 | gpt-5.6-terra-xhigh | openai | 1514 | ±16 | 1.5K |
| 30 | qwen3.8-27b | alibaba | 1513 | ±34 | 291 |
| 31 | glm-5 | zai | 1510 | ±14 | 1.7K |
| 32 | ernie-5.0-preview-1022 | baidu | 1509 | ±30 | 381 |
| 33 | gemini-2.5-pro | 1509 | ±7 | 8.8K | |
| 34 | gemini-3-flash | 1509 | ±13 | 2.3K | |
| 35 | gpt-5.4 | openai | 1508 | ±11 | 3.7K |
| 36 | qwen3.7-plus | alibaba | 1508 | ±14 | 2.0K |
| 37 | mimo-v2.5-pro | xiaomi | 1503 | ±11 | 3.0K |
| 38 | muse-spark | meta | 1503 | ±21 | 850 |
| 39 | claude-opus-4-8 | anthropic | 1503 | ±12 | 2.7K |
| 40 | hy3 | tencent | 1502 | ±28 | 434 |
| 41 | ernie-5.1 | baidu | 1502 | ±15 | 1.8K |
| 42 | grok-4.5 | xai | 1502 | ±16 | 1.6K |
| 43 | glm-4.6 | zai | 1500 | ±12 | 2.6K |
| 44 | ernie-5.0-0110 | baidu | 1499 | ±13 | 2.2K |
| 45 | claude-opus-4-8-high | anthropic | 1498 | ±12 | 2.7K |
| 46 | kimi-k2.5-thinking | moonshot | 1498 | ±10 | 3.9K |
| 47 | qwen3.5-397b-a17b | alibaba | 1497 | ±10 | 4.3K |
| 48 | ernie-5.0-preview-1203 | baidu | 1497 | ±21 | 792 |
| 49 | glm-4.7 | zai | 1495 | ±19 | 961 |
| 50 | inkling | thinky | 1495 | ±16 | 1.5K |
| 51 | gpt-5.1-high | openai | 1493 | ±11 | 3.1K |
| 52 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4 | nvidia | 1491 | ±23 | 631 |
| 53 | glm-5v-turbo | zai | 1491 | ±24 | 605 |
| 54 | qwen3.6-max-preview | alibaba | 1489 | ±33 | 320 |
| 55 | dola-seed-2.0-pro | bytedance | 1489 | ±10 | 4.4K |
| 56 | claude-sonnet-4-6 | anthropic | 1489 | ±10 | 3.8K |
| 57 | deepseek-v4-pro | deepseek | 1485 | ±12 | 2.9K |
| 58 | claude-sonnet-5-high | anthropic | 1483 | ±14 | 2.0K |
| 59 | deepseek-v4-pro-high-preview | deepseek | 1483 | ±12 | 2.8K |
| 60 | gemma-4-26b-a4b | 1483 | ±26 | 469 | |
| 61 | qwen3-235b-a22b-thinking-2507 | alibaba | 1483 | ±26 | 540 |
| 62 | grok-4.20-beta-0309-reasoning | xai | 1481 | ±11 | 3.6K |
| 63 | deepseek-v4-pro-high-20260813 | deepseek | 1481 | ±35 | 268 |
| 64 | qwen3-max-preview | alibaba | 1479 | ±13 | 2.1K |
| 65 | grok-4.20-multi-agent-beta-0309 | xai | 1478 | ±11 | 3.4K |
| 66 | grok-4.20-beta1 | xai | 1477 | ±16 | 1.5K |
| 67 | gemini-3-flash (thinking-minimal) | 1477 | ±9 | 5.1K | |
| 68 | qwen3.6-plus | alibaba | 1473 | ±13 | 2.2K |
| 69 | qwen3.5-27b | alibaba | 1472 | ±14 | 1.8K |
| 70 | gemma-4-31b | 1472 | ±26 | 465 | |
| 71 | mimo-v2.5 | xiaomi | 1470 | ±13 | 2.1K |
| 72 | deepseek-v3.1-thinking | deepseek | 1470 | ±18 | 1.2K |
| 73 | gpt-5.1 | openai | 1469 | ±10 | 3.3K |
| 74 | claude-opus-4-5-20251101 | anthropic | 1469 | ±9 | 4.8K |
| 75 | gpt-5.6-luna-xhigh | openai | 1468 | ±16 | 1.6K |
| 76 | gemini-3.5-flash-lite | 1468 | ±17 | 1.4K | |
| 77 | mimo-v2-omni | xiaomi | 1467 | ±20 | 859 |
| 78 | deepseek-v4-flash-high-preview | deepseek | 1467 | ±12 | 2.5K |
| 79 | glm-4.5 | zai | 1466 | ±14 | 1.8K |
| 80 | amazon-nova-experimental-chat-11-10 | amazon | 1466 | ±14 | 1.8K |
| 81 | qwen3.5-122b-a10b | alibaba | 1466 | ±14 | 1.9K |
| 82 | longcat-flash-chat-2602-exp | meituan | 1465 | ±15 | 1.7K |
| 83 | grok-4.1 | xai | 1465 | ±9 | 4.8K |
| 84 | mimo-v2-flash (non-thinking) | xiaomi | 1465 | ±11 | 3.0K |
| 85 | deepseek-v4-flash | deepseek | 1465 | ±12 | 2.5K |
| 86 | claude-opus-4-5-20251101-high-32k | anthropic | 1465 | ±11 | 2.8K |
| 87 | qwen3-235b-a22b-instruct-2507 | alibaba | 1465 | ±8 | 6.8K |
| 88 | deepseek-v3.2-exp | deepseek | 1463 | ±18 | 997 |
| 89 | gemini-3.1-flash-lite-preview | 1463 | ±10 | 3.6K | |
| 90 | qwen3-vl-235b-a22b-instruct | alibaba | 1462 | ±24 | 701 |
| 91 | qwen3-next-80b-a3b-instruct | alibaba | 1462 | ±14 | 1.7K |
| 92 | gpt-5.2-chat-latest-20260210 | openai | 1461 | ±13 | 2.1K |
| 93 | qwen3.5-35b-a3b | alibaba | 1461 | ±14 | 1.8K |
| 94 | kimi-k2.5-instant | moonshot | 1461 | ±27 | 454 |
| 95 | deepseek-v3.2-exp-thinking | deepseek | 1460 | ±26 | 500 |
| 96 | claude-sonnet-4-5-20250929 | anthropic | 1459 | ±9 | 5.3K |
| 97 | claude-sonnet-4-5-20250929-high-32k | anthropic | 1458 | ±9 | 5.3K |
| 98 | grok-4.1-thinking | xai | 1458 | ±9 | 4.6K |
| 99 | grok-4-fast-chat | xai | 1457 | ±28 | 463 |
| 100 | Inkling Small | thinky | 1457 | ±19 | 955 |
能力評分資料來自 LMArena(原 LMSYS Chatbot Arena)公開發布的 排行榜資料集「中文(chinese)」切片,許可 CC-BY-4.0,本站署名引用、未作修改。 Arena 分由真人匿名中文盲測對戰經統計模型(Bradley-Terry)估算,反映相對偏好、非絕對能力,可能滯後或隨樣本波動,僅供參考。 本欄目僅作資訊整理,不構成任何投資或採購建議。本站不自建評測跑分。榜單釋出於 2026-08-27。