大模型能力榜
📊 全部数据 · 总览按 LMArena 竞技场(Chatbot Arena)的真人盲测对战评分,排出大模型的综合能力高下(overall 全球总榜)。Arena 分越高,代表在真人匿名对比中越受偏好——它反映的是偏好、非绝对能力,且头部几名的分差常落在置信区间内(见下表「置信区间」列),更宜看作近似并列。数据归因 LMArena,客观呈现、不构成投资或采购建议。榜单发布于 2026-08-27
| 排名 | 模型 | 机构 | Arena 分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 | claude-opus-5-max | anthropic | 1505 | ±6 | 15.4K |
| 2 | claude-opus-5-high | anthropic | 1504 | ±5 | 31.6K |
| 3 | claude-opus-4-6-high | anthropic | 1503 | ±3 | 72.1K |
| 4 | claude-opus-4-6 | anthropic | 1497 | ±3 | 76.1K |
| 5 | claude-fable-5 | anthropic | 1495 | ±5 | 25.8K |
| 6 | gemini-3.7-flash-high | 1490 | ±8 | 5.7K | |
| 7 | claude-opus-4-7-high | anthropic | 1490 | ±4 | 60.1K |
| 8 | muse-spark-1.2 (xHigh) | meta | 1488 | ±10 | 3.2K |
| 9 | gemini-3.5-flash-high | 1483 | ±4 | 32.2K | |
| 10 | claude-opus-4-7 | anthropic | 1483 | ±4 | 61.3K |
| 11 | gemini-3.1-pro-preview | 1480 | ±3 | 101.2K | |
| 12 | qwen3.8-max | alibaba | 1480 | ±6 | 11.8K |
| 13 | gemini-3-pro | 1480 | ±4 | 40.7K | |
| 14 | muse-spark-1.1 | meta | 1478 | ±5 | 22.2K |
| 15 | gemini-3.6-flash-high | 1477 | ±5 | 20.2K | |
| 16 | kimi-k3-max | moonshot | 1476 | ±6 | 16.6K |
| 17 | gemini-3.5-flash-medium | 1475 | ±5 | 30.6K | |
| 18 | glm-5.3-max | zai | 1475 | ±8 | 5.8K |
| 19 | qwen3.7-max-preview | alibaba | 1474 | ±10 | 3.7K |
| 20 | muse-spark | meta | 1474 | ±6 | 13.6K |
| 21 | gpt-5.5-high | openai | 1471 | ±4 | 61.6K |
| 22 | qwen3.5-max-preview | alibaba | 1471 | ±5 | 21.5K |
| 23 | gpt-5.4-high | openai | 1470 | ±4 | 60.6K |
| 24 | ernie-5.1 | baidu | 1468 | ±5 | 37.1K |
| 25 | glm-5.2-max | zai | 1467 | ±5 | 32.5K |
| 26 | gemini-3-flash | 1467 | ±4 | 30.2K | |
| 27 | gpt-5.5 | openai | 1466 | ±4 | 63.0K |
| 28 | glm-5.3-flash | zai | 1466 | ±12 | 2.4K |
| 29 | mimo-v2.5-pro | xiaomi | 1465 | ±4 | 56.0K |
| 30 | glm-5.1 | zai | 1463 | ±4 | 44.0K |
| 31 | claude-opus-4-8-high | anthropic | 1461 | ±4 | 46.8K |
| 32 | claude-sonnet-4-6 | anthropic | 1458 | ±4 | 66.4K |
| 33 | gemini-2.5-pro | 1458 | ±2 | 122.6K | |
| 34 | kimi-k2.6 | moonshot | 1455 | ±5 | 37.5K |
| 35 | qwen3.7-plus | alibaba | 1455 | ±5 | 36.3K |
| 36 | gpt-5.6-sol-xhigh | openai | 1454 | ±5 | 21.5K |
| 37 | gpt-5.4 | openai | 1453 | ±4 | 63.6K |
| 38 | claude-opus-4-8 | anthropic | 1452 | ±4 | 47.5K |
| 39 | grok-4.5 | xai | 1451 | ±5 | 24.2K |
| 40 | deepseek-v4-pro | deepseek | 1451 | ±4 | 54.2K |
| 41 | grok-4.20-beta-0309-reasoning | xai | 1451 | ±4 | 62.2K |
| 42 | claude-opus-4-5-20251101 | anthropic | 1450 | ±3 | 70.0K |
| 43 | grok-4.20-multi-agent-beta-0309 | xai | 1450 | ±4 | 60.8K |
| 44 | dola-seed-2.0-pro | bytedance | 1448 | ±3 | 74.3K |
| 45 | amazon-nova-experimental-chat-26-02-10 | amazon | 1448 | ±10 | 3.4K |
| 46 | claude-opus-4-5-20251101-high-32k | anthropic | 1447 | ±4 | 36.3K |
| 47 | gpt-5.6-terra-xhigh | openai | 1447 | ±5 | 22.3K |
| 48 | qwen3.6-max-preview | alibaba | 1446 | ±8 | 5.2K |
| 49 | glm-5 | zai | 1446 | ±4 | 27.6K |
| 50 | kimi-k2.5-thinking | moonshot | 1446 | ±3 | 70.6K |
| 51 | deepseek-v4-pro-high-preview | deepseek | 1445 | ±4 | 51.6K |
| 52 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4 | nvidia | 1445 | ±7 | 10.7K |
| 53 | grok-4.20-beta1 | xai | 1445 | ±5 | 26.6K |
| 54 | ernie-5.0-0110 | baidu | 1444 | ±4 | 34.9K |
| 55 | grok-4.6-high | xai | 1444 | ±10 | 3.5K |
| 56 | gemini-3-flash (thinking-minimal) | 1442 | ±3 | 85.9K | |
| 57 | ernie-5.0-preview-1203 | baidu | 1442 | ±7 | 9.6K |
| 58 | claude-sonnet-5-high | anthropic | 1442 | ±5 | 29.5K |
| 59 | gpt-5.1-high | openai | 1442 | ±4 | 40.3K |
| 60 | gemma-4-31b | 1442 | ±8 | 5.9K | |
| 61 | deepseek-v4-pro-high-20260813 | deepseek | 1441 | ±9 | 4.2K |
| 62 | hy3 | tencent | 1441 | ±8 | 6.5K |
| 63 | glm-4.6 | zai | 1440 | ±4 | 35.1K |
| 64 | qwen3-max-preview | alibaba | 1439 | ±5 | 27.2K |
| 65 | gpt-5.2-chat-latest-20260210 | openai | 1439 | ±4 | 34.2K |
| 66 | inkling | thinky | 1439 | ±5 | 20.4K |
| 67 | claude-sonnet-4-5-20250929 | anthropic | 1438 | ±3 | 79.7K |
| 68 | qwen3.5-397b-a17b | alibaba | 1438 | ±3 | 71.9K |
| 69 | glm-5v-turbo | zai | 1437 | ±7 | 9.4K |
| 70 | gemini-3.5-flash-lite | 1437 | ±5 | 20.1K | |
| 71 | qwen3.6-plus | alibaba | 1437 | ±4 | 45.4K |
| 72 | grok-4.1-thinking | xai | 1437 | ±3 | 64.2K |
| 73 | qwen3.8-27b | alibaba | 1437 | ±9 | 5.0K |
| 74 | mimo-v2-pro | xiaomi | 1437 | ±5 | 24.4K |
| 75 | grok-4.1 | xai | 1436 | ±3 | 66.4K |
| 76 | glm-4.7 | zai | 1436 | ±6 | 11.9K |
| 77 | gemma-4-26b-a4b | 1435 | ±8 | 5.8K | |
| 78 | minimax-m3 | minimax | 1434 | ±4 | 43.0K |
| 79 | claude-sonnet-4-5-20250929-high-32k | anthropic | 1434 | ±3 | 81.0K |
| 80 | deepseek-v4-flash | deepseek | 1432 | ±4 | 48.9K |
| 81 | ernie-5.0-preview-1022 | baidu | 1430 | ±9 | 4.7K |
| 82 | glm-4.5 | zai | 1430 | ±5 | 23.7K |
| 83 | gpt-5.6-luna-xhigh | openai | 1429 | ±5 | 22.9K |
| 84 | chatgpt-4o-latest-20250326 | openai | 1429 | ±3 | 80.7K |
| 85 | mistral-large-3 | mistral | 1428 | ±3 | 64.0K |
| 86 | mimo-v2.5 | xiaomi | 1428 | ±4 | 44.5K |
| 87 | deepseek-r1-0528 | deepseek | 1427 | ±6 | 18.1K |
| 88 | longcat-flash-chat-2602-exp | meituan | 1426 | ±5 | 28.0K |
| 89 | grok-3-preview-02-24 | xai | 1425 | ±4 | 32.4K |
| 90 | deepseek-v3.2 | deepseek | 1425 | ±4 | 46.5K |
| 91 | deepseek-v3.2-exp-thinking | deepseek | 1425 | ±7 | 8.9K |
| 92 | mistral-medium-2508 | mistral | 1425 | ±3 | 92.8K |
| 93 | deepseek-v4-flash-high-preview | deepseek | 1424 | ±4 | 48.7K |
| 94 | longcat-flash-chat | meituan | 1423 | ±6 | 11.2K |
| 95 | mimo-v2-omni | xiaomi | 1423 | ±6 | 19.4K |
| 96 | deepseek-v3.2-exp | deepseek | 1423 | ±6 | 11.8K |
| 97 | gpt-5.1 | openai | 1423 | ±4 | 43.0K |
| 98 | mistral-medium-3.5 | mistral | 1421 | ±7 | 11.0K |
| 99 | amazon-nova-experimental-chat-12-10 | amazon | 1421 | ±10 | 3.6K |
| 100 | qwen3-vl-235b-a22b-instruct | alibaba | 1420 | ±7 | 11.2K |
中文能力评测参考
LMArena 总榜以英文对战为主;想看中文场景,可切到上方「中文榜」(LMArena 中文竞技场),或参考国内权威榜单(本站不转载其数据,仅外链):
能力评分数据来自 LMArena(原 LMSYS Chatbot Arena)公开发布的 排行榜数据集,许可 CC-BY-4.0,本站署名引用、未作修改。 Arena 分由真人匿名盲测对战经统计模型(Bradley-Terry)估算,反映相对偏好、非绝对能力,可能滞后或随样本波动,仅供参考。 本栏目仅作信息整理,不构成任何投资或采购建议。本站不自建评测跑分。榜单发布于 2026-08-27。