IT之家 8 月 24 日消息,Arena(arena.ai)平台发布 2026 年第 34 周(8 月 17 日 ~8 月 23 日)AI 大模型盲测排名,本期智谱新发布的 glm-5.3-max 首次入榜即闯入综合榜 Top 15,位列第 13 名,ELO 得分 1487 分;月之暗面 kimi-k3-max 从第 12 名升至第 10 名,首次杀入综合榜前十。此外,本周还有多个国产模型在各细分榜单中取得亮眼表现,新模型入榜数量较多,整体竞争格局进一步变化。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
综合榜头部格局保持稳定,claude-fable-5 以 1508 分蝉联第一,claude-opus-4-6-high 和 claude-opus-4-7-high 分别以 1504 分、 1502 分位列二、三名,三者分差均在 30 分以内,在误差范围内视为接近。
本周最大变化是新入榜的 glm-5.3-max 直接来到第 13 名,表现突出; kimi-k3-max 上升 2 位来到第 10 名,首次进入前十; muse-spark-1.1 上升 3 位至第 8 名。同时本周有 gpt-5.5-instant 、 claude-opus-4-8 两款新模型入榜,分别位列第 28、 29 名。qwen3.8-max 排名有所下滑,从第 8 名降至第 19 名。
国产模型在中上游占据多个席位,整体表现稳定:
月之暗面 kimi-k3-max 位列第 10 名,ELO 1489 分,较上周上升 2 位;
智谱 glm-5.3-max 位列第 13 名,ELO 1487 分,首次入榜;
阿里 qwen3.8-max 位列第 19 名,ELO 1481 分,较上周下降 11 位;
阿里 qwen3.7-max-preview 位列第 27 名,ELO 1474 分,排名基本持平。
claude-fable-5
Anthropic
1508 ±5
24331
$10 / $50
1M
claude-opus-4-6-high
Anthropic
1504 ±4
72359
$5 / $25
1M
claude-opus-4-7-high
Anthropic
1502 ±4
60203
$5 / $25
1M
muse-spark-1.2 (xHigh)
Meta
1498 ±10
3257
$1.25 / $4.25
N/A
claude-opus-4-6
Anthropic
1497 ±3
76362
$5 / $25
1M
claude-opus-4-7
Anthropic
1494 ±4
61304
$5 / $25
1M
claude-opus-5-high
Anthropic
1493 ±5
27610
$5 / $25
1M
↑ 3
muse-spark-1.1
Meta
1491 ±5
20242
$1.25 / $4.25
N/A
gemini-3.7-flash-high
1490 ±8
5718
$0.75 / $3.57
1.05M
10
↑ 2
kimi-k3-max
Moonshot
1489 ±6
15054
N/A
— 以下为 Top 10 外的国产模型 —
13
新上榜
glm-5.3-max
Z.ai
1487 ±10
3751
$1.4 / $4.4
1.05M
19
↓ 11
qwen3.8-max
Alibaba
1481 ±7
9955
$2 / $6
1M
27
↓ 1
qwen3.7-max-preview
Alibaba
1474 ±10
3712
$1.48 / $4.43
1M
代码榜
代码榜头部发生微调,claude-opus-4-7-high 升至榜首,ELO 1552 分,claude-opus-4-6-high 位列第二,原本榜首的 claude-fable-5 降至第三,三者 ELO 分差仅为 1 分,在误差范围内属于并列水平。智谱 glm-5.3-max 首次入榜即杀入前十,位列第 10 名,ELO 1531 分,首秀表现亮眼。grok-4.20-beta1 新入榜位列第 20 名; claude-sonnet-4-5-20250929-high-32k 、 gpt-5.5-high 两款新模型也完成首次排名。qwen3.8-max 排名下滑明显,从第 13 名降至第 25 名。
国产模型在代码榜中已有多款进入前三十,具体排名如下:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名基本持平;
智谱 glm-5.3-max 位列第 10 名,ELO 1531 分,首次入榜;
阿里 qwen3.7-max-preview 位列第 17 名,ELO 1524 分,排名基本持平;
阿里 qwen3.8-max 位列第 25 名,ELO 1520 分,较上周下降 12 位;
小米 mimo-v2.5-pro 位列第 27 名,ELO 1519 分,排名基本持平。
↑ 1
claude-opus-4-7-high
Anthropic
1552 ±6
17212
$5 / $25
1M
↑ 1
claude-opus-4-6-high
Anthropic
1551 ±6
18844
$5 / $25
1M
↓ 2
claude-fable-5
Anthropic
1551 ±8
6552
$10 / $50
1M
claude-opus-4-7
Anthropic
1547 ±6
17362
$5 / $25
1M
claude-opus-4-6
Anthropic
1546 ±5
21288
$5 / $25
1M
kimi-k3-max
Moonshot
1542 ±10
3966
N/A
↑ 2
claude-opus-5-high
Anthropic
1533 ±8
7416
$5 / $25
1M
↓ 1
claude-opus-4-8-high
Anthropic
1533 ±7
12425
$5 / $25
1M
↓ 1
muse-spark-1.2 (xHigh)
Meta
1531 ±20
939
$1.25 / $4.25
N/A
10
新上榜
glm-5.3-max
Z.ai
1531 ±19
994
$1.4 / $4.4
1.05M
— 以下为 Top 10 外的国产模型 —
17
qwen3.7-max-preview
Alibaba
1524 ±18
1119
$1.48 / $4.43
1M
25
↓ 12
qwen3.8-max
Alibaba
1520 ±11
2970
$2 / $6
1M
27
↓ 2
mimo-v2.5-pro
Xiaomi
1519 ±6
14938
$0.44 / $0.87
1.05M
前端开发榜
前端开发榜头部依旧稳定,claude-opus-5-max 以 1691 分蝉联第一,国产 kimi-k3-max 和 qwen3.8-max 稳定占据二、三名,ELO 分别为 1674 分和 1669 分,与榜首分差在 30 分以内,误差范围内视为接近。新入榜的 glm-5.3-max 直接来到第 8 名,qwen3.8-27b 首次入榜位列第 9 名,两款国产新模型均进入前十,表现突出。目前已有多款国产模型进入前十五,在前端开发领域竞争力显著。
claude-opus-5-max
Anthropic
1691 ±9
8116
$5 / $25
1M
kimi-k3-max
Moonshot
1674 ±11
4546
$3 / $15
1.05M
qwen3.8-max
Alibaba
1669 ±13
3212
$2 / $6
1M
claude-opus-5-high
Anthropic
1663 ±8
8659
$5 / $25
1M
grok-4.6-high
SpaceXAI
1629 ±17
1523
$2 / $6
500K
claude-fable-5
Anthropic
1626 ±8
8382
$10 / $50
1M
gpt-5.6-sol-xhigh(codex-harness)
OpenAI
1619 ±8
9499
$5 / $30
1.05M
新上榜
glm-5.3-max
Z.ai
1599 ±15
1916
$1.4 / $4.4
1.05M
新上榜
qwen3.8-27b
Alibaba
1595 ±13
2464
$0.5 / $3
N/A
10
↓ 2
gemini-3.7-flash-high
1587 ±13
2552
$0.75 / $3.57
1.05M
— 以下为 Top 10 外的国产模型 —
11
↓ 2
glm-5.2-max
Z.ai
1582 ±8
8775
$1.4 / $4.4
1M
12
↓ 2
deepseek-v4-pro-high-20260813
DeepSeek
1582 ±12
2869
$1.32 / $3.96
N/A
13
↓ 2
deepseek-v4-flash-high
DeepSeek
1579 ±11
3537
$0.44 / $1.32
1.05M
26
↓ 1
seed-2.1-pro-preview
Bytedance
1521 ±8
7679
N/A
28
↓ 4
hy3
Tencent
1518 ±12
2680
$0.13 / $0.53
262.1K
AI 生图榜
AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1381 分继续领跑,国产 seedream-5.0-pro 稳定保持第 8 名,qwen-image-3.0-pro 位列第 9 名,两款国产模型均进入前十,整体排名没有大幅波动。hunyuan-image-3.0 本周升至第 29 名,保持在前三十行列。
gpt-image-2 (medium)
OpenAI
1381 ±5
70065
$8 / $30
N/A
mai-image-2.6-preview
Microsoft AI
1336 ±11
3488
N/A
grok-imagine-image-2.0 (low)
SpaceXAI
1316 ±12
2676
N/A
reve-2.1
Reve
1302 ±8
7588
N/A
muse-image
Meta
1282 ±7
15119
N/A
reve-2.0
Reve
1270 ±6
14641
N/A
gemini-3.1-flash-image(nano-banana-2) [web-search]
1264 ±5
29102
N/A
seedream-5.0-pro
Bytedance
1258 ±5
28830
N/A
qwen-image-3.0-pro
Alibaba
1257 ±9
4705
N/A
10
mai-image-2.5
Microsoft AI
1256 ±4
46329
N/A
— 以下为 Top 10 外的国产模型 —
16
↑ 1
qwen-image-2.0-pro-2026-06-22
Alibaba
1191 ±6
12021
N/A
29
↑ 1
hunyuan-image-3.0
Tencent
1151 ±3
173345
N/A
AI 视频榜
AI 视频榜中,字节跳动新发布的 dreamina-seedance-2.5-720p 首次入榜即来到第 4 名,ELO 1477 分,紧随其前代产品 dreamina-seedance-2.0-720p 之后,两款国产模型均进入前五,表现亮眼。gemini-omni-flash 继续以 1512 分排名第一,flux-3-video 位列第二,dreamina-seedance-2.0-720p 保持第三。
gemini-omni-flash
1512 ±11
16916
N/A
flux-3-video
Black Forest Labs
1494 ±17
1291
N/A
dreamina-seedance-2.0-720p
Bytedance
1482 ±10
49058
N/A
新上榜
dreamina-seedance-2.5-720p
Bytedance
1477 ±19
1337
N/A
↓ 1
muse-video
Meta
1457 ±15
2176
N/A
↓ 1
minimax-h3
MiniMax
1453 ±13
3081
N/A
↓ 1
happyhorse-1.0
Alibaba-ATH
1428 ±13
22113
N/A
↓ 1
sora-2-pro
OpenAI
1364 ±7
46509
$0 / $0.3
N/A
↓ 1
veo-3.1-audio
1364 ±14
13743
$0 / $0.4
N/A
10
↓ 1
veo-3.1-audio-1080p
1363 ±10
24979
N/A
— 以下为 Top 10 外的国产模型 —
15
↓ 1
wan2.7-t2v
Alibaba
1344 ±9
17769
N/A
18
↓ 1
wan2.6-t2v
Alibaba
1330 ±8
44304
N/A
19
↓ 1
seedance-v1.5-pro
Bytedance
1256 ±7
75990
N/A
21
↓ 1
wan2.5-t2v-preview
Alibaba
1249 ±9
28239
N/A
智能体榜
智能体榜头部依旧由 Anthropic 模型占据,Claude Opus 5 (High) 以 12.47% 的净提升度保持第一,Claude Opus 5 (Max) 上升一位至第二,Claude Fable 5 (High) 降至第三,三者净提升度差距小于置信区间,在误差范围内视为接近。月之暗面 Kimi K3 (Max) 上升一位至第四,净提升度 10.41%,任务确认成功率达到 17.97%,整体表现已经进入头部梯队。本周 DeepSeek V4 Pro (High) (0813) 和 Qwen3.8 Max 两款国产模型新入榜,分别位列第 14 和第 15 名,表现不俗。
国产模型在智能体榜已有多款进入前三十,头部已经摸到第一梯队门槛:
月之暗面 Kimi K3 (Max) 排名第 4,净提升度 10.41%,任务确认成功率 17.97%,较上周上升 1 位;
深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14,净提升度 6.26%,任务确认成功率 13.06%,首次入榜;
阿里 Qwen3.8 Max 排名第 15,净提升度 6.20%,工具幻觉率仅 0.18%,首次入榜;
智谱 GLM 5.2 (Max) 排名第 17,净提升度 5.82%,较上周下降 3 位;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 20,净提升度 3.99%。
Claude Opus 5 (High)
Anthropic
12.47% ±1.54%
15.41% ±3.16%
20.52% ±5.59%
11.15% ±2.98%
↑ 1
Claude Opus 5 (Max)
Anthropic
12% ±1.8%
18.52% ±3.24%
19.13% ±6.56%
6.65% ±3.66%
↓ 1
Claude Fable 5 (High)
Anthropic
11.57% ±1.7%
12.44% ±3.24%
21.37% ±5.95%
8.99% ±3.55%
↑ 1
Kimi K3 (Max)
Moonshot
10.41% ±0.62%
17.97% ±1.23%
18.31% ±2.23%
5.96% ±1.13%
↓ 1
GPT 5.6 Sol (xHigh)
OpenAI
9.74% ±1.39%
10% ±2.87%
22.2% ±5.11%
5.77% ±2.88%
Claude Opus 4.8 (High)
Anthropic
9.55% ±1.51%
8.26% ±2.7%
21.65% ±4.97%
9.01% ±2.86%
GPT 5.5 (xHigh)
OpenAI
8.51% ±0.93%
4.42% ±1.96%
13.46% ±3.23%
8.86% ±1.76%
Claude Opus 4.7 (High)
Anthropic
8.12% ±1.24%
5.62% ±2.53%
12.36% ±4.17%
8.44% ±2.47%
GPT 5.5 (High)
OpenAI
7.74% ±0.84%
4.09% ±1.74%
11.26% ±2.94%
9.12% ±1.56%
10
Claude Opus 4.7
Anthropic
7.4% ±1.25%
4.99% ±2.59%
11.51% ±4.09%
9.32% ±2.45%
— 以下为 Top 10 外的国产模型 —
14
新上榜
DeepSeek V4 Pro (High) (0813)
DeepSeek
6.26% ±1.28%
13.06% ±2.65%
3.82% ±4.37%
2.35% ±2.83%
15
新上榜
Qwen3.8 Max
Alibaba
6.2% ±1.36%
11.62% ±3.03%
6.81% ±4.79%
4% ±2.67%
17
↓ 3
GLM 5.2 (Max)
Z.ai
5.82% ±0.87%
7.24% ±1.87%
9.42% ±2.99%
5.22% ±1.53%
20
↓ 1
Deepseek V4 Flash (High)(20260731)
DeepSeek
3.99% ±0.79%
8.09% ±1.89%
2.15% ±2.64%
3.45% ±1.5%
27
↓ 2
Kimi K2.7 Code
Moonshot
0.43% ±2.07%
3.72% ±4.42%
1.53% ±6.94%
2.59% ±4.69%
28
DeepSeek V4 Pro
DeepSeek
0.05% ±0.88%
2.66% ±2.21%
2.39% ±2.82%
0.15% ±1.66%
29
↓ 3
GLM 5.1
Z.ai
0% ±0.75%
0.93% ±1.69%
0.28% ±2.27%
0.97% ±1.4%
本周 Arena 榜单迎来多款国产新模型亮相,智谱 glm-5.3-max 在综合榜、代码榜、前端开发榜均取得出色排名,月之暗面 kimi-k3-max 首次杀入综合榜前十,智能体榜也进入前四,字节跳动新模型 dreamina-seedance-2.5-720p 在 AI 视频榜直接进入前五,国产模型整体在多个维度继续突破。接下来随着更多国产大模型新版本发布,预计排名竞争将进一步加剧,值得后续关注。