IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。
国产模型在综合榜已有多款进入中上游,具体排名如下:
阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;
月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;
阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。
claude-fable-5
Anthropic
1507 ±6
19390
$10 / $50
1M
claude-opus-4-6-thinking
Anthropic
1505 ±4
69336
$2.5 / $12.5
1M
claude-opus-4-7-thinking
Anthropic
1502 ±4
57018
$5 / $25
1M
新上榜
muse-spark-1.2 (xHigh)
Meta
1498 ±13
2057
$1.25 / $4.25
N/A
↓ 1
claude-opus-4-6
Anthropic
1497 ±3
73158
$2.5 / $12.5
1M
新上榜
qwen3.8-max
Alibaba
1497 ±9
4662
$2 / $6
1M
↓ 2
claude-opus-4-7
Anthropic
1493 ±4
58135
$5 / $25
1M
↓ 2
claude-opus-5-high
Anthropic
1493 ±6
14902
$5 / $25
1M
↓ 2
claude-opus-5-max
Anthropic
1488 ±8
7137
$5 / $25
1M
10
↓ 1
muse-spark
Meta
1488 ±6
13476
N/A
— 以下为 Top 10 外的国产模型 —
14
↓ 2
kimi-k3-max
Moonshot
1485 ±7
9861
N/A
23
↓ 2
qwen3.7-max-preview
Alibaba
1475 ±10
3695
$1.48 / $4.43
1M
代码榜
代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。
国产模型在代码榜已有多款进入前 30,具体如下:
月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;
阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;
阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;
小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;
智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。
claude-fable-5
Anthropic
1553 ±9
5234
$10 / $50
1M
claude-opus-4-7-thinking
Anthropic
1552 ±6
16303
$5 / $25
1M
claude-opus-4-6-thinking
Anthropic
1551 ±6
18015
$2.5 / $12.5
1M
claude-opus-4-6
Anthropic
1547 ±6
20444
$2.5 / $12.5
1M
claude-opus-4-7
Anthropic
1546 ±6
16534
$5 / $25
1M
↑ 2
kimi-k3-max
Moonshot
1542 ±12
2611
N/A
↓ 1
claude-opus-4-8-thinking
Anthropic
1535 ±7
10509
$2.5 / $12.5
1M
新上榜
qwen3.8-max
Alibaba
1532 ±16
1411
$2 / $6
1M
↑ 1
muse-spark-1.1
Meta
1532 ±10
4199
$1.25 / $4.25
N/A
10
↓ 1
claude-opus-4-5-20251101-thinking-32k
Anthropic
1530 ±7
7603
$5 / $25
200K
— 以下为 Top 10 外的国产模型 —
17
↓ 1
qwen3.7-max-preview
Alibaba
1526 ±18
1112
$1.48 / $4.43
1M
28
mimo-v2.5-pro
Xiaomi
1519 ±7
13199
$0.44 / $0.87
1.05M
30
↓ 3
glm-5.1
Z.ai
1517 ±7
10330
$1.4 / $4.4
202.8K
前端开发榜
本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。
国产模型具体排名如下:
月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;
阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;
智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;
深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。
claude-opus-5-max
Anthropic
1686 ±11
4029
$5 / $25
1M
kimi-k3-max
Moonshot
1675 ±12
4372
$3 / $15
1.05M
claude-opus-5-high
Anthropic
1670 ±10
5145
$5 / $25
1M
新上榜
qwen3.8-max
Alibaba
1667 ±16
1980
$2 / $6
1M
↓ 1
claude-fable-5
Anthropic
1630 ±9
6816
$10 / $50
1M
↓ 1
gpt-5.6-sol-xhigh(codex-harness)
OpenAI
1620 ±9
6903
$5 / $30
1.05M
↓ 1
glm-5.2-max
Z.ai
1588 ±9
6924
$1.4 / $4.4
1M
新上榜
deepseek-v4-flash-high
DeepSeek
1581 ±15
1931
$0.14 / $0.28
1.05M
↓ 1
claude-opus-4-8-thinking
Anthropic
1565 ±8
9549
$2.5 / $12.5
1M
10
↓ 1
claude-opus-4-7
Anthropic
1560 ±7
12398
$5 / $25
1M
— 以下为 Top 10 外的国产模型 —
21
↓ 3
seed-2.1-pro-preview
Bytedance
1524 ±9
6069
N/A
24
↓ 1
hy3
Tencent
1522 ±15
1729
$0.13 / $0.53
262.1K
25
↓ 3
qwen3.7-max-20260517
Alibaba
1516 ±8
8044
$1.48 / $4.43
1M
26
↓ 2
glm-5.1
Z.ai
1515 ±8
7853
$1.4 / $4.4
202.8K
27
↓ 2
kimi-k2.6
Moonshot
1510 ±8
9261
$0.95 / $4
262.1K
智能体榜
智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。
国产模型在智能体榜已有多款进入前 30,具体如下:
月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;
智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;
智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。
↑ 2
Claude Opus 5 (High)
Anthropic
11.99% ±1.37%
16.04% ±2.79%
19.46% ±5.19%
10.29% ±2.51%
↓ 1
Claude Fable 5 (High)
Anthropic
11.66% ±2.39%
11.47% ±4.46%
22.56% ±8.25%
10.01% ±4.93%
↓ 1
Claude Opus 5 (Max)
Anthropic
11.19% ±1.62%
16.36% ±3.11%
19.07% ±6.03%
5.8% ±3.1%
GPT 5.6 Sol (xHigh)
OpenAI
10.28% ±1.72%
9.06% ±3.48%
22.7% ±6.42%
8.42% ±3.5%
Kimi K3 (Max)
Moonshot
10.08% ±1.07%
14.97% ±2.09%
19.68% ±3.85%
7.45% ±1.97%
Claude Opus 4.8 (Thinking)
Anthropic
9.35% ±1.7%
8.81% ±2.9%
21.46% ±5.38%
8.5% ±3.08%
↑ 1
GPT 5.5 (xHigh)
OpenAI
8.45% ±0.99%
5.24% ±2.08%
13.56% ±3.55%
8.19% ±1.8%
↑ 1
Claude Opus 4.7 (Thinking)
Anthropic
8.33% ±1.32%
6.65% ±2.76%
11.87% ±4.59%
8.61% ±2.72%
↓ 2
Claude Sonnet 5 (High)
Anthropic
7.46% ±2.15%
5.56% ±4.29%
14.8% ±7.65%
5.14% ±4.55%
10
↑ 1
Claude Opus 4.7
Anthropic
7.32% ±1.36%
5.55% ±2.85%
10.72% ±4.45%
9.54% ±2.7%
— 以下为 Top 10 外的国产模型 —
12
GLM 5.2 (Max)
Z.ai
6.75% ±0.9%
9.21% ±1.83%
12.39% ±3.21%
5.62% ±1.59%
21
新上榜
Deepseek V4 Flash (High)(20260731)
DeepSeek
2.84% ±1.1%
8.53% ±2.54%
0.46% ±3.64%
0.43% ±2.19%
23
Kimi K2.7 Code
Moonshot
0.69% ±1.94%
4.12% ±4.08%
2.36% ±6.68%
1.92% ±4.37%
24
↓ 2
GLM 5.1
Z.ai
0.35% ±0.77%
1.06% ±1.72%
0.72% ±2.5%
0.76% ±1.4%
25
Qwen3.7 Max
Alibaba
0.16% ±0.88%
0.24% ±2.11%
5.07% ±2.72%
0.21% ±1.55%
26
DeepSeek V4 Pro
DeepSeek
0.33% ±0.86%
2.74% ±2.16%
3.35% ±2.78%
0.3% ±1.54%
27
↑ 2
Kimi K2.6
Moonshot
0.48% ±2.16%
2.28% ±4.11%
2.12% ±6.8%
1.66% ±4.49%
30
↓ 3
Hy3
Tencent
1.12% ±1.42%
2.2% ±3.04%
3.7% ±4.91%
9.01% ±2.6%
AI 生图榜
本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。
gpt-image-2 (medium)
OpenAI
1380 ±5
69194
N/A
新上榜
grok-imagine-image-2.0 (low)
SpaceXAI
1320 ±12
2722
N/A
↓ 1
reve-2.1
Reve
1302 ±8
7598
N/A
↓ 1
muse-image
Meta
1283 ±7
14510
N/A
↓ 1
reve-2.0
Reve
1270 ±6
14650
N/A
↓ 1
gemini-3.1-flash-image(nano-banana-2) [web-search]
1263 ±5
27910
N/A
新上榜
qwen-image-3.0-pro
Alibaba
1258 ±10
3735
N/A
↓ 2
seedream-5.0-pro
Bytedance
1257 ±5
26510
N/A
↓ 2
mai-image-2.5
Microsoft AI
1256 ±5
44940
N/A
10
↓ 2
gemini-3.1-flash-lite-image(nano-banana-2-lite)
1251 ±6
16419
N/A
— 以下为 Top 10 外的国产模型 —
16
↓ 2
qwen-image-2.0-pro-2026-06-22
Alibaba
1191 ±6
12026
N/A
29
↓ 4
hunyuan-image-3.0
Tencent
1151 ±3
173366
N/A
AI 视频榜
AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。
gemini-omni-flash
1513 ±12
14571
N/A
dreamina-seedance-2.0-720p
Bytedance
1479 ±11
47067
N/A
muse-video
Meta
1458 ±15
2160
N/A
新上榜
minimax-h3
MiniMax
1455 ±19
1060
N/A
↓ 1
happyhorse-1.0
Alibaba-ATH
1428 ±13
21979
N/A
↓ 1
sora-2-pro
OpenAI
1365 ±8
44543
$0 / $0.3
N/A
veo-3.1-audio
1364 ±14
13687
$0 / $0.4
N/A
↓ 2
veo-3.1-audio-1080p
1363 ±10
24846
N/A
↓ 1
veo-3.1-fast-audio
1362 ±11
39301
$0 / $0.15
N/A
10
↓ 1
veo-3.1-fast-audio-1080p
1358 ±10
25637
N/A
— 以下为 Top 10 外的国产模型 —
13
↓ 2
wan2.7-t2v
Alibaba
1347 ±9
15246
N/A
16
↓ 1
wan2.6-t2v
Alibaba
1330 ±9
41706
N/A
17
↓ 1
seedance-v1.5-pro
Bytedance
1256 ±7
75653
N/A
19
↓ 2
wan2.5-t2v-preview
Alibaba
1252 ±10
25895
N/A
28
↓ 1
hailuo-2.3
MiniMax
1202 ±7
72127
N/A
29
↓ 1
hailuo-02-pro
MiniMax
1198 ±13
9365
N/A
30
↓ 1
seedance-v1-pro
Bytedance
1190 ±11
12117
N/A
本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。