IT之家 8 月 17 日消息,Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。
谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。
国产模型整体处于榜单中上游,具体排名如下:
月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;
阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;
阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。
claude-fable-5
Anthropic
1506 ±5
21533
$10 / $50
1M
新上榜
claude-opus-4-6-high
Anthropic
1505 ±4
72516
$5 / $25
1M
新上榜
claude-opus-4-7-high
Anthropic
1502 ±4
60331
$5 / $25
1M
muse-spark-1.2 (xHigh)
Meta
1498 ±10
3280
$1.25 / $4.25
N/A
claude-opus-4-6
Anthropic
1497 ±3
76474
$5 / $25
1M
↑ 1
claude-opus-4-7
Anthropic
1494 ±4
61419
$5 / $25
1M
↑ 1
claude-opus-5-high
Anthropic
1493 ±5
20030
$5 / $25
1M
↓ 2
qwen3.8-max
Alibaba
1491 ±8
7004
$2 / $6
1M
新上榜
gemini-3.7-flash-high
1490 ±8
5744
$0.75 / $3.57
1.05M
10
↓ 1
claude-opus-5-max
Anthropic
1489 ±7
9679
$5 / $25
1M
— 以下为 Top 10 外的国产模型 —
12
↑ 2
kimi-k3-max
Moonshot
1489 ±6
11969
N/A
26
↓ 3
qwen3.7-max-preview
Alibaba
1474 ±10
3717
$1.48 / $4.43
1M
代码榜
代码榜格局同样由 Anthropic 新模型主导,claude-fable-5 以 1554 分守住榜首位置,新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分别以 1552 分、 1551 分占据第二、第三名,分数差距极小,误差范围内视为并列。kimi-k3-max 稳定在第六名,ELO 分数上涨 2 分,依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名,是本周涨幅最大的头部模型。
国产模型在代码榜占据多个中上游席位,具体排名如下:
月之暗面 kimi-k3-max 排名最高,位列第 6 名,ELO 1544 分,排名不变;
阿里 qwen3.8-max 位列第 13 名,ELO 1529 分,较上周下降 5 位;
阿里 qwen3.7-max-preview 位列第 17 名,ELO 1525 分,排名不变;
小米 mimo-v2.5-pro 位列第 25 名,ELO 1520 分,较上周上升 3 位。
claude-fable-5
Anthropic
1554 ±9
5817
$10 / $50
1M
新上榜
claude-opus-4-7-high
Anthropic
1552 ±6
17272
$5 / $25
1M
新上榜
claude-opus-4-6-high
Anthropic
1551 ±6
18894
$5 / $25
1M
↑ 1
claude-opus-4-7
Anthropic
1548 ±6
17423
$5 / $25
1M
↓ 1
claude-opus-4-6
Anthropic
1547 ±6
21341
$5 / $25
1M
kimi-k3-max
Moonshot
1544 ±11
3176
N/A
新上榜
claude-opus-4-8-high
Anthropic
1533 ±7
11417
$5 / $25
1M
↑ 7
muse-spark-1.2 (xHigh)
Meta
1533 ±20
947
$1.25 / $4.25
N/A
↑ 2
claude-opus-5-high
Anthropic
1531 ±9
5433
$5 / $25
1M
10
↓ 1
muse-spark-1.1
Meta
1531 ±9
5002
$1.25 / $4.25
N/A
— 以下为 Top 10 外的国产模型 —
13
↓ 5
qwen3.8-max
Alibaba
1529 ±13
2146
$2 / $6
1M
17
qwen3.7-max-preview
Alibaba
1525 ±18
1120
$1.48 / $4.43
1M
25
↑ 3
mimo-v2.5-pro
Xiaomi
1520 ±7
13986
$0.44 / $0.87
1.05M
前端开发榜
前端开发榜头部格局稳定,claude-opus-5-max 以 1692 分蝉联第一,国产 kimi-k3-max 以 1674 分保持第二名位置,仅落后 18 分,依然对榜首形成紧逼。阿里 qwen3.8-max 上升 1 位至第三名,ELO 分数 1667 分,深度求索的 deepseek-v4-pro-high-20260813 作为新模型首次入榜即拿到第 10 名,ELO 分数 1584 分,表现不俗。
国产模型在前端开发榜占据多个头部和中上游位置,具体如下:
月之暗面 kimi-k3-max 位列第 2 名,ELO 1674 分,排名不变;
阿里 qwen3.8-max 位列第 3 名,ELO 1667 分,较上周上升 1 位;
智谱 glm-5.2-max 位列第 9 名,ELO 1585 分,较上周下降 2 位;
深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名,ELO 1584 分;
深度求索 deepseek-v4-flash-high 位列第 11 名,ELO 1581 分,排名下降 3 位。
claude-opus-5-max
Anthropic
1692 ±9
6448
$5 / $25
1M
kimi-k3-max
Moonshot
1674 ±11
4546
$3 / $15
1.05M
↑ 1
qwen3.8-max
Alibaba
1667 ±13
2855
$2 / $6
1M
↓ 1
claude-opus-5-high
Anthropic
1663 ±9
7334
$5 / $25
1M
新上榜
grok-4.6-high
SpaceXAI
1631 ±17
1513
$2 / $6
500K
↓ 1
claude-fable-5
Anthropic
1627 ±8
7867
$10 / $50
1M
↓ 1
gpt-5.6-sol-xhigh(codex-harness)
OpenAI
1622 ±8
8595
$5 / $30
1.05M
新上榜
gemini-3.7-flash-high
1587 ±13
2543
$0.75 / $3.57
1.05M
↓ 2
glm-5.2-max
Z.ai
1585 ±8
8142
$1.4 / $4.4
1M
10
新上榜
deepseek-v4-pro-high-20260813
DeepSeek
1584 ±14
2180
N/A
— 以下为 Top 10 外的国产模型 —
11
↓ 3
deepseek-v4-flash-high
DeepSeek
1581 ±12
2936
$0.44 / $1.32
1.05M
24
hy3
Tencent
1522 ±13
2284
$0.13 / $0.53
262.1K
25
↓ 4
seed-2.1-pro-preview
Bytedance
1522 ±8
7121
N/A
27
↓ 2
qwen3.7-max-20260517
Alibaba
1517 ±8
8373
$1.48 / $4.43
1M
29
↓ 3
glm-5.1
Z.ai
1510 ±7
8817
$1.4 / $4.4
202.8K
30
↓ 3
kimi-k2.6
Moonshot
1509 ±7
9589
$0.95 / $4
262.1K
AI 生图榜
AI 生图榜中,gpt-image-2 (medium) 以 1381 分继续稳坐榜首,微软新模型 mai-image-2.6-preview 首次入榜就拿到第二名,ELO 分数 1336 分,直接跻身头部梯队。国产 seedream-5.0-pro 守住第八名,ELO 分数 1258 分,qwen-image-3.0-pro 位列第九名,两者分数差距仅 1 分,在误差范围内并列。
gpt-image-2 (medium)
OpenAI
1381 ±5
70065
N/A
新上榜
mai-image-2.6-preview
Microsoft AI
1336 ±11
3488
N/A
↓ 1
grok-imagine-image-2.0 (low)
SpaceXAI
1316 ±12
2676
N/A
↓ 1
reve-2.1
Reve
1302 ±8
7588
N/A
↓ 1
muse-image
Meta
1282 ±7
15119
N/A
↓ 1
reve-2.0
Reve
1270 ±6
14641
N/A
↓ 1
gemini-3.1-flash-image(nano-banana-2) [web-search]
1264 ±5
29102
N/A
seedream-5.0-pro
Bytedance
1258 ±5
28830
N/A
↓ 2
qwen-image-3.0-pro
Alibaba
1257 ±9
4705
N/A
10
↓ 1
mai-image-2.5
Microsoft AI
1256 ±4
46329
N/A
— 以下为 Top 10 外的国产模型 —
17
↓ 1
qwen-image-2.0-pro-2026-06-22
Alibaba
1191 ±6
12021
N/A
30
↓ 1
hunyuan-image-3.0
Tencent
1151 ±3
173345
N/A
AI 视频榜
AI 视频榜头部迎来新变化,Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名,ELO 分数 1496 分,仅落后榜首 gemini-omni-flash 16 分。国产模型 dreamina-seedance-2.0-720p 保持第三名位置,ELO 分数 1478 分,minimax-h3 位列第五名,整体头部格局相对稳定。
gemini-omni-flash
1512 ±11
15930
N/A
新上榜
flux-3-video
Black Forest Labs
1496 ±17
1288
N/A
↓ 1
dreamina-seedance-2.0-720p
Bytedance
1478 ±9
48355
N/A
↓ 1
muse-video
Meta
1457 ±15
2176
N/A
↓ 1
minimax-h3
MiniMax
1453 ±14
2192
N/A
↓ 1
happyhorse-1.0
Alibaba-ATH
1428 ±13
22117
N/A
↓ 1
sora-2-pro
OpenAI
1366 ±7
45731
$0 / $0.3
N/A
↓ 1
veo-3.1-audio
1364 ±14
13743
$0 / $0.4
N/A
↓ 1
veo-3.1-audio-1080p
1363 ±10
24981
N/A
10
↓ 1
veo-3.1-fast-audio
1362 ±10
39441
$0 / $0.15
N/A
— 以下为 Top 10 外的国产模型 —
14
↓ 1
wan2.7-t2v
Alibaba
1343 ±8
16757
N/A
17
↓ 1
wan2.6-t2v
Alibaba
1333 ±8
43230
N/A
18
↓ 1
seedance-v1.5-pro
Bytedance
1256 ±7
76001
N/A
20
↓ 1
wan2.5-t2v-preview
Alibaba
1249 ±9
27361
N/A
29
↓ 1
hailuo-2.3
MiniMax
1203 ±6
74338
N/A
30
↓ 1
hailuo-02-pro
MiniMax
1198 ±12
9392
N/A
智能体榜
智能体榜中,Anthropic 模型继续垄断前三,Claude Opus 5 (High) 以 12.19% 的净提升度守住榜首位置。本次榜单有两款新模型进入前十,其中国产 Qwen3.8 Max 首次入榜即排名第 11 位,净提升度达到 7.61%,任务确认成功率 12.54%,工具幻觉率仅 0.11%,表现非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六,净提升度 9.78%。国产 Kimi K3 (Max) 稳定在第五名,净提升度 10.6%,任务确认成功率 15.55%,已经跻身全球智能体第一梯队。
国产模型在智能体榜已有多款进入中上游,具体如下:
月之暗面 Kimi K3 (Max) 位列第 5 名,净提升度 10.60%,任务确认成功率 15.55%,排名不变;
阿里 Qwen3.8 Max 新入榜位列第 11 名,净提升度 7.61%,任务确认成功率 12.54%;
智谱 GLM 5.2 (Max) 位列第 14 名,净提升度 6.74%,较上周下降 2 位;
深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名,净提升度 4.04%,较上周上升 2 位。
Claude Opus 5 (High)
Anthropic
12.19% ±1.45%
15.35% ±3.03%
19.26% ±5.29%
11.34% ±2.79%
Claude Fable 5 (High)
Anthropic
12.01% ±2.57%
10.66% ±4.9%
25.14% ±9.01%
8.84% ±5.23%
Claude Opus 5 (Max)
Anthropic
11.95% ±1.71%
17.96% ±3.18%
19.3% ±6.26%
6.95% ±3.43%
GPT 5.6 Sol (xHigh)
OpenAI
10.86% ±1.8%
10.12% ±3.69%
23.03% ±6.72%
9.23% ±3.74%
Kimi K3 (Max)
Moonshot
10.6% ±1.04%
15.55% ±2.06%
20.31% ±3.78%
7.8% ±1.91%
新上榜
Claude Opus 4.8 (High)
Anthropic
9.78% ±1.78%
9.45% ±3.1%
22.52% ±5.71%
8.44% ±3.33%
GPT 5.5 (xHigh)
OpenAI
8.9% ±1.03%
4.97% ±2.18%
14.61% ±3.62%
9.17% ±1.92%
新上榜
Claude Opus 4.7 (High)
Anthropic
8.17% ±1.43%
6.61% ±2.95%
12.32% ±4.81%
7.72% ±2.91%
↑ 2
GPT 5.5 (High)
OpenAI
7.73% ±0.97%
4.03% ±2.04%
11.62% ±3.39%
8.59% ±1.79%
10
Claude Opus 4.7
Anthropic
7.66% ±1.45%
5.45% ±3.08%
11.57% ±4.71%
9.95% ±2.87%
— 以下为 Top 10 外的国产模型 —
11
新上榜
Qwen3.8 Max
Alibaba
7.61% ±1.6%
12.54% ±3.32%
11.64% ±5.58%
5.34% ±3.09%
14
↓ 2
GLM 5.2 (Max)
Z.ai
6.74% ±0.9%
8.39% ±1.91%
11.6% ±3.18%
6.14% ±1.58%
19
↑ 2
Deepseek V4 Flash (High)(20260731)
DeepSeek
4.04% ±0.81%
8.7% ±1.93%
2.46% ±2.71%
3.34% ±1.57%
25
↓ 2
Kimi K2.7 Code
Moonshot
1.08% ±2.15%
4.43% ±4.55%
2.74% ±7.27%
1.76% ±4.86%
26
↓ 2
GLM 5.1
Z.ai
0.58% ±0.82%
1.75% ±1.82%
0.84% ±2.56%
1.73% ±1.48%
27
↓ 2
Qwen3.7 Max
Alibaba
0.2% ±0.87%
0.34% ±2.13%
4.24% ±2.67%
0.03% ±1.52%
28
↓ 2
DeepSeek V4 Pro
DeepSeek
0.14% ±0.88%
2.16% ±2.21%
2.5% ±2.82%
0.59% ±1.63%
本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名,前端开发榜更是稳居第二,qwen3.8-max 在智能体榜首秀即进入 Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代,值得持续关注其排名表现。