IT之家 8 月 24 日消息,Arena(arena.ai)平台发布 2026 年第 34 周(8 月 17 日 ~8 月 23 日)AI 大模型盲测排名,本期智谱新发布的 glm-5.3-max 首次入榜即闯入综合榜 Top 15,位列第 13 名,ELO 得分 1487 分;月之暗面 kimi-k3-max 从第 12 名升至第 10 名,首次杀入综合榜前十。此外,本周还有多个国产模型在各细分榜单中取得亮眼表现,新模型入榜数量较多,整体竞争格局进一步变化。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

综合榜头部格局保持稳定,claude-fable-5 以 1508 分蝉联第一,claude-opus-4-6-high 和 claude-opus-4-7-high 分别以 1504 分、 1502 分位列二、三名,三者分差均在 30 分以内,在误差范围内视为接近。

本周最大变化是新入榜的 glm-5.3-max 直接来到第 13 名,表现突出; kimi-k3-max 上升 2 位来到第 10 名,首次进入前十; muse-spark-1.1 上升 3 位至第 8 名。同时本周有 gpt-5.5-instant 、 claude-opus-4-8 两款新模型入榜,分别位列第 28、 29 名。qwen3.8-max 排名有所下滑,从第 8 名降至第 19 名。

国产模型在中上游占据多个席位,整体表现稳定:

月之暗面 kimi-k3-max 位列第 10 名,ELO 1489 分,较上周上升 2 位;

智谱 glm-5.3-max 位列第 13 名,ELO 1487 分,首次入榜;

阿里 qwen3.8-max 位列第 19 名,ELO 1481 分,较上周下降 11 位;

阿里 qwen3.7-max-preview 位列第 27 名,ELO 1474 分,排名基本持平。

claude-fable-5

Anthropic

1508 ±5

24331

$10 / $50

1M

claude-opus-4-6-high

Anthropic

1504 ±4

72359

$5 / $25

1M

claude-opus-4-7-high

Anthropic

1502 ±4

60203

$5 / $25

1M

muse-spark-1.2 (xHigh)

Meta

1498 ±10

3257

$1.25 / $4.25

N/A

claude-opus-4-6

Anthropic

1497 ±3

76362

$5 / $25

1M

claude-opus-4-7

Anthropic

1494 ±4

61304

$5 / $25

1M

claude-opus-5-high

Anthropic

1493 ±5

27610

$5 / $25

1M

↑ 3

muse-spark-1.1

Meta

1491 ±5

20242

$1.25 / $4.25

N/A

gemini-3.7-flash-high

Google

1490 ±8

5718

$0.75 / $3.57

1.05M

10

↑ 2

kimi-k3-max

Moonshot

1489 ±6

15054

N/A

— 以下为 Top 10 外的国产模型 —

13

新上榜

glm-5.3-max

Z.ai

1487 ±10

3751

$1.4 / $4.4

1.05M

19

↓ 11

qwen3.8-max

Alibaba

1481 ±7

9955

$2 / $6

1M

27

↓ 1

qwen3.7-max-preview

Alibaba

1474 ±10

3712

$1.48 / $4.43

1M

代码榜

代码榜头部发生微调,claude-opus-4-7-high 升至榜首,ELO 1552 分,claude-opus-4-6-high 位列第二,原本榜首的 claude-fable-5 降至第三,三者 ELO 分差仅为 1 分,在误差范围内属于并列水平。智谱 glm-5.3-max 首次入榜即杀入前十,位列第 10 名,ELO 1531 分,首秀表现亮眼。grok-4.20-beta1 新入榜位列第 20 名; claude-sonnet-4-5-20250929-high-32k 、 gpt-5.5-high 两款新模型也完成首次排名。qwen3.8-max 排名下滑明显,从第 13 名降至第 25 名。

国产模型在代码榜中已有多款进入前三十,具体排名如下:

月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名基本持平;

智谱 glm-5.3-max 位列第 10 名,ELO 1531 分,首次入榜;

阿里 qwen3.7-max-preview 位列第 17 名,ELO 1524 分,排名基本持平;

阿里 qwen3.8-max 位列第 25 名,ELO 1520 分,较上周下降 12 位;

小米 mimo-v2.5-pro 位列第 27 名,ELO 1519 分,排名基本持平。

↑ 1

claude-opus-4-7-high

Anthropic

1552 ±6

17212

$5 / $25

1M

↑ 1

claude-opus-4-6-high

Anthropic

1551 ±6

18844

$5 / $25

1M

↓ 2

claude-fable-5

Anthropic

1551 ±8

6552

$10 / $50

1M

claude-opus-4-7

Anthropic

1547 ±6

17362

$5 / $25

1M

claude-opus-4-6

Anthropic

1546 ±5

21288

$5 / $25

1M

kimi-k3-max

Moonshot

1542 ±10

3966

N/A

↑ 2

claude-opus-5-high

Anthropic

1533 ±8

7416

$5 / $25

1M

↓ 1

claude-opus-4-8-high

Anthropic

1533 ±7

12425

$5 / $25

1M

↓ 1

muse-spark-1.2 (xHigh)

Meta

1531 ±20

939

$1.25 / $4.25

N/A

10

新上榜

glm-5.3-max

Z.ai

1531 ±19

994

$1.4 / $4.4

1.05M

— 以下为 Top 10 外的国产模型 —

17

qwen3.7-max-preview

Alibaba

1524 ±18

1119

$1.48 / $4.43

1M

25

↓ 12

qwen3.8-max

Alibaba

1520 ±11

2970

$2 / $6

1M

27

↓ 2

mimo-v2.5-pro

Xiaomi

1519 ±6

14938

$0.44 / $0.87

1.05M

前端开发榜

前端开发榜头部依旧稳定,claude-opus-5-max 以 1691 分蝉联第一,国产 kimi-k3-max 和 qwen3.8-max 稳定占据二、三名,ELO 分别为 1674 分和 1669 分,与榜首分差在 30 分以内,误差范围内视为接近。新入榜的 glm-5.3-max 直接来到第 8 名,qwen3.8-27b 首次入榜位列第 9 名,两款国产新模型均进入前十,表现突出。目前已有多款国产模型进入前十五,在前端开发领域竞争力显著。

claude-opus-5-max

Anthropic

1691 ±9

8116

$5 / $25

1M

kimi-k3-max

Moonshot

1674 ±11

4546

$3 / $15

1.05M

qwen3.8-max

Alibaba

1669 ±13

3212

$2 / $6

1M

claude-opus-5-high

Anthropic

1663 ±8

8659

$5 / $25

1M

grok-4.6-high

SpaceXAI

1629 ±17

1523

$2 / $6

500K

claude-fable-5

Anthropic

1626 ±8

8382

$10 / $50

1M

gpt-5.6-sol-xhigh(codex-harness)

OpenAI

1619 ±8

9499

$5 / $30

1.05M

新上榜

glm-5.3-max

Z.ai

1599 ±15

1916

$1.4 / $4.4

1.05M

新上榜

qwen3.8-27b

Alibaba

1595 ±13

2464

$0.5 / $3

N/A

10

↓ 2

gemini-3.7-flash-high

Google

1587 ±13

2552

$0.75 / $3.57

1.05M

— 以下为 Top 10 外的国产模型 —

11

↓ 2

glm-5.2-max

Z.ai

1582 ±8

8775

$1.4 / $4.4

1M

12

↓ 2

deepseek-v4-pro-high-20260813

DeepSeek

1582 ±12

2869

$1.32 / $3.96

N/A

13

↓ 2

deepseek-v4-flash-high

DeepSeek

1579 ±11

3537

$0.44 / $1.32

1.05M

26

↓ 1

seed-2.1-pro-preview

Bytedance

1521 ±8

7679

N/A

28

↓ 4

hy3

Tencent

1518 ±12

2680

$0.13 / $0.53

262.1K

AI 生图榜

AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1381 分继续领跑,国产 seedream-5.0-pro 稳定保持第 8 名,qwen-image-3.0-pro 位列第 9 名,两款国产模型均进入前十,整体排名没有大幅波动。hunyuan-image-3.0 本周升至第 29 名,保持在前三十行列。

gpt-image-2 (medium)

OpenAI

1381 ±5

70065

$8 / $30

N/A

mai-image-2.6-preview

Microsoft AI

1336 ±11

3488

N/A

grok-imagine-image-2.0 (low)

SpaceXAI

1316 ±12

2676

N/A

reve-2.1

Reve

1302 ±8

7588

N/A

muse-image

Meta

1282 ±7

15119

N/A

reve-2.0

Reve

1270 ±6

14641

N/A

gemini-3.1-flash-image(nano-banana-2) [web-search]

Google

1264 ±5

29102

N/A

seedream-5.0-pro

Bytedance

1258 ±5

28830

N/A

qwen-image-3.0-pro

Alibaba

1257 ±9

4705

N/A

10

mai-image-2.5

Microsoft AI

1256 ±4

46329

N/A

— 以下为 Top 10 外的国产模型 —

16

↑ 1

qwen-image-2.0-pro-2026-06-22

Alibaba

1191 ±6

12021

N/A

29

↑ 1

hunyuan-image-3.0

Tencent

1151 ±3

173345

N/A

AI 视频榜

AI 视频榜中,字节跳动新发布的 dreamina-seedance-2.5-720p 首次入榜即来到第 4 名,ELO 1477 分,紧随其前代产品 dreamina-seedance-2.0-720p 之后,两款国产模型均进入前五,表现亮眼。gemini-omni-flash 继续以 1512 分排名第一,flux-3-video 位列第二,dreamina-seedance-2.0-720p 保持第三。

gemini-omni-flash

Google

1512 ±11

16916

N/A

flux-3-video

Black Forest Labs

1494 ±17

1291

N/A

dreamina-seedance-2.0-720p

Bytedance

1482 ±10

49058

N/A

新上榜

dreamina-seedance-2.5-720p

Bytedance

1477 ±19

1337

N/A

↓ 1

muse-video

Meta

1457 ±15

2176

N/A

↓ 1

minimax-h3

MiniMax

1453 ±13

3081

N/A

↓ 1

happyhorse-1.0

Alibaba-ATH

1428 ±13

22113

N/A

↓ 1

sora-2-pro

OpenAI

1364 ±7

46509

$0 / $0.3

N/A

↓ 1

veo-3.1-audio

Google

1364 ±14

13743

$0 / $0.4

N/A

10

↓ 1

veo-3.1-audio-1080p

Google

1363 ±10

24979

N/A

— 以下为 Top 10 外的国产模型 —

15

↓ 1

wan2.7-t2v

Alibaba

1344 ±9

17769

N/A

18

↓ 1

wan2.6-t2v

Alibaba

1330 ±8

44304

N/A

19

↓ 1

seedance-v1.5-pro

Bytedance

1256 ±7

75990

N/A

21

↓ 1

wan2.5-t2v-preview

Alibaba

1249 ±9

28239

N/A

智能体榜

智能体榜头部依旧由 Anthropic 模型占据,Claude Opus 5 (High) 以 12.47% 的净提升度保持第一,Claude Opus 5 (Max) 上升一位至第二,Claude Fable 5 (High) 降至第三,三者净提升度差距小于置信区间,在误差范围内视为接近。月之暗面 Kimi K3 (Max) 上升一位至第四,净提升度 10.41%,任务确认成功率达到 17.97%,整体表现已经进入头部梯队。本周 DeepSeek V4 Pro (High) (0813) 和 Qwen3.8 Max 两款国产模型新入榜,分别位列第 14 和第 15 名,表现不俗。

国产模型在智能体榜已有多款进入前三十,头部已经摸到第一梯队门槛:

月之暗面 Kimi K3 (Max) 排名第 4,净提升度 10.41%,任务确认成功率 17.97%,较上周上升 1 位;

深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14,净提升度 6.26%,任务确认成功率 13.06%,首次入榜;

阿里 Qwen3.8 Max 排名第 15,净提升度 6.20%,工具幻觉率仅 0.18%,首次入榜;

智谱 GLM 5.2 (Max) 排名第 17,净提升度 5.82%,较上周下降 3 位;

深度求索 Deepseek V4 Flash (High) (20260731) 排名第 20,净提升度 3.99%。

Claude Opus 5 (High)

Anthropic

12.47% ±1.54%

15.41% ±3.16%

20.52% ±5.59%

11.15% ±2.98%

↑ 1

Claude Opus 5 (Max)

Anthropic

12% ±1.8%

18.52% ±3.24%

19.13% ±6.56%

6.65% ±3.66%

↓ 1

Claude Fable 5 (High)

Anthropic

11.57% ±1.7%

12.44% ±3.24%

21.37% ±5.95%

8.99% ±3.55%

↑ 1

Kimi K3 (Max)

Moonshot

10.41% ±0.62%

17.97% ±1.23%

18.31% ±2.23%

5.96% ±1.13%

↓ 1

GPT 5.6 Sol (xHigh)

OpenAI

9.74% ±1.39%

10% ±2.87%

22.2% ±5.11%

5.77% ±2.88%

Claude Opus 4.8 (High)

Anthropic

9.55% ±1.51%

8.26% ±2.7%

21.65% ±4.97%

9.01% ±2.86%

GPT 5.5 (xHigh)

OpenAI

8.51% ±0.93%

4.42% ±1.96%

13.46% ±3.23%

8.86% ±1.76%

Claude Opus 4.7 (High)

Anthropic

8.12% ±1.24%

5.62% ±2.53%

12.36% ±4.17%

8.44% ±2.47%

GPT 5.5 (High)

OpenAI

7.74% ±0.84%

4.09% ±1.74%

11.26% ±2.94%

9.12% ±1.56%

10

Claude Opus 4.7

Anthropic

7.4% ±1.25%

4.99% ±2.59%

11.51% ±4.09%

9.32% ±2.45%

— 以下为 Top 10 外的国产模型 —

14

新上榜

DeepSeek V4 Pro (High) (0813)

DeepSeek

6.26% ±1.28%

13.06% ±2.65%

3.82% ±4.37%

2.35% ±2.83%

15

新上榜

Qwen3.8 Max

Alibaba

6.2% ±1.36%

11.62% ±3.03%

6.81% ±4.79%

4% ±2.67%

17

↓ 3

GLM 5.2 (Max)

Z.ai

5.82% ±0.87%

7.24% ±1.87%

9.42% ±2.99%

5.22% ±1.53%

20

↓ 1

Deepseek V4 Flash (High)(20260731)

DeepSeek

3.99% ±0.79%

8.09% ±1.89%

2.15% ±2.64%

3.45% ±1.5%

27

↓ 2

Kimi K2.7 Code

Moonshot

0.43% ±2.07%

3.72% ±4.42%

1.53% ±6.94%

2.59% ±4.69%

28

DeepSeek V4 Pro

DeepSeek

0.05% ±0.88%

2.66% ±2.21%

2.39% ±2.82%

0.15% ±1.66%

29

↓ 3

GLM 5.1

Z.ai

0% ±0.75%

0.93% ±1.69%

0.28% ±2.27%

0.97% ±1.4%

本周 Arena 榜单迎来多款国产新模型亮相,智谱 glm-5.3-max 在综合榜、代码榜、前端开发榜均取得出色排名,月之暗面 kimi-k3-max 首次杀入综合榜前十,智能体榜也进入前四,字节跳动新模型 dreamina-seedance-2.5-720p 在 AI 视频榜直接进入前五,国产模型整体在多个维度继续突破。接下来随着更多国产大模型新版本发布,预计排名竞争将进一步加剧,值得后续关注。