IT之家 8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。

国产模型在综合榜已有多款进入中上游,具体排名如下:

阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;

月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;

阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。

claude-fable-5

Anthropic

1507 ±6

19390

$10 / $50

1M

claude-opus-4-6-thinking

Anthropic

1505 ±4

69336

$2.5 / $12.5

1M

claude-opus-4-7-thinking

Anthropic

1502 ±4

57018

$5 / $25

1M

新上榜

muse-spark-1.2 (xHigh)

Meta

1498 ±13

2057

$1.25 / $4.25

N/A

↓ 1

claude-opus-4-6

Anthropic

1497 ±3

73158

$2.5 / $12.5

1M

新上榜

qwen3.8-max

Alibaba

1497 ±9

4662

$2 / $6

1M

↓ 2

claude-opus-4-7

Anthropic

1493 ±4

58135

$5 / $25

1M

↓ 2

claude-opus-5-high

Anthropic

1493 ±6

14902

$5 / $25

1M

↓ 2

claude-opus-5-max

Anthropic

1488 ±8

7137

$5 / $25

1M

10

↓ 1

muse-spark

Meta

1488 ±6

13476

N/A

— 以下为 Top 10 外的国产模型 —

14

↓ 2

kimi-k3-max

Moonshot

1485 ±7

9861

N/A

23

↓ 2

qwen3.7-max-preview

Alibaba

1475 ±10

3695

$1.48 / $4.43

1M

代码榜

代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。

国产模型在代码榜已有多款进入前 30,具体如下:

月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;

阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;

阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;

小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;

智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。

claude-fable-5

Anthropic

1553 ±9

5234

$10 / $50

1M

claude-opus-4-7-thinking

Anthropic

1552 ±6

16303

$5 / $25

1M

claude-opus-4-6-thinking

Anthropic

1551 ±6

18015

$2.5 / $12.5

1M

claude-opus-4-6

Anthropic

1547 ±6

20444

$2.5 / $12.5

1M

claude-opus-4-7

Anthropic

1546 ±6

16534

$5 / $25

1M

↑ 2

kimi-k3-max

Moonshot

1542 ±12

2611

N/A

↓ 1

claude-opus-4-8-thinking

Anthropic

1535 ±7

10509

$2.5 / $12.5

1M

新上榜

qwen3.8-max

Alibaba

1532 ±16

1411

$2 / $6

1M

↑ 1

muse-spark-1.1

Meta

1532 ±10

4199

$1.25 / $4.25

N/A

10

↓ 1

claude-opus-4-5-20251101-thinking-32k

Anthropic

1530 ±7

7603

$5 / $25

200K

— 以下为 Top 10 外的国产模型 —

17

↓ 1

qwen3.7-max-preview

Alibaba

1526 ±18

1112

$1.48 / $4.43

1M

28

mimo-v2.5-pro

Xiaomi

1519 ±7

13199

$0.44 / $0.87

1.05M

30

↓ 3

glm-5.1

Z.ai

1517 ±7

10330

$1.4 / $4.4

202.8K

前端开发榜

本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。

国产模型具体排名如下:

月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;

阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;

智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;

深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。

claude-opus-5-max

Anthropic

1686 ±11

4029

$5 / $25

1M

kimi-k3-max

Moonshot

1675 ±12

4372

$3 / $15

1.05M

claude-opus-5-high

Anthropic

1670 ±10

5145

$5 / $25

1M

新上榜

qwen3.8-max

Alibaba

1667 ±16

1980

$2 / $6

1M

↓ 1

claude-fable-5

Anthropic

1630 ±9

6816

$10 / $50

1M

↓ 1

gpt-5.6-sol-xhigh(codex-harness)

OpenAI

1620 ±9

6903

$5 / $30

1.05M

↓ 1

glm-5.2-max

Z.ai

1588 ±9

6924

$1.4 / $4.4

1M

新上榜

deepseek-v4-flash-high

DeepSeek

1581 ±15

1931

$0.14 / $0.28

1.05M

↓ 1

claude-opus-4-8-thinking

Anthropic

1565 ±8

9549

$2.5 / $12.5

1M

10

↓ 1

claude-opus-4-7

Anthropic

1560 ±7

12398

$5 / $25

1M

— 以下为 Top 10 外的国产模型 —

21

↓ 3

seed-2.1-pro-preview

Bytedance

1524 ±9

6069

N/A

24

↓ 1

hy3

Tencent

1522 ±15

1729

$0.13 / $0.53

262.1K

25

↓ 3

qwen3.7-max-20260517

Alibaba

1516 ±8

8044

$1.48 / $4.43

1M

26

↓ 2

glm-5.1

Z.ai

1515 ±8

7853

$1.4 / $4.4

202.8K

27

↓ 2

kimi-k2.6

Moonshot

1510 ±8

9261

$0.95 / $4

262.1K

智能体榜

智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。

国产模型在智能体榜已有多款进入前 30,具体如下:

月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;

智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;

深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;

智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。

↑ 2

Claude Opus 5 (High)

Anthropic

11.99% ±1.37%

16.04% ±2.79%

19.46% ±5.19%

10.29% ±2.51%

↓ 1

Claude Fable 5 (High)

Anthropic

11.66% ±2.39%

11.47% ±4.46%

22.56% ±8.25%

10.01% ±4.93%

↓ 1

Claude Opus 5 (Max)

Anthropic

11.19% ±1.62%

16.36% ±3.11%

19.07% ±6.03%

5.8% ±3.1%

GPT 5.6 Sol (xHigh)

OpenAI

10.28% ±1.72%

9.06% ±3.48%

22.7% ±6.42%

8.42% ±3.5%

Kimi K3 (Max)

Moonshot

10.08% ±1.07%

14.97% ±2.09%

19.68% ±3.85%

7.45% ±1.97%

Claude Opus 4.8 (Thinking)

Anthropic

9.35% ±1.7%

8.81% ±2.9%

21.46% ±5.38%

8.5% ±3.08%

↑ 1

GPT 5.5 (xHigh)

OpenAI

8.45% ±0.99%

5.24% ±2.08%

13.56% ±3.55%

8.19% ±1.8%

↑ 1

Claude Opus 4.7 (Thinking)

Anthropic

8.33% ±1.32%

6.65% ±2.76%

11.87% ±4.59%

8.61% ±2.72%

↓ 2

Claude Sonnet 5 (High)

Anthropic

7.46% ±2.15%

5.56% ±4.29%

14.8% ±7.65%

5.14% ±4.55%

10

↑ 1

Claude Opus 4.7

Anthropic

7.32% ±1.36%

5.55% ±2.85%

10.72% ±4.45%

9.54% ±2.7%

— 以下为 Top 10 外的国产模型 —

12

GLM 5.2 (Max)

Z.ai

6.75% ±0.9%

9.21% ±1.83%

12.39% ±3.21%

5.62% ±1.59%

21

新上榜

Deepseek V4 Flash (High)(20260731)

DeepSeek

2.84% ±1.1%

8.53% ±2.54%

0.46% ±3.64%

0.43% ±2.19%

23

Kimi K2.7 Code

Moonshot

0.69% ±1.94%

4.12% ±4.08%

2.36% ±6.68%

1.92% ±4.37%

24

↓ 2

GLM 5.1

Z.ai

0.35% ±0.77%

1.06% ±1.72%

0.72% ±2.5%

0.76% ±1.4%

25

Qwen3.7 Max

Alibaba

0.16% ±0.88%

0.24% ±2.11%

5.07% ±2.72%

0.21% ±1.55%

26

DeepSeek V4 Pro

DeepSeek

0.33% ±0.86%

2.74% ±2.16%

3.35% ±2.78%

0.3% ±1.54%

27

↑ 2

Kimi K2.6

Moonshot

0.48% ±2.16%

2.28% ±4.11%

2.12% ±6.8%

1.66% ±4.49%

30

↓ 3

Hy3

Tencent

1.12% ±1.42%

2.2% ±3.04%

3.7% ±4.91%

9.01% ±2.6%

AI 生图榜

本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。

gpt-image-2 (medium)

OpenAI

1380 ±5

69194

N/A

新上榜

grok-imagine-image-2.0 (low)

SpaceXAI

1320 ±12

2722

N/A

↓ 1

reve-2.1

Reve

1302 ±8

7598

N/A

↓ 1

muse-image

Meta

1283 ±7

14510

N/A

↓ 1

reve-2.0

Reve

1270 ±6

14650

N/A

↓ 1

gemini-3.1-flash-image(nano-banana-2) [web-search]

Google

1263 ±5

27910

N/A

新上榜

qwen-image-3.0-pro

Alibaba

1258 ±10

3735

N/A

↓ 2

seedream-5.0-pro

Bytedance

1257 ±5

26510

N/A

↓ 2

mai-image-2.5

Microsoft AI

1256 ±5

44940

N/A

10

↓ 2

gemini-3.1-flash-lite-image(nano-banana-2-lite)

Google

1251 ±6

16419

N/A

— 以下为 Top 10 外的国产模型 —

16

↓ 2

qwen-image-2.0-pro-2026-06-22

Alibaba

1191 ±6

12026

N/A

29

↓ 4

hunyuan-image-3.0

Tencent

1151 ±3

173366

N/A

AI 视频榜

AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。

gemini-omni-flash

Google

1513 ±12

14571

N/A

dreamina-seedance-2.0-720p

Bytedance

1479 ±11

47067

N/A

muse-video

Meta

1458 ±15

2160

N/A

新上榜

minimax-h3

MiniMax

1455 ±19

1060

N/A

↓ 1

happyhorse-1.0

Alibaba-ATH

1428 ±13

21979

N/A

↓ 1

sora-2-pro

OpenAI

1365 ±8

44543

$0 / $0.3

N/A

veo-3.1-audio

Google

1364 ±14

13687

$0 / $0.4

N/A

↓ 2

veo-3.1-audio-1080p

Google

1363 ±10

24846

N/A

↓ 1

veo-3.1-fast-audio

Google

1362 ±11

39301

$0 / $0.15

N/A

10

↓ 1

veo-3.1-fast-audio-1080p

Google

1358 ±10

25637

N/A

— 以下为 Top 10 外的国产模型 —

13

↓ 2

wan2.7-t2v

Alibaba

1347 ±9

15246

N/A

16

↓ 1

wan2.6-t2v

Alibaba

1330 ±9

41706

N/A

17

↓ 1

seedance-v1.5-pro

Bytedance

1256 ±7

75653

N/A

19

↓ 2

wan2.5-t2v-preview

Alibaba

1252 ±10

25895

N/A

28

↓ 1

hailuo-2.3

MiniMax

1202 ±7

72127

N/A

29

↓ 1

hailuo-02-pro

MiniMax

1198 ±13

9365

N/A

30

↓ 1

seedance-v1-pro

Bytedance

1190 ±11

12117

N/A

本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。