IT之家 8 月 17 日消息,Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。

谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。

国产模型整体处于榜单中上游,具体排名如下:

月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;

阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;

阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。

claude-fable-5

Anthropic

1506 ±5

21533

$10 / $50

1M

新上榜

claude-opus-4-6-high

Anthropic

1505 ±4

72516

$5 / $25

1M

新上榜

claude-opus-4-7-high

Anthropic

1502 ±4

60331

$5 / $25

1M

muse-spark-1.2 (xHigh)

Meta

1498 ±10

3280

$1.25 / $4.25

N/A

claude-opus-4-6

Anthropic

1497 ±3

76474

$5 / $25

1M

↑ 1

claude-opus-4-7

Anthropic

1494 ±4

61419

$5 / $25

1M

↑ 1

claude-opus-5-high

Anthropic

1493 ±5

20030

$5 / $25

1M

↓ 2

qwen3.8-max

Alibaba

1491 ±8

7004

$2 / $6

1M

新上榜

gemini-3.7-flash-high

Google

1490 ±8

5744

$0.75 / $3.57

1.05M

10

↓ 1

claude-opus-5-max

Anthropic

1489 ±7

9679

$5 / $25

1M

— 以下为 Top 10 外的国产模型 —

12

↑ 2

kimi-k3-max

Moonshot

1489 ±6

11969

N/A

26

↓ 3

qwen3.7-max-preview

Alibaba

1474 ±10

3717

$1.48 / $4.43

1M

代码榜

代码榜格局同样由 Anthropic 新模型主导,claude-fable-5 以 1554 分守住榜首位置,新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分别以 1552 分、 1551 分占据第二、第三名,分数差距极小,误差范围内视为并列。kimi-k3-max 稳定在第六名,ELO 分数上涨 2 分,依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名,是本周涨幅最大的头部模型。

国产模型在代码榜占据多个中上游席位,具体排名如下:

月之暗面 kimi-k3-max 排名最高,位列第 6 名,ELO 1544 分,排名不变;

阿里 qwen3.8-max 位列第 13 名,ELO 1529 分,较上周下降 5 位;

阿里 qwen3.7-max-preview 位列第 17 名,ELO 1525 分,排名不变;

小米 mimo-v2.5-pro 位列第 25 名,ELO 1520 分,较上周上升 3 位。

claude-fable-5

Anthropic

1554 ±9

5817

$10 / $50

1M

新上榜

claude-opus-4-7-high

Anthropic

1552 ±6

17272

$5 / $25

1M

新上榜

claude-opus-4-6-high

Anthropic

1551 ±6

18894

$5 / $25

1M

↑ 1

claude-opus-4-7

Anthropic

1548 ±6

17423

$5 / $25

1M

↓ 1

claude-opus-4-6

Anthropic

1547 ±6

21341

$5 / $25

1M

kimi-k3-max

Moonshot

1544 ±11

3176

N/A

新上榜

claude-opus-4-8-high

Anthropic

1533 ±7

11417

$5 / $25

1M

↑ 7

muse-spark-1.2 (xHigh)

Meta

1533 ±20

947

$1.25 / $4.25

N/A

↑ 2

claude-opus-5-high

Anthropic

1531 ±9

5433

$5 / $25

1M

10

↓ 1

muse-spark-1.1

Meta

1531 ±9

5002

$1.25 / $4.25

N/A

— 以下为 Top 10 外的国产模型 —

13

↓ 5

qwen3.8-max

Alibaba

1529 ±13

2146

$2 / $6

1M

17

qwen3.7-max-preview

Alibaba

1525 ±18

1120

$1.48 / $4.43

1M

25

↑ 3

mimo-v2.5-pro

Xiaomi

1520 ±7

13986

$0.44 / $0.87

1.05M

前端开发榜

前端开发榜头部格局稳定,claude-opus-5-max 以 1692 分蝉联第一,国产 kimi-k3-max 以 1674 分保持第二名位置,仅落后 18 分,依然对榜首形成紧逼。阿里 qwen3.8-max 上升 1 位至第三名,ELO 分数 1667 分,深度求索的 deepseek-v4-pro-high-20260813 作为新模型首次入榜即拿到第 10 名,ELO 分数 1584 分,表现不俗。

国产模型在前端开发榜占据多个头部和中上游位置,具体如下:

月之暗面 kimi-k3-max 位列第 2 名,ELO 1674 分,排名不变;

阿里 qwen3.8-max 位列第 3 名,ELO 1667 分,较上周上升 1 位;

智谱 glm-5.2-max 位列第 9 名,ELO 1585 分,较上周下降 2 位;

深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名,ELO 1584 分;

深度求索 deepseek-v4-flash-high 位列第 11 名,ELO 1581 分,排名下降 3 位。

claude-opus-5-max

Anthropic

1692 ±9

6448

$5 / $25

1M

kimi-k3-max

Moonshot

1674 ±11

4546

$3 / $15

1.05M

↑ 1

qwen3.8-max

Alibaba

1667 ±13

2855

$2 / $6

1M

↓ 1

claude-opus-5-high

Anthropic

1663 ±9

7334

$5 / $25

1M

新上榜

grok-4.6-high

SpaceXAI

1631 ±17

1513

$2 / $6

500K

↓ 1

claude-fable-5

Anthropic

1627 ±8

7867

$10 / $50

1M

↓ 1

gpt-5.6-sol-xhigh(codex-harness)

OpenAI

1622 ±8

8595

$5 / $30

1.05M

新上榜

gemini-3.7-flash-high

Google

1587 ±13

2543

$0.75 / $3.57

1.05M

↓ 2

glm-5.2-max

Z.ai

1585 ±8

8142

$1.4 / $4.4

1M

10

新上榜

deepseek-v4-pro-high-20260813

DeepSeek

1584 ±14

2180

N/A

— 以下为 Top 10 外的国产模型 —

11

↓ 3

deepseek-v4-flash-high

DeepSeek

1581 ±12

2936

$0.44 / $1.32

1.05M

24

hy3

Tencent

1522 ±13

2284

$0.13 / $0.53

262.1K

25

↓ 4

seed-2.1-pro-preview

Bytedance

1522 ±8

7121

N/A

27

↓ 2

qwen3.7-max-20260517

Alibaba

1517 ±8

8373

$1.48 / $4.43

1M

29

↓ 3

glm-5.1

Z.ai

1510 ±7

8817

$1.4 / $4.4

202.8K

30

↓ 3

kimi-k2.6

Moonshot

1509 ±7

9589

$0.95 / $4

262.1K

AI 生图榜

AI 生图榜中,gpt-image-2 (medium) 以 1381 分继续稳坐榜首,微软新模型 mai-image-2.6-preview 首次入榜就拿到第二名,ELO 分数 1336 分,直接跻身头部梯队。国产 seedream-5.0-pro 守住第八名,ELO 分数 1258 分,qwen-image-3.0-pro 位列第九名,两者分数差距仅 1 分,在误差范围内并列。

gpt-image-2 (medium)

OpenAI

1381 ±5

70065

N/A

新上榜

mai-image-2.6-preview

Microsoft AI

1336 ±11

3488

N/A

↓ 1

grok-imagine-image-2.0 (low)

SpaceXAI

1316 ±12

2676

N/A

↓ 1

reve-2.1

Reve

1302 ±8

7588

N/A

↓ 1

muse-image

Meta

1282 ±7

15119

N/A

↓ 1

reve-2.0

Reve

1270 ±6

14641

N/A

↓ 1

gemini-3.1-flash-image(nano-banana-2) [web-search]

Google

1264 ±5

29102

N/A

seedream-5.0-pro

Bytedance

1258 ±5

28830

N/A

↓ 2

qwen-image-3.0-pro

Alibaba

1257 ±9

4705

N/A

10

↓ 1

mai-image-2.5

Microsoft AI

1256 ±4

46329

N/A

— 以下为 Top 10 外的国产模型 —

17

↓ 1

qwen-image-2.0-pro-2026-06-22

Alibaba

1191 ±6

12021

N/A

30

↓ 1

hunyuan-image-3.0

Tencent

1151 ±3

173345

N/A

AI 视频榜

AI 视频榜头部迎来新变化,Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名,ELO 分数 1496 分,仅落后榜首 gemini-omni-flash 16 分。国产模型 dreamina-seedance-2.0-720p 保持第三名位置,ELO 分数 1478 分,minimax-h3 位列第五名,整体头部格局相对稳定。

gemini-omni-flash

Google

1512 ±11

15930

N/A

新上榜

flux-3-video

Black Forest Labs

1496 ±17

1288

N/A

↓ 1

dreamina-seedance-2.0-720p

Bytedance

1478 ±9

48355

N/A

↓ 1

muse-video

Meta

1457 ±15

2176

N/A

↓ 1

minimax-h3

MiniMax

1453 ±14

2192

N/A

↓ 1

happyhorse-1.0

Alibaba-ATH

1428 ±13

22117

N/A

↓ 1

sora-2-pro

OpenAI

1366 ±7

45731

$0 / $0.3

N/A

↓ 1

veo-3.1-audio

Google

1364 ±14

13743

$0 / $0.4

N/A

↓ 1

veo-3.1-audio-1080p

Google

1363 ±10

24981

N/A

10

↓ 1

veo-3.1-fast-audio

Google

1362 ±10

39441

$0 / $0.15

N/A

— 以下为 Top 10 外的国产模型 —

14

↓ 1

wan2.7-t2v

Alibaba

1343 ±8

16757

N/A

17

↓ 1

wan2.6-t2v

Alibaba

1333 ±8

43230

N/A

18

↓ 1

seedance-v1.5-pro

Bytedance

1256 ±7

76001

N/A

20

↓ 1

wan2.5-t2v-preview

Alibaba

1249 ±9

27361

N/A

29

↓ 1

hailuo-2.3

MiniMax

1203 ±6

74338

N/A

30

↓ 1

hailuo-02-pro

MiniMax

1198 ±12

9392

N/A

智能体榜

智能体榜中,Anthropic 模型继续垄断前三,Claude Opus 5 (High) 以 12.19% 的净提升度守住榜首位置。本次榜单有两款新模型进入前十,其中国产 Qwen3.8 Max 首次入榜即排名第 11 位,净提升度达到 7.61%,任务确认成功率 12.54%,工具幻觉率仅 0.11%,表现非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六,净提升度 9.78%。国产 Kimi K3 (Max) 稳定在第五名,净提升度 10.6%,任务确认成功率 15.55%,已经跻身全球智能体第一梯队。

国产模型在智能体榜已有多款进入中上游,具体如下:

月之暗面 Kimi K3 (Max) 位列第 5 名,净提升度 10.60%,任务确认成功率 15.55%,排名不变;

阿里 Qwen3.8 Max 新入榜位列第 11 名,净提升度 7.61%,任务确认成功率 12.54%;

智谱 GLM 5.2 (Max) 位列第 14 名,净提升度 6.74%,较上周下降 2 位;

深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名,净提升度 4.04%,较上周上升 2 位。

Claude Opus 5 (High)

Anthropic

12.19% ±1.45%

15.35% ±3.03%

19.26% ±5.29%

11.34% ±2.79%

Claude Fable 5 (High)

Anthropic

12.01% ±2.57%

10.66% ±4.9%

25.14% ±9.01%

8.84% ±5.23%

Claude Opus 5 (Max)

Anthropic

11.95% ±1.71%

17.96% ±3.18%

19.3% ±6.26%

6.95% ±3.43%

GPT 5.6 Sol (xHigh)

OpenAI

10.86% ±1.8%

10.12% ±3.69%

23.03% ±6.72%

9.23% ±3.74%

Kimi K3 (Max)

Moonshot

10.6% ±1.04%

15.55% ±2.06%

20.31% ±3.78%

7.8% ±1.91%

新上榜

Claude Opus 4.8 (High)

Anthropic

9.78% ±1.78%

9.45% ±3.1%

22.52% ±5.71%

8.44% ±3.33%

GPT 5.5 (xHigh)

OpenAI

8.9% ±1.03%

4.97% ±2.18%

14.61% ±3.62%

9.17% ±1.92%

新上榜

Claude Opus 4.7 (High)

Anthropic

8.17% ±1.43%

6.61% ±2.95%

12.32% ±4.81%

7.72% ±2.91%

↑ 2

GPT 5.5 (High)

OpenAI

7.73% ±0.97%

4.03% ±2.04%

11.62% ±3.39%

8.59% ±1.79%

10

Claude Opus 4.7

Anthropic

7.66% ±1.45%

5.45% ±3.08%

11.57% ±4.71%

9.95% ±2.87%

— 以下为 Top 10 外的国产模型 —

11

新上榜

Qwen3.8 Max

Alibaba

7.61% ±1.6%

12.54% ±3.32%

11.64% ±5.58%

5.34% ±3.09%

14

↓ 2

GLM 5.2 (Max)

Z.ai

6.74% ±0.9%

8.39% ±1.91%

11.6% ±3.18%

6.14% ±1.58%

19

↑ 2

Deepseek V4 Flash (High)(20260731)

DeepSeek

4.04% ±0.81%

8.7% ±1.93%

2.46% ±2.71%

3.34% ±1.57%

25

↓ 2

Kimi K2.7 Code

Moonshot

1.08% ±2.15%

4.43% ±4.55%

2.74% ±7.27%

1.76% ±4.86%

26

↓ 2

GLM 5.1

Z.ai

0.58% ±0.82%

1.75% ±1.82%

0.84% ±2.56%

1.73% ±1.48%

27

↓ 2

Qwen3.7 Max

Alibaba

0.2% ±0.87%

0.34% ±2.13%

4.24% ±2.67%

0.03% ±1.52%

28

↓ 2

DeepSeek V4 Pro

DeepSeek

0.14% ±0.88%

2.16% ±2.21%

2.5% ±2.82%

0.59% ±1.63%

本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名,前端开发榜更是稳居第二,qwen3.8-max 在智能体榜首秀即进入 Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代,值得持续关注其排名表现。