您现在的位置是:首页 >> AI资讯

AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼

AI资讯 2026-08-10  阅读:111
阿里 qwen3.8-max 杀入综合榜第 6 名,ELO 1497 分,国产多模型在各榜单均有亮眼表现。

8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。

:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。

国产模型在综合榜已有多款进入中上游,具体排名如下:

  • 阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;

  • 月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;

  • 阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。

排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M)
输入 / 输出
上下文
1 - claude-fable-5 Anthropic 1507 ±6 19390 $10 / $50 1M
2 - claude-opus-4-6-thinking Anthropic 1505 ±4 69336 $2.5 / $12.5 1M
3 - claude-opus-4-7-thinking Anthropic 1502 ±4 57018 $5 / $25 1M
4 新上榜 muse-spark-1.2 (xHigh) Meta 1498 ±13 2057 $1.25 / $4.25 N/A
5 ↓ 1 claude-opus-4-6 Anthropic 1497 ±3 73158 $2.5 / $12.5 1M
6 新上榜 qwen3.8-max Alibaba 1497 ±9 4662 $2 / $6 1M
7 ↓ 2 claude-opus-4-7 Anthropic 1493 ±4 58135 $5 / $25 1M
8 ↓ 2 claude-opus-5-high Anthropic 1493 ±6 14902 $5 / $25 1M
9 ↓ 2 claude-opus-5-max Anthropic 1488 ±8 7137 $5 / $25 1M
10 ↓ 1 muse-spark Meta 1488 ±6 13476 N/A N/A
— 以下为 Top 10 外的国产模型 —
14 ↓ 2 kimi-k3-max Moonshot 1485 ±7 9861 N/A N/A
23 ↓ 2 qwen3.7-max-preview Alibaba 1475 ±10 3695 $1.48 / $4.43 1M

代码榜

代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。

国产模型在代码榜已有多款进入前 30,具体如下:

  • 月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;

  • 阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;

  • 阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;

  • 小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;

  • 智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。

排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M)
输入 / 输出
上下文
1 - claude-fable-5 Anthropic 1553 ±9 5234 $10 / $50 1M
2 - claude-opus-4-7-thinking Anthropic 1552 ±6 16303 $5 / $25 1M
3 - claude-opus-4-6-thinking Anthropic 1551 ±6 18015 $2.5 / $12.5 1M
4 - claude-opus-4-6 Anthropic 1547 ±6 20444 $2.5 / $12.5 1M
5 - claude-opus-4-7 Anthropic 1546 ±6 16534 $5 / $25 1M
6 ↑ 2 kimi-k3-max Moonshot 1542 ±12 2611 N/A N/A
7 ↓ 1 claude-opus-4-8-thinking Anthropic 1535 ±7 10509 $2.5 / $12.5 1M
8 新上榜 qwen3.8-max Alibaba 1532 ±16 1411 $2 / $6 1M
9 ↑ 1 muse-spark-1.1 Meta 1532 ±10 4199 $1.25 / $4.25 N/A
10 ↓ 1 claude-opus-4-5-20251101-
thinking-32k
Anthropic 1530 ±7 7603 $5 / $25 200K
— 以下为 Top 10 外的国产模型 —
17 ↓ 1 qwen3.7-max-preview Alibaba 1526 ±18 1112 $1.48 / $4.43 1M
28 - mimo-v2.5-pro Xiaomi 1519 ±7 13199 $0.44 / $0.87 1.05M
30 ↓ 3 glm-5.1 Z.ai 1517 ±7 10330 $1.4 / $4.4 202.8K

前端开发榜

本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。

国产模型具体排名如下:

  • 月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;

  • 阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;

  • 智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;

  • 深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。

排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M)
输入 / 输出
上下文
1 - claude-opus-5-max Anthropic 1686 ±11 4029 $5 / $25 1M
2 - kimi-k3-max Moonshot 1675 ±12 4372 $3 / $15 1.05M
3 - claude-opus-5-high Anthropic 1670 ±10 5145 $5 / $25 1M
4 新上榜 qwen3.8-max Alibaba 1667 ±16 1980 $2 / $6 1M
5 ↓ 1 claude-fable-5 Anthropic 1630 ±9 6816 $10 / $50 1M
6 ↓ 1 gpt-5.6-sol-xhigh
(codex-harness)
OpenAI 1620 ±9 6903 $5 / $30 1.05M
7 ↓ 1 glm-5.2-max Z.ai 1588 ±9 6924 $1.4 / $4.4 1M
8 新上榜 deepseek-v4-flash-high DeepSeek 1581 ±15 1931 $0.14 / $0.28 1.05M
9 ↓ 1 claude-opus-4-8-thinking Anthropic 1565 ±8 9549 $2.5 / $12.5 1M
10 ↓ 1 claude-opus-4-7 Anthropic 1560 ±7 12398 $5 / $25 1M
— 以下为 Top 10 外的国产模型 —
21 ↓ 3 seed-2.1-pro-preview Bytedance 1524 ±9 6069 N/A N/A
24 ↓ 1 hy3 Tencent 1522 ±15 1729 $0.13 / $0.53 262.1K
25 ↓ 3 qwen3.7-max-20260517 Alibaba 1516 ±8 8044 $1.48 / $4.43 1M
26 ↓ 2 glm-5.1 Z.ai 1515 ±8 7853 $1.4 / $4.4 202.8K
27 ↓ 2 kimi-k2.6 Moonshot 1510 ±8 9261 $0.95 / $4 262.1K

智能体榜

智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。

国产模型在智能体榜已有多款进入前 30,具体如下:

  • 月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;

  • 智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;

  • 深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;

  • 智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。

排名 较上周 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性
1 ↑ 2 Claude Opus 5 (High) Anthropic 11.99% ±1.37% 16.04% ±2.79% 19.46% ±5.19% 10.29% ±2.51%
2 ↓ 1 Claude Fable 5 (High) Anthropic 11.66% ±2.39% 11.47% ±4.46% 22.56% ±8.25% 10.01% ±4.93%
3 ↓ 1 Claude Opus 5 (Max) Anthropic 11.19% ±1.62% 16.36% ±3.11% 19.07% ±6.03% 5.8% ±3.1%
4 - GPT 5.6 Sol (xHigh) OpenAI 10.28% ±1.72% 9.06% ±3.48% 22.7% ±6.42% 8.42% ±3.5%
5 - Kimi K3 (Max) Moonshot 10.08% ±1.07% 14.97% ±2.09% 19.68% ±3.85% 7.45% ±1.97%
6 - Claude Opus 4.8 (Thinking) Anthropic 9.35% ±1.7% 8.81% ±2.9% 21.46% ±5.38% 8.5% ±3.08%
7 ↑ 1 GPT 5.5 (xHigh) OpenAI 8.45% ±0.99% 5.24% ±2.08% 13.56% ±3.55% 8.19% ±1.8%
8 ↑ 1 Claude Opus 4.7 (Thinking) Anthropic 8.33% ±1.32% 6.65% ±2.76% 11.87% ±4.59% 8.61% ±2.72%
9 ↓ 2 Claude Sonnet 5 (High) Anthropic 7.46% ±2.15% 5.56% ±4.29% 14.8% ±7.65% 5.14% ±4.55%
10 ↑ 1 Claude Opus 4.7 Anthropic 7.32% ±1.36% 5.55% ±2.85% 10.72% ±4.45% 9.54% ±2.7%
— 以下为 Top 10 外的国产模型 —
12 - GLM 5.2 (Max) Z.ai 6.75% ±0.9% 9.21% ±1.83% 12.39% ±3.21% 5.62% ±1.59%
21 新上榜 Deepseek V4 Flash (High)
(20260731)
DeepSeek 2.84% ±1.1% 8.53% ±2.54% 0.46% ±3.64% 0.43% ±2.19%
23 - Kimi K2.7 Code Moonshot 0.69% ±1.94% 4.12% ±4.08% 2.36% ±6.68% 1.92% ±4.37%
24 ↓ 2 GLM 5.1 Z.ai 0.35% ±0.77% 1.06% ±1.72% 0.72% ±2.5% 0.76% ±1.4%
25 - Qwen3.7 Max Alibaba 0.16% ±0.88% 0.24% ±2.11% 5.07% ±2.72% 0.21% ±1.55%
26 - DeepSeek V4 Pro DeepSeek 0.33% ±0.86% 2.74% ±2.16% 3.35% ±2.78% 0.3% ±1.54%
27 ↑ 2 Kimi K2.6 Moonshot 0.48% ±2.16% 2.28% ±4.11% 2.12% ±6.8% 1.66% ±4.49%
30 ↓ 3 Hy3 Tencent 1.12% ±1.42% 2.2% ±3.04% 3.7% ±4.91% 9.01% ±2.6%

AI 生图榜

本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。

排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M)
输入 / 输出
上下文
1 - gpt-image-2 (medium) OpenAI 1380 ±5 69194 N/A N/A
2 新上榜 grok-imagine-image-2.0 (low) SpaceXAI 1320 ±12 2722 N/A N/A
3 ↓ 1 reve-2.1 Reve 1302 ±8 7598 N/A N/A
4 ↓ 1 muse-image Meta 1283 ±7 14510 N/A N/A
5 ↓ 1 reve-2.0 Reve 1270 ±6 14650 N/A N/A
6 ↓ 1 gemini-3.1-flash-image
(nano-banana-2) [web-search]
Google 1263 ±5 27910 N/A N/A
7 新上榜 qwen-image-3.0-pro Alibaba 1258 ±10 3735 N/A N/A
8 ↓ 2 seedream-5.0-pro Bytedance 1257 ±5 26510 N/A N/A
9 ↓ 2 mai-image-2.5 Microsoft AI 1256 ±5 44940 N/A N/A
10 ↓ 2 gemini-3.1-flash-lite-image
(nano-banana-2-lite)
Google 1251 ±6 16419 N/A N/A
— 以下为 Top 10 外的国产模型 —
16 ↓ 2 qwen-image-2.0-pro-2026-06-22 Alibaba 1191 ±6 12026 N/A N/A
29 ↓ 4 hunyuan-image-3.0 Tencent 1151 ±3 173366 N/A N/A

AI 视频榜

AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。

排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M)
输入 / 输出
上下文
1 - gemini-omni-flash Google 1513 ±12 14571 N/A N/A
2 - dreamina-seedance-2.0-720p Bytedance 1479 ±11 47067 N/A N/A
3 - muse-video Meta 1458 ±15 2160 N/A N/A
4 新上榜 minimax-h3 MiniMax 1455 ±19 1060 N/A N/A
5 ↓ 1 happyhorse-1.0 Alibaba-ATH 1428 ±13 21979 N/A N/A
6 ↓ 1 sora-2-pro OpenAI 1365 ±8 44543 $0 / $0.3 N/A
7 - veo-3.1-audio Google 1364 ±14 13687 $0 / $0.4 N/A
8 ↓ 2 veo-3.1-audio-1080p Google 1363 ±10 24846 N/A N/A
9 ↓ 1 veo-3.1-fast-audio Google 1362 ±11 39301 $0 / $0.15 N/A
10 ↓ 1 veo-3.1-fast-audio-1080p Google 1358 ±10 25637 N/A N/A
— 以下为 Top 10 外的国产模型 —
13 ↓ 2 wan2.7-t2v Alibaba 1347 ±9 15246 N/A N/A
16 ↓ 1 wan2.6-t2v Alibaba 1330 ±9 41706 N/A N/A
17 ↓ 1 seedance-v1.5-pro Bytedance 1256 ±7 75653 N/A N/A
19 ↓ 2 wan2.5-t2v-preview Alibaba 1252 ±10 25895 N/A N/A
28 ↓ 1 hailuo-2.3 MiniMax 1202 ±7 72127 N/A N/A
29 ↓ 1 hailuo-02-pro MiniMax 1198 ±13 9365 N/A N/A
30 ↓ 1 seedance-v1-pro Bytedance 1190 ±11 12117 N/A N/A

本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。

如果您对本站有任何建议,欢迎您提出来!本站部分信息来源于网络,如果侵犯了您权益,请联系我们删除!