AI 大模型周榜:国产 glm-5.3-max 首秀闯入综合榜前 15,kimi-k3-max 冲进前十
8 月 24 日消息,Arena(arena.ai)平台发布 2026 年第 34 周(8 月 17 日 ~8 月 23 日)AI 大模型盲测排名,本期智谱新发布的 glm-5.3-max 首次入榜即闯入综合榜 Top 15,位列第 13 名,ELO 得分 1487 分;月之暗面 kimi-k3-max 从第 12 名升至第 10 名,首次杀入综合榜前十。此外,本周还有多个国产模型在各细分榜单中取得亮眼表现,新模型入榜数量较多,整体竞争格局进一步变化。
注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
综合榜头部格局保持稳定,claude-fable-5 以 1508 分蝉联第一,claude-opus-4-6-high 和 claude-opus-4-7-high 分别以 1504 分、 1502 分位列二、三名,三者分差均在 30 分以内,在误差范围内视为接近。
本周最大变化是新入榜的 glm-5.3-max 直接来到第 13 名,表现突出; kimi-k3-max 上升 2 位来到第 10 名,首次进入前十; muse-spark-1.1 上升 3 位至第 8 名。同时本周有 gpt-5.5-instant 、 claude-opus-4-8 两款新模型入榜,分别位列第 28、 29 名。qwen3.8-max 排名有所下滑,从第 8 名降至第 19 名。
国产模型在中上游占据多个席位,整体表现稳定:
月之暗面 kimi-k3-max 位列第 10 名,ELO 1489 分,较上周上升 2 位;
智谱 glm-5.3-max 位列第 13 名,ELO 1487 分,首次入榜;
阿里 qwen3.8-max 位列第 19 名,ELO 1481 分,较上周下降 11 位;
阿里 qwen3.7-max-preview 位列第 27 名,ELO 1474 分,排名基本持平。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1508 ±5 | 24331 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-6-high | Anthropic | 1504 ±4 | 72359 | $5 / $25 | 1M |
| 3 | - | claude-opus-4-7-high | Anthropic | 1502 ±4 | 60203 | $5 / $25 | 1M |
| 4 | - | muse-spark-1.2 (xHigh) | Meta | 1498 ±10 | 3257 | $1.25 / $4.25 | N/A |
| 5 | - | claude-opus-4-6 | Anthropic | 1497 ±3 | 76362 | $5 / $25 | 1M |
| 6 | - | claude-opus-4-7 | Anthropic | 1494 ±4 | 61304 | $5 / $25 | 1M |
| 7 | - | claude-opus-5-high | Anthropic | 1493 ±5 | 27610 | $5 / $25 | 1M |
| 8 | ↑ 3 | muse-spark-1.1 | Meta | 1491 ±5 | 20242 | $1.25 / $4.25 | N/A |
| 9 | - | gemini-3.7-flash-high | 1490 ±8 | 5718 | $0.75 / $3.57 | 1.05M | |
| 10 | ↑ 2 | kimi-k3-max | Moonshot | 1489 ±6 | 15054 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 13 | 新上榜 | glm-5.3-max | Z.ai | 1487 ±10 | 3751 | $1.4 / $4.4 | 1.05M |
| 19 | ↓ 11 | qwen3.8-max | Alibaba | 1481 ±7 | 9955 | $2 / $6 | 1M |
| 27 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1474 ±10 | 3712 | $1.48 / $4.43 | 1M |
代码榜
代码榜头部发生微调,claude-opus-4-7-high 升至榜首,ELO 1552 分,claude-opus-4-6-high 位列第二,原本榜首的 claude-fable-5 降至第三,三者 ELO 分差仅为 1 分,在误差范围内属于并列水平。智谱 glm-5.3-max 首次入榜即杀入前十,位列第 10 名,ELO 1531 分,首秀表现亮眼。grok-4.20-beta1 新入榜位列第 20 名; claude-sonnet-4-5-20250929-high-32k 、 gpt-5.5-high 两款新模型也完成首次排名。qwen3.8-max 排名下滑明显,从第 13 名降至第 25 名。
国产模型在代码榜中已有多款进入前三十,具体排名如下:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名基本持平;
智谱 glm-5.3-max 位列第 10 名,ELO 1531 分,首次入榜;
阿里 qwen3.7-max-preview 位列第 17 名,ELO 1524 分,排名基本持平;
阿里 qwen3.8-max 位列第 25 名,ELO 1520 分,较上周下降 12 位;
小米 mimo-v2.5-pro 位列第 27 名,ELO 1519 分,排名基本持平。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | ↑ 1 | claude-opus-4-7-high | Anthropic | 1552 ±6 | 17212 | $5 / $25 | 1M |
| 2 | ↑ 1 | claude-opus-4-6-high | Anthropic | 1551 ±6 | 18844 | $5 / $25 | 1M |
| 3 | ↓ 2 | claude-fable-5 | Anthropic | 1551 ±8 | 6552 | $10 / $50 | 1M |
| 4 | - | claude-opus-4-7 | Anthropic | 1547 ±6 | 17362 | $5 / $25 | 1M |
| 5 | - | claude-opus-4-6 | Anthropic | 1546 ±5 | 21288 | $5 / $25 | 1M |
| 6 | - | kimi-k3-max | Moonshot | 1542 ±10 | 3966 | N/A | N/A |
| 7 | ↑ 2 | claude-opus-5-high | Anthropic | 1533 ±8 | 7416 | $5 / $25 | 1M |
| 8 | ↓ 1 | claude-opus-4-8-high | Anthropic | 1533 ±7 | 12425 | $5 / $25 | 1M |
| 9 | ↓ 1 | muse-spark-1.2 (xHigh) | Meta | 1531 ±20 | 939 | $1.25 / $4.25 | N/A |
| 10 | 新上榜 | glm-5.3-max | Z.ai | 1531 ±19 | 994 | $1.4 / $4.4 | 1.05M |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 17 | - | qwen3.7-max-preview | Alibaba | 1524 ±18 | 1119 | $1.48 / $4.43 | 1M |
| 25 | ↓ 12 | qwen3.8-max | Alibaba | 1520 ±11 | 2970 | $2 / $6 | 1M |
| 27 | ↓ 2 | mimo-v2.5-pro | Xiaomi | 1519 ±6 | 14938 | $0.44 / $0.87 | 1.05M |
前端开发榜
前端开发榜头部依旧稳定,claude-opus-5-max 以 1691 分蝉联第一,国产 kimi-k3-max 和 qwen3.8-max 稳定占据二、三名,ELO 分别为 1674 分和 1669 分,与榜首分差在 30 分以内,误差范围内视为接近。新入榜的 glm-5.3-max 直接来到第 8 名,qwen3.8-27b 首次入榜位列第 9 名,两款国产新模型均进入前十,表现突出。目前已有多款国产模型进入前十五,在前端开发领域竞争力显著。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-5-max | Anthropic | 1691 ±9 | 8116 | $5 / $25 | 1M |
| 2 | - | kimi-k3-max | Moonshot | 1674 ±11 | 4546 | $3 / $15 | 1.05M |
| 3 | - | qwen3.8-max | Alibaba | 1669 ±13 | 3212 | $2 / $6 | 1M |
| 4 | - | claude-opus-5-high | Anthropic | 1663 ±8 | 8659 | $5 / $25 | 1M |
| 5 | - | grok-4.6-high | SpaceXAI | 1629 ±17 | 1523 | $2 / $6 | 500K |
| 6 | - | claude-fable-5 | Anthropic | 1626 ±8 | 8382 | $10 / $50 | 1M |
| 7 | - | gpt-5.6-sol-xhigh (codex-harness) |
OpenAI | 1619 ±8 | 9499 | $5 / $30 | 1.05M |
| 8 | 新上榜 | glm-5.3-max | Z.ai | 1599 ±15 | 1916 | $1.4 / $4.4 | 1.05M |
| 9 | 新上榜 | qwen3.8-27b | Alibaba | 1595 ±13 | 2464 | $0.5 / $3 | N/A |
| 10 | ↓ 2 | gemini-3.7-flash-high | 1587 ±13 | 2552 | $0.75 / $3.57 | 1.05M | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 11 | ↓ 2 | glm-5.2-max | Z.ai | 1582 ±8 | 8775 | $1.4 / $4.4 | 1M |
| 12 | ↓ 2 | deepseek-v4-pro-high-20260813 | DeepSeek | 1582 ±12 | 2869 | $1.32 / $3.96 | N/A |
| 13 | ↓ 2 | deepseek-v4-flash-high | DeepSeek | 1579 ±11 | 3537 | $0.44 / $1.32 | 1.05M |
| 26 | ↓ 1 | seed-2.1-pro-preview | Bytedance | 1521 ±8 | 7679 | N/A | N/A |
| 28 | ↓ 4 | hy3 | Tencent | 1518 ±12 | 2680 | $0.13 / $0.53 | 262.1K |
AI 生图榜
AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1381 分继续领跑,国产 seedream-5.0-pro 稳定保持第 8 名,qwen-image-3.0-pro 位列第 9 名,两款国产模型均进入前十,整体排名没有大幅波动。hunyuan-image-3.0 本周升至第 29 名,保持在前三十行列。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1381 ±5 | 70065 | $8 / $30 | N/A |
| 2 | - | mai-image-2.6-preview | Microsoft AI | 1336 ±11 | 3488 | N/A | N/A |
| 3 | - | grok-imagine-image-2.0 (low) | SpaceXAI | 1316 ±12 | 2676 | N/A | N/A |
| 4 | - | reve-2.1 | Reve | 1302 ±8 | 7588 | N/A | N/A |
| 5 | - | muse-image | Meta | 1282 ±7 | 15119 | N/A | N/A |
| 6 | - | reve-2.0 | Reve | 1270 ±6 | 14641 | N/A | N/A |
| 7 | - | gemini-3.1-flash-image (nano-banana-2) [web-search] |
1264 ±5 | 29102 | N/A | N/A | |
| 8 | - | seedream-5.0-pro | Bytedance | 1258 ±5 | 28830 | N/A | N/A |
| 9 | - | qwen-image-3.0-pro | Alibaba | 1257 ±9 | 4705 | N/A | N/A |
| 10 | - | mai-image-2.5 | Microsoft AI | 1256 ±4 | 46329 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | ↑ 1 | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12021 | N/A | N/A |
| 29 | ↑ 1 | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173345 | N/A | N/A |
AI 视频榜
AI 视频榜中,字节跳动新发布的 dreamina-seedance-2.5-720p 首次入榜即来到第 4 名,ELO 1477 分,紧随其前代产品 dreamina-seedance-2.0-720p 之后,两款国产模型均进入前五,表现亮眼。gemini-omni-flash 继续以 1512 分排名第一,flux-3-video 位列第二,dreamina-seedance-2.0-720p 保持第三。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 |
上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gemini-omni-flash | 1512 ±11 | 16916 | N/A | N/A | |
| 2 | - | flux-3-video | Black Forest Labs | 1494 ±17 | 1291 | N/A | N/A |
| 3 | - | dreamina-seedance-2.0-720p | Bytedance | 1482 ±10 | 49058 | N/A | N/A |
| 4 | 新上榜 | dreamina-seedance-2.5-720p | Bytedance | 1477 ±19 | 1337 | N/A | N/A |
| 5 | ↓ 1 | muse-video | Meta | 1457 ±15 | 2176 | N/A | N/A |
| 6 | ↓ 1 | minimax-h3 | MiniMax | 1453 ±13 | 3081 | N/A | N/A |
| 7 | ↓ 1 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 22113 | N/A | N/A |
| 8 | ↓ 1 | sora-2-pro | OpenAI | 1364 ±7 | 46509 | $0 / $0.3 | N/A |
| 9 | ↓ 1 | veo-3.1-audio | 1364 ±14 | 13743 | $0 / $0.4 | N/A | |
| 10 | ↓ 1 | veo-3.1-audio-1080p | 1363 ±10 | 24979 | N/A | N/A | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 15 | ↓ 1 | wan2.7-t2v | Alibaba | 1344 ±9 | 17769 | N/A | N/A |
| 18 | ↓ 1 | wan2.6-t2v | Alibaba | 1330 ±8 | 44304 | N/A | N/A |
| 19 | ↓ 1 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 75990 | N/A | N/A |
| 21 | ↓ 1 | wan2.5-t2v-preview | Alibaba | 1249 ±9 | 28239 | N/A | N/A |
智能体榜
智能体榜头部依旧由 Anthropic 模型占据,Claude Opus 5 (High) 以 12.47% 的净提升度保持第一,Claude Opus 5 (Max) 上升一位至第二,Claude Fable 5 (High) 降至第三,三者净提升度差距小于置信区间,在误差范围内视为接近。月之暗面 Kimi K3 (Max) 上升一位至第四,净提升度 10.41%,任务确认成功率达到 17.97%,整体表现已经进入头部梯队。本周 DeepSeek V4 Pro (High) (0813) 和 Qwen3.8 Max 两款国产模型新入榜,分别位列第 14 和第 15 名,表现不俗。
国产模型在智能体榜已有多款进入前三十,头部已经摸到第一梯队门槛:
月之暗面 Kimi K3 (Max) 排名第 4,净提升度 10.41%,任务确认成功率 17.97%,较上周上升 1 位;
深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14,净提升度 6.26%,任务确认成功率 13.06%,首次入榜;
阿里 Qwen3.8 Max 排名第 15,净提升度 6.20%,工具幻觉率仅 0.18%,首次入榜;
智谱 GLM 5.2 (Max) 排名第 17,净提升度 5.82%,较上周下降 3 位;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 20,净提升度 3.99%。
| 排名 | 较上周 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | - | Claude Opus 5 (High) | Anthropic | 12.47% ±1.54% | 15.41% ±3.16% | 20.52% ±5.59% | 11.15% ±2.98% |
| 2 | ↑ 1 | Claude Opus 5 (Max) | Anthropic | 12% ±1.8% | 18.52% ±3.24% | 19.13% ±6.56% | 6.65% ±3.66% |
| 3 | ↓ 1 | Claude Fable 5 (High) | Anthropic | 11.57% ±1.7% | 12.44% ±3.24% | 21.37% ±5.95% | 8.99% ±3.55% |
| 4 | ↑ 1 | Kimi K3 (Max) | Moonshot | 10.41% ±0.62% | 17.97% ±1.23% | 18.31% ±2.23% | 5.96% ±1.13% |
| 5 | ↓ 1 | GPT 5.6 Sol (xHigh) | OpenAI | 9.74% ±1.39% | 10% ±2.87% | 22.2% ±5.11% | 5.77% ±2.88% |
| 6 | - | Claude Opus 4.8 (High) | Anthropic | 9.55% ±1.51% | 8.26% ±2.7% | 21.65% ±4.97% | 9.01% ±2.86% |
| 7 | - | GPT 5.5 (xHigh) | OpenAI | 8.51% ±0.93% | 4.42% ±1.96% | 13.46% ±3.23% | 8.86% ±1.76% |
| 8 | - | Claude Opus 4.7 (High) | Anthropic | 8.12% ±1.24% | 5.62% ±2.53% | 12.36% ±4.17% | 8.44% ±2.47% |
| 9 | - | GPT 5.5 (High) | OpenAI | 7.74% ±0.84% | 4.09% ±1.74% | 11.26% ±2.94% | 9.12% ±1.56% |
| 10 | - | Claude Opus 4.7 | Anthropic | 7.4% ±1.25% | 4.99% ±2.59% | 11.51% ±4.09% | 9.32% ±2.45% |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 14 | 新上榜 | DeepSeek V4 Pro (High) (0813) | DeepSeek | 6.26% ±1.28% | 13.06% ±2.65% | 3.82% ±4.37% | 2.35% ±2.83% |
| 15 | 新上榜 | Qwen3.8 Max | Alibaba | 6.2% ±1.36% | 11.62% ±3.03% | 6.81% ±4.79% | 4% ±2.67% |
| 17 | ↓ 3 | GLM 5.2 (Max) | Z.ai | 5.82% ±0.87% | 7.24% ±1.87% | 9.42% ±2.99% | 5.22% ±1.53% |
| 20 | ↓ 1 | Deepseek V4 Flash (High) (20260731) |
DeepSeek | 3.99% ±0.79% | 8.09% ±1.89% | 2.15% ±2.64% | 3.45% ±1.5% |
| 27 | ↓ 2 | Kimi K2.7 Code | Moonshot | 0.43% ±2.07% | 3.72% ±4.42% | 1.53% ±6.94% | 2.59% ±4.69% |
| 28 | - | DeepSeek V4 Pro | DeepSeek | 0.05% ±0.88% | 2.66% ±2.21% | 2.39% ±2.82% | 0.15% ±1.66% |
| 29 | ↓ 3 | GLM 5.1 | Z.ai | 0% ±0.75% | 0.93% ±1.69% | 0.28% ±2.27% | 0.97% ±1.4% |
本周 Arena 榜单迎来多款国产新模型亮相,智谱 glm-5.3-max 在综合榜、代码榜、前端开发榜均取得出色排名,月之暗面 kimi-k3-max 首次杀入综合榜前十,智能体榜也进入前四,字节跳动新模型 dreamina-seedance-2.5-720p 在 AI 视频榜直接进入前五,国产模型整体在多个维度继续突破。接下来随着更多国产大模型新版本发布,预计排名竞争将进一步加剧,值得后续关注。
如果您对本站有任何建议,欢迎您提出来!本站部分信息来源于网络,如果侵犯了您权益,请联系我们删除!
微信客服