IT之家 9 月 7 日消息,Arena(arena.ai)平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。
前端开发榜中,阿里 qwen3.8-max-0902 首次入榜即位列第 4,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15;
AI 视频榜中,阿里 wan3.0 首次入榜直接冲进前三,展现国产生成视频模型的最新竞争力。
整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。
IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。
本周有两款新模型首次入榜,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。
头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。
国产模型整体处于中上游位置,梯队相对稳定:
月之暗面 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平;
智谱 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位;
阿里 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位;
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1507 ±5 | 27189 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-6-high | Anthropic | 1505 ±4 | 72099 | $5 / $25 | 1M |
| 3 | 新上榜 | claude-fable-5.1-max | Anthropic | 1504 ±11 | 2906 | $10 / $50 | 1M |
| 4 | ↓ 1 | claude-opus-4-7-high | Anthropic | 1502 ±4 | 60103 | $5 / $25 | 1M |
| 5 | ↓ 1 | muse-spark-1.2 (xHigh) | Meta | 1499 ±10 | 3240 | $1.25 / $4.25 | N/A |
| 6 | ↓ 1 | claude-opus-4-6 | Anthropic | 1498 ±3 | 76015 | $5 / $25 | 1M |
| 7 | ↓ 1 | claude-opus-4-7 | Anthropic | 1494 ±4 | 61238 | $5 / $25 | 1M |
| 8 | 新上榜 | gemini-3.8-flash-high | 1494 ±9 | 5125 | $0.75 / $3.75 | 1.05M | |
| 9 | ↓ 2 | claude-opus-5-high | Anthropic | 1493 ±5 | 35174 | $5 / $25 | 1M |
| 10 | ↓ 2 | muse-spark-1.1 | Meta | 1492 ±5 | 24064 | $1.25 / $4.25 | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 12 | ↓ 2 | kimi-k3-max | Moonshot | 1489 ±5 | 18090 | N/A | N/A |
| 20 | ↓ 5 | glm-5.3-max | Z.ai | 1482 ±7 | 7668 | $1.4 / $4.4 | 1.05M |
| 22 | ↓ 2 | qwen3.8-max | Alibaba | 1480 ±6 | 13346 | $2 / $6 | 1M |
代码榜
代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。
本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。
国产模型在代码榜已有多款进入前 30,具体排名如下:
月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;
智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位;
智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 3 位;
阿里 qwen3.8-max 位列第 30 名,ELO 1520 分,较上周下降 4 位;
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-4-7-high | Anthropic | 1552 ±6 | 17176 | $5 / $25 | 1M |
| 2 | - | claude-opus-4-6-high | Anthropic | 1552 ±6 | 18800 | $5 / $25 | 1M |
| 3 | - | claude-fable-5 | Anthropic | 1551 ±8 | 7293 | $10 / $50 | 1M |
| 4 | - | claude-opus-4-7 | Anthropic | 1547 ±6 | 17342 | $5 / $25 | 1M |
| 5 | - | claude-opus-4-6 | Anthropic | 1546 ±5 | 21198 | $5 / $25 | 1M |
| 6 | - | kimi-k3-max | Moonshot | 1542 ±9 | 4719 | N/A | N/A |
| 7 | 新上榜 | gemini-3.8-flash-high | 1537 ±16 | 1456 | $0.75 / $3.75 | 1.05M | |
| 8 | ↑ 1 | claude-opus-4-8-high | Anthropic | 1534 ±6 | 13439 | $5 / $25 | 1M |
| 9 | ↑ 2 | glm-5.3-flash | Z.ai | 1534 ±17 | 1274 | $0.15 / $0.5 | 1.05M |
| 10 | ↓ 3 | muse-spark-1.2 (xHigh) | Meta | 1533 ±20 | 935 | $1.25 / $4.25 | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | ↓ 3 | glm-5.3-max | Z.ai | 1528 ±14 | 2008 | $1.4 / $4.4 | 1.05M |
| 19 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1525 ±18 | 1118 | $1.48 / $4.43 | 1M |
| 26 | ↑ 1 | mimo-v2.5-pro | Xiaomi | 1520 ±6 | 15813 | $0.44 / $0.87 | 1.05M |
| 30 | ↓ 4 | qwen3.8-max | Alibaba | 1520 ±10 | 3867 | $2 / $6 | 1M |
前端开发榜
前端开发榜本周迎来密集新模型入榜,OpenAI gpt-6-astra-max 首次登榜即拿下榜首,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。
国产模型此次扎堆入榜表现突出,阿里 qwen3.8-max-0902 首次入榜即冲到第 4,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。
国产模型在前端开发榜已有多款进入前 20:
阿里 qwen3.8-max-0902 排名最高,位列第 4 名,ELO 1686 分,首次入榜;
月之暗面 kimi-k3-max 位列第 5 名,ELO 1674 分,排名下降 3 位;
阿里 qwen3.8-max 位列第 6 名,ELO 1670 分,排名下降 3 位;
阿里 qwen3.8-flash-next 位列第 9 名,ELO 1626 分,首次入榜;
腾讯 hy4-preview 位列第 12 名,ELO 1621 分,首次入榜。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | 新上榜 | gpt-6-astra-max | OpenAI | 1797 ±24 | 1199 | $10 / $50 | 1.05M |
| 2 | 新上榜 | claude-fable-5.1-max | Anthropic | 1762 ±16 | 2275 | $10 / $50 | 1M |
| 3 | ↓ 2 | claude-opus-5-max | Anthropic | 1688 ±8 | 10904 | $5 / $25 | 1M |
| 4 | 新上榜 | qwen3.8-max-0902 | Alibaba | 1686 ±16 | 1868 | $2 / $6 | N/A |
| 5 | ↓ 3 | kimi-k3-max | Moonshot | 1674 ±11 | 4546 | $3 / $15 | 1.05M |
| 6 | ↓ 3 | qwen3.8-max | Alibaba | 1670 ±12 | 3223 | $2 / $6 | 1M |
| 7 | ↓ 3 | claude-opus-5-high | Anthropic | 1661 ±7 | 10928 | $5 / $25 | 1M |
| 8 | ↓ 2 | claude-fable-5 | Anthropic | 1629 ±8 | 9356 | $10 / $50 | 1M |
| 9 | 新上榜 | qwen3.8-flash-next | Alibaba | 1626 ±14 | 2158 | $0.16 / $0.47 | 1M |
| 10 | ↓ 5 | grok-4.6-high | SpaceXAI | 1625 ±11 | 3487 | $2 / $6 | 500K |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 12 | 新上榜 | hy4-preview | Tencent | 1621 ±16 | 1661 | $0.83 / $2.5 | 1.05M |
| 14 | ↓ 6 | glm-5.3-max | Z.ai | 1609 ±12 | 2930 | $1.4 / $4.4 | 1.05M |
| 15 | 新上榜 | glm-5.3-flash | Z.ai | 1605 ±15 | 1961 | $0.15 / $0.5 | 1.05M |
| 16 | ↓ 7 | qwen3.8-27b | Alibaba | 1594 ±11 | 3543 | $0.4 / $3 | N/A |
| 18 | ↓ 7 | glm-5.2-max | Z.ai | 1587 ±7 | 9836 | $1.4 / $4.4 | 1M |
| 19 | ↓ 7 | deepseek-v4-pro-high-20260813 | DeepSeek | 1582 ±11 | 3518 | $1.32 / $3.96 | N/A |
| 20 | ↓ 7 | deepseek-v4-flash-high | DeepSeek | 1580 ±10 | 4177 | $0.44 / $1.32 | 1.05M |
智能体榜
智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。
在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。
国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜:
月之暗面 kimi-k3-max 排名最高,位列第 7 名,净提升度 7.96%,任务确认成功率 16.58%,排名下降 1 位;
腾讯 hy4-preview 位列第 10 名,净提升度 6.92%,任务确认成功率 13.56%,首次入榜;
智谱 glm-5.2 (max) 位列第 12 名,净提升度 6.03%,较上周上升 4 位;
阿里 qwen3.8-max 位列第 16 名,净提升度 5.51%,较上周下降 5 位;
| 排名 | 较上周 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | 新上榜 | Claude Fable 5.1 (Max) | Anthropic | 15.87% ±2.84% | 22.45% ±3.71% | 42.45% ±10.94% | 0.58% ±6.77% |
| 2 | ↓ 1 | Claude Opus 5 (High) | Anthropic | 12.68% ±1.73% | 13.3% ±3.69% | 18.27% ±6.49% | 16.09% ±3.24% |
| 3 | ↓ 1 | Claude Opus 5 (Max) | Anthropic | 11.67% ±1.96% | 14.89% ±3.95% | 17.3% ±7.1% | 9.7% ±3.85% |
| 4 | ↓ 1 | Claude Fable 5 (High) | Anthropic | 10.23% ±1.46% | 7.37% ±3.17% | 19.36% ±5.29% | 11.89% ±2.68% |
| 5 | ↓ 1 | GPT 5.6 Sol (xHigh) | OpenAI | 9.31% ±1.49% | 6.68% ±3.13% | 22.07% ±5.5% | 8.88% ±2.84% |
| 6 | ↓ 1 | Claude Opus 4.8 (High) | Anthropic | 9.17% ±1.48% | 5.27% ±3.07% | 18.04% ±5.19% | 12.59% ±2.73% |
| 7 | ↓ 1 | Kimi K3 (Max) | Moonshot | 7.96% ±0.68% | 16.58% ±1.4% | 14.03% ±2.36% | 1.24% ±1.35% |
| 8 | - | Claude Sonnet 5 (High) | Anthropic | 7.41% ±1.95% | 2.8% ±4.13% | 11.19% ±6.78% | 11.52% ±4.13% |
| 9 | ↓ 2 | GPT 5.5 (xHigh) | OpenAI | 7.21% ±1.08% | 2.07% ±2.42% | 11.41% ±3.77% | 8.54% ±2.01% |
| 10 | 新上榜 | Hy4 preview | Tencent | 6.92% ±1.51% | 13.56% ±2.96% | 10.26% ±5.61% | 0.1% ±3.21% |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 12 | ↑ 4 | GLM 5.2 (Max) | Z.ai | 6.03% ±0.76% | 8.63% ±1.64% | 11.73% ±2.67% | 4.48% ±1.38% |
| 16 | ↓ 5 | Qwen3.8 Max | Alibaba | 5.51% ±1.09% | 10.37% ±2.35% | 6.58% ±3.8% | 4.15% ±2.19% |
| 18 | ↓ 6 | DeepSeek V4 Pro (High) (0813) | DeepSeek | 5.43% ±0.9% | 11.75% ±1.91% | 5.24% ±3.13% | 0.67% ±1.95% |
| 22 | ↓ 2 | GLM 5.3 (Max) | Z.ai | 3.8% ±0.71% | 12.1% ±1.52% | 5.75% ±2.41% | 0.63% ±1.37% |
| 23 | 新上榜 | GLM 5.3 Flash | Z.ai | 3.67% ±1.03% | 14.14% ±2.16% | 5.45% ±3.49% | 0.23% ±2.12% |
| 24 | ↓ 2 | Deepseek V4 Flash (High) (20260731) | DeepSeek | 3.29% ±0.8% | 8.46% ±1.76% | 3.9% ±2.76% | 0.02% ±1.6% |
| 27 | 新上榜 | Qwen3.8 Flash Next | Alibaba | 2.61% ±1.21% | 12.46% ±2.49% | 0.24% ±4.15% | 1.18% ±2.74% |
| 30 | ↓ 3 | Qwen 3.8 27B | Alibaba | 1.03% ±0.99% | 6.98% ±2.26% | 0.78% ±3.28% | 0.39% ±2.02% |
AI 生图榜
AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。
国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1382 ±4 | 77830 | $8 / $30 | N/A |
| 2 | 新上榜 | mai-image-2.6 | Microsoft AI | 1332 ±7 | 10086 | N/A | N/A |
| 3 | - | grok-imagine-image-2.0 (low) | SpaceXAI | 1315 ±12 | 2682 | N/A | N/A |
| 4 | - | reve-2.1 | Reve | 1301 ±8 | 7576 | N/A | N/A |
| 5 | - | muse-image | Meta | 1279 ±6 | 24856 | N/A | N/A |
| 6 | - | reve-2.0 | Reve | 1270 ±6 | 14636 | N/A | N/A |
| 7 | - | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1261 ±5 | 40649 | $0.5 / $3 | 131.1K | |
| 8 | - | seedream-5.0-pro | Bytedance | 1258 ±4 | 59484 | N/A | N/A |
| 9 | - | qwen-image-3.0-pro | Alibaba | 1254 ±7 | 10923 | N/A | N/A |
| 10 | - | mai-image-2.5 | Microsoft AI | 1254 ±4 | 57295 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | - | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12016 | N/A | N/A |
| 29 | - | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173129 | N/A | N/A |
AI 视频榜
AI 视频榜本周最大亮点是阿里 wan3.0 首次入榜即冲进前三,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。
国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gemini-omni-1.1-flash | 1515 ±15 | 1777 | $1.5 / $9 | 131.1K | |
| 2 | - | gemini-omni-flash | 1511 ±10 | 21934 | N/A | N/A | |
| 3 | 新上榜 | wan3.0 | Alibaba | 1494 ±19 | 1167 | N/A | N/A |
| 4 | ↓ 1 | flux-3-video | Black Forest Labs | 1494 ±17 | 1290 | N/A | N/A |
| 5 | 新上榜 | grok-imagine-video-1.5-agent | SpaceXAI | 1491 ±19 | 1195 | N/A | N/A |
| 6 | ↓ 1 | dreamina-seedance-2.5-720p | Bytedance | 1482 ±12 | 4066 | N/A | N/A |
| 7 | ↓ 3 | dreamina-seedance-2.0-720p | Bytedance | 1479 ±8 | 52864 | N/A | N/A |
| 8 | ↓ 2 | minimax-h3 | MiniMax | 1462 ±10 | 7648 | N/A | N/A |
| 9 | ↓ 2 | muse-video | Meta | 1456 ±15 | 2178 | N/A | N/A |
| 10 | ↓ 2 | happyhorse-1.0 | Alibaba-ATH | 1427 ±13 | 22116 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 19 | ↓ 4 | wan2.7-t2v | Alibaba | 1341 ±8 | 23025 | N/A | N/A |
| 21 | ↓ 2 | wan2.6-t2v | Alibaba | 1328 ±8 | 49348 | N/A | N/A |
| 22 | ↓ 2 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 75891 | N/A | N/A |
| 25 | ↓ 2 | wan2.5-t2v-preview | Alibaba | 1246 ±9 | 32461 | N/A | N/A |
本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。
头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。
下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。

