都说自己是第一,中国最强的大模型到底是谁?
来源:36kr 2 小时前

一个较为诚实的表述是,中国大模型的第一梯队是Kimi K3与Qwen3.8-Max组成的双雄格局。前者赢在国际验证,后者赢在中文综合与生态。

当前,中国大模型行业出现了一个奇观,几乎每一家头部公司,都声称自己的模型是“中国第一”甚至“全球前三”。

阿里说Qwen3.8-Max“第三方盲测仅次于Claude”;月之暗面说Kimi K3是“全球最强开源模型”;智谱说GLM-5.2“Code Arena全球第一”;DeepSeek的模型卡上写着“SWE-bench Verified 80.6%”;字节的豆包2.1宣称“IMO金牌、HLE全球领先”;百度文心5.0强调“10M上下文、中文写作第一”。

这些说法都“对”,但都不完整。它们有一个共同特征,每个“第一”前面都有一个精心挑选的定语。参数最大是第一,某个单项基准是第一,某个盲测榜是第一,某个价格档是第一。定语不同,结论自然互不冲突。就像智能手机年代每家厂商都说自己“跑分第一、拍照第一、续航第一”,也像新能源汽车每家都说“续航第一、智驾第一、安全第一”。

大洋彼岸的情况不同。美国大模型行业存在一个相对公认的格局,某个阶段OpenAI领先,某个阶段Anthropic的Claude领先,Google的Gemini在中间穿插反超,2026年年中的共识是Anthropic重新领跑,Claude Fable 5在Artificial Analysis智能指数上以约60分排第一,GPT-5.6 Sol以约59分排第二。这个共识由第三方评测机构、开发者社区和真实使用数据共同投票形成,不需要看任何一家公司的发布会。

中国没有形成这种共识。不是因为没有答案,而是因为答案被公关宣传的声浪盖住了。这促使我们抛开所有公司自己的说法,主要采用三类最权威的第三方验证数据,Arena全球盲测、Artificial Analysis智能指数与SuperCLUE中文测评来进行交叉对照,看事实到底支持什么结论。

第一条证据链:Artificial Analysis智能指数

Artificial Analysis(AA)是国际开发者社区引用最多的独立评测机构,它的智能指数综合了数学、推理、代码、知识等多个维度的标准化测试,全球189款模型同台排名。它不收厂商的钱,测试口径统一,是目前最接近“客观”的第三方标尺。

截至2026年8月初,中国主要模型在AA智能指数上的成绩是:

月之暗面Kimi K3(Max):57分,189款模型中排第四。这是开源权重模型有史以来的最高排名,超过了Claude Opus 4.8(约56分),仅次于Claude Fable 5(约60分)、GPT-5.6 Sol(约59分)和谷歌的一款旗舰。

智谱GLM-5.2(Max):51分,排在十名开外。

深度求索DeepSeek V4 Flash 0731:50分,与谷歌Gemini 3.6 Flash持平。

阿里Qwen3.8-Max:暂无成绩。 截至目前,AA尚未完成对它的评测。其上一代Qwen3.7-Max的验证成绩是56.6分——这是该家族唯一的第三方参照。

这张表透露了两件事。第一,中国最强的模型已经摸到了全球第一梯队的门槛:Kimi K3的57分与榜首的差距是3分,而一年前这个差距是两位数。第二,“官方最强”与“验证最强”是两回事——声称“仅次于Claude Fable 5”的Qwen3.8-Max,恰恰是头部模型中唯一还没有第三方成绩的。

第二条证据链:Arena盲测

Arena(arena.ai)的机制是人类盲测,两个匿名模型回答同一个问题,用户投给更好的那个,数百万张投票换算成ELO积分。它衡量的不是“考多少分”,而是“真人觉得谁更好用”。2026年8月第33周(8月10日-16日)的榜单,国产模型的成绩如下。

在综合榜中,Anthropic的Claude系列包揽前五。国产模型中,Qwen3.8-Max排第8(ELO 1491),Kimi K3 Max排第12(1489),是仅有的两家进入前十五的中国模型。这个格局值得细看,两家分差只有2分,在误差范围内基本并列,但Qwen3.8-Max的位置更靠前。

在代码榜中,Kimi K3 Max排第6(1544分),是排名最高的国产代码模型;Qwen3.8-Max排第13,小米Mimo排第25。

前端开发榜,是国产模型表现最突出的一个榜单。Kimi K3 Max以1674分排第2,仅落后榜首的Claude Opus 5 Max(1692分)18分;Qwen3.8-Max排第3(1667分);智谱GLM-5.2-Max排第9;DeepSeek V4 Pro新入榜即排第10。而一个月前Kimi K3刚发布时,曾以1679分短暂登顶这个榜单,那是国产模型第一次在Arena的实战榜单上拿到全球第一。

智能体榜中,Kimi K3 Max以10.60%的净提升度排第5,与Claude Opus系列同处全球第一梯队;Qwen3.8 Max新入榜排第11;GLM 5.2 Max排第14;DeepSeek V4 Flash排第19。

把四张榜单放在一起看,结论清晰。在Arena的体系里,Kimi K3 Max是中国模型中覆盖面最广、位置最高的那个——代码第6、前端第2、智能体第5、综合第12,没有一项掉出前十五;Qwen3.8-Max则是综合榜上位置最高的国产模型(第8),但在代码、智能体两个实战榜单上落后于Kimi

第三条证据链:SuperCLUE中文测评

SuperCLUE是中文场景下最具公信力的第三方基准之一。2026年7月的榜单上,12款国产主流模型的综合总分排名是:Qwen3.8-Max、Kimi-K3、豆包Doubao-Seed-2.1-Pro与DeepSeek-V4-Flash。

第一和第二的分差很小,但顺序明确。在中文综合能力上,阿里的Qwen3.8-Max排第一。 这与它在Arena综合榜(第8,高于Kimi的第12)的表现互相印证。

值得注意的是第三、第四名。字节豆包2.1-Pro在中文综合测评中排第三,是“五强”中唯一没有参加Arena国际盲测的模型,它的能力在国内榜单可见,在国际坐标系里缺失。DeepSeek排在第四,它曾经的领跑者位置,已经让给了后来者。

编程专项上,SuperCLUE给出了另一个答案。GLM-5.2以64.13分断层领先,Kimi K2.7-Code得55.43分。智谱是一家典型的“偏科生”,单项编程全球第一(它还在国际Code Arena和Design Arena上拿到过第1),综合能力却排不进国内前四。

五家画像:各强的维度

在逐一画像之前,先把五家旗舰的硬规格放在一起,因为2026年夏天是这五家在六周内密集发布前沿模型的第一个夏天:6月中旬智谱GLM-5.2,7月16日Kimi K3,7月19日Qwen3.8-Max预览,7月27日Kimi K3开源,7月31日DeepSeek V4 Flash 0731,8月3日Qwen3.8-Max正式版。

三个事实值得注意。第一,百万token上下文已经是旗舰标配,不再是差异点——五家全部支持。第二,2万亿参数级的模型全部选择开源(MIT协议),这是中国公司对全球开源社区的集体贡献,也是对美国闭源路线的差异化竞争。第三,同为旗舰,输出价格差了50倍——这个价差本身就是商业模式的选择:Kimi K3用最贵的价格匹配最强的推理密度,DeepSeek用地板价换取Agent高频调用市场。

把三条证据链交叉对照,2026年8月中国大模型五强的真实位置,可以这样描述。

月之暗面Kimi K3,验证维度上的中国第一。7月16日发布,7月27日开源,2.8万亿参数、104B激活,是人类历史上参数规模最大的开源模型,也是全球第一个原生支持文本、图像、音频、视频四模态的万亿级开源模型。它的第三方成绩单是所有国产模型中最完整的,AA智能指数57分(开源史上最高、全球第4、超过Claude Opus 4.8),Arena前端第2、代码第6、智能体第5,SuperCLUE中文第二。第三方评测机构FireworksAI在1030个真实Agent任务上的实测显示,Kimi K3的表现接近Claude Fable 5,成本约为其1/50。短板是贵,输出定价100元/百万token,是DeepSeek V4 Flash的50倍。

阿里Qwen3.8-Max,中文综合与生态上的第一。2.4万亿参数、95B激活,8月3日正式版发布。它是SuperCLUE中文综合第一、Arena综合榜国产最高(第8)。但必须指出,它的国际验证成绩单目前是空白的。AA智能指数未评测,官方基准(电商模拟4.16倍回报、16天自主编程265次提交等)全部来自阿里自己。它真正的护城河在别处,Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚,这是其他四家都没有的资产。

深度求索DeepSeek V4,是推理与性价比之王,但已被反超。2025年初,DeepSeek R1以极低的训练成本逼近当时OpenAI的顶级模型,在硅谷引发震动,英伟达当天股价大跌,全球第一次正视中国大模型。那是DeepSeek的高光时刻,也是中国大模型行业的高光时刻。此后一年半,DeepSeek的节奏慢了下来:V4今年4月24日发布,中间四个月没有重磅更新,7月31日的V4 Flash 0731和8月中旬的V4 Pro更新才重新回到牌桌。它的底子仍在——8月中旬一项对8款主流模型的独立横评(API实测)中,DeepSeek V4 Pro以9.1分排在所有国产模型之首,全场仅次于Claude Opus 4.8(9.20),推理单项9.5分超过GPT-5.6,“识别条件不足、知道何时不该下结论”的能力被评为全场最强;SWE-bench Verified约80.6%是国产模型中可查证的最高标准化跑分。V4 Flash(284B/13B激活)把输出价格压到2元/百万token,约为Claude Opus的1%,是Agent高频调用场景的默认选项。但它的AA智能指数是50分,综合排名已被Kimi K3(57)和Qwen3.8-Max甩开,从2025年的全球领跑者,变成了2026年的追赶者。这个故事本身是中国大模型竞争烈度的注脚,在这个行业,停止迭代一个季度,就可能从第一梯队掉队。

智谱GLM-5.2,编程特长生。约744B参数,MIT开源,基于华为昇腾训练,这在2026年的语境里有特殊的战略意义。它在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第1,SuperCLUE编程专项断层领先。但综合能力(AA 51分、Arena智能体第14)与第一梯队有明显差距,独立横评中它的推理任务表现甚至出现过翻车。

字节豆包2.1-Pro,用户规模第一,国际验证缺位。SuperCLUE中文综合第三,响应速度全场最快(首字延迟约380毫秒),背靠豆包App国内最大的AI用户盘子。字节内部正在推进五万亿参数超大模型的前期论证。但它缺席Arena国际盲测,AA指数也查无此模型。一个不在国际考场出现的考生,无法参与“全球坐标”的排名。

直接回答这个问题

三条证据链摆完,可以正面回答“中国最强的大模型到底是谁”了。

如果以第三方验证的完整性和强度为标准,答案是月之暗面的Kimi K3。它是目前唯一一个在所有主流国际评测体系中都有成绩、且成绩全部进入全球前列的中国模型:AA智能指数57分排全球第4(这是中国模型乃至所有开源模型的历史最高位),Arena四个实战榜单三项国产第一、一项前三,FireworksAI实测接近Claude Fable 5。它是全球开发者社区用脚投票选出来的中国冠军——在Hugging Face上,2.8T的Kimi K3开源当天即登顶趋势榜。

如果以中文综合能力为标准,答案是阿里的Qwen3.8-Max。SuperCLUE总分第一,Arena综合榜国产最高。它在中文语境下的综合表现目前没有对手,加上Qwen家族全球第一的开源生态,它是产业渗透角度的隐形第一。但需要保留一个判断,它的国际标准化成绩单还空着,官方“仅次于Claude Fable 5”的说法目前属于“厂商主张”,等待第三方验证。

所以最诚实的表述是,中国大模型的第一梯队是一个双雄格局,Kimi K3与Qwen3.8-Max,前者赢在国际验证,后者赢在中文综合与生态。两者身后,DeepSeek V4、GLM-5.2、豆包2.1-Pro构成第二梯队,分别在推理、编程、用户规模上各握一张单项冠军的牌。

这像极了2026年全球格局的中国版,美国是Anthropic与OpenAI的双雄(60分与59分),中国是月之暗面与阿里的双雄(57分与待验证)。真正的差距在第三名之后,美国的第三名谷歌与国际前二的差距远小于中国第三名与前二的差距。

对普通使用者而言,这个结论可以再翻译得直白一些。按场景选,比按“谁最强”选更接近最优解。写代码、做前端、跑Agent,Kimi K3是当前国产验证成绩最好的选择;中文写作、超长文档、综合办公,Qwen3.8-Max更稳;高难度推理和数学,DeepSeek V4 Pro的实测表现仍是国产最强;预算敏感的高频调用,DeepSeek V4 Flash的性价比没有对手;要本地部署、数据不出内网,可选开源的Kimi K3、GLM-5.2或Qwen家族。“没有全能王,组合使用优于单押一个”——这是那项独立横评的结论,也是大多数深度用户的真实用法。

“人人第一”是怎么造出来的

回到开头的问题:为什么中国会出现“每家都第一”的乱象?拆开看,每家的说法在技术上都不算撒谎,它们只是选择了对自己最有利的坐标系。

阿里说“盲测仅次于Claude”,用的是Arena综合榜(第8,前面的7个里有5个是Anthropic和谷歌的模型,国产中确实是最高的);月之暗面说“全球最强开源”——用的是参数规模和AA指数(在开源这个类目里确实第一);智谱说“全球第一”,用的是Code Arena(编程单项确实第一过);DeepSeek说“SWE-bench 80.6%”,用的是单一标准化基准(确实可查证);字节说“金牌、全球领先”,用的是竞赛成绩和自建基准(HLE-Text 54.2分确实是该基准的最高分,但该基准样本极少)。

这套话术的完整公式是,换一个坐标系,就换出一个第一。坐标系可以按能力维度切(推理、代码、写作、多模态),按语言切(中文、英文),按规模切(开源、闭源、万亿级、百亿级激活),按价格切(同价位最强),甚至按硬件切(国产芯片训练的最强)。切法是无穷的,第一也是无穷的。

美国行业也存在营销,但压制营销的是两股力量。一是Artificial Analysis、Arena这类成熟第三方评测机构的存在,它们的榜单被投资人和企业采购方当作决策依据,厂商绕不过去;二是开发者社区的舆论场,一个模型发布后几小时内就会在开源社区和社交媒体上被真实任务检验,名不副实的宣称存活不了48小时。中国的评测基础设施(SuperCLUE、OpenCompass等)正在补齐,但公关宣传的音量仍然大于榜单的音量。

一个可以参考的判断习惯是,看任何一个“第一”的宣称,先问三个问题。这个第一是在哪个坐标系里?这个坐标系是谁定义的?同一坐标系里排第二第三的是谁?三个问题问完,大部分“第一”会自动现出原形。

差距与时间窗

最后说一个容易被发布会掩盖的事实,中国第一与世界第一的差距,目前是3分(AA指数57对60),但这个数字背后的差距比看起来大。

Kimi K3超过的是Claude Opus 4.8——Anthropic的上一代模型。它面对的Claude Fable 5、GPT-5.6 Sol,以及Anthropic在8月密集发布的多款opus-4系列新模型,仍在快速迭代。Arena第33周的榜单上,综合榜前五名全部是Anthropic的模型,这个集中度本身就是差距的体现。

但另一面同样成立,中国模型从“落后一个身位”到“3分之差”,只用了一年半。2025年初DeepSeek R1让全球第一次正视中国模型,2026年年中Kimi K3成为全球前五中唯一的非美国模型、并且是开源的。在开源这个半场,格局甚至已经反转,全球最强的开源权重模型(Kimi K3)、下载量最大的开源家族(Qwen)、生态最活跃的开源社区,全部在中国。

这场追赶背后还有一个不太出现在排行榜上、但决定长跑胜负的变量:算力。GLM-5.2基于华为昇腾训练,是首个在国际榜单登顶的国产芯片训练模型;DeepSeek的架构设计从V3开始就以“单位算力产出最大化”为第一原则,用稀疏激活和算法优化把成本压到同行难以理解的水平;Kimi K3和Qwen3.8-Max的万亿级训练同样完成于国产算力占比持续提升的集群之上。在美国对高端GPU出口持续收紧的背景下,中国大模型的这轮进步是在算力约束下取得的,这意味着它不是靠堆资源堆出来的峰值,而是效率创新的产物。效率优势的缺点是天花板可能更低,优点是可持续、可复制。

还有一个维度的差距常被忽略,商业模式与生态。Anthropic与OpenAI的领先不只是模型分数,还有Claude Code、ChatGPT这类被全球开发者每天高强度使用的终端产品形成的真实数据飞轮。中国模型在API与开源生态上进展极快,但全球级别的终端产品还没有出现,豆包的用户盘子主要在国内,Kimi和Qwen的海外用户仍以开发者为主。分数可以三个月追平,产品与生态的差距需要更长时间。

所以“中国最强的大模型是谁”这个问题的完整答案,还应该加上一层时间维度。按当下的第三方验证,是Kimi K3;按中文综合与产业生态,是Qwen3.8-Max;而三个月后这个答案可能就要重写,Qwen3.8-Max的AA评测、DeepSeek的下一代、字节的五万亿参数模型与智谱的下一版模型,都在路上。

这不是和稀泥。模型行业的一个基本事实是,领先窗口以月计算。2025年初是DeepSeek R1的时刻,2026年年中属于Kimi K3和Qwen3.8-Max。真正不变的结论只有一条,能被全球第三方榜单反复验证的那个名字,才是当下真正的第一。到今天为止,这个名字是Kimi K3。下一个是谁,让榜单说话,而非听各个大模型厂自说自话。

简体中文 English