
跑分这事儿,最近有点不太对劲。
9月8日,分析机构SemiAnalysis连甩五条推文,直接点名谷歌和Meta两家万亿巨头——
Gemini 3.8 Flash和Muse Spark 1.3是「刷榜痕迹最明显的两个模型」。

证据,非常清晰。
在测Agent干活能力的Terminal-Bench 2.1榜单上,Gemini 3.8 Flash考了89.4分,在182个模型里高居第2,把GPT-6 Astra都压在了身下。
结果换到8月29日刚上线的Terminal-Bench 4.0,同一个模型只拿到19.1分,在14个测试对象里直接掉到第12,成绩当场打了个二折。
同一时间,GPT-6 Astra从88.4掉到57.7,好歹算个六五折。

仅仅27分钟后,Meta首席AI官Alexandr Wang亲自杀到评论区,开口直接甩出六个字,这是个愚蠢的论点。
他认为GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但没人说Sol在刷榜。
同时他还强调,Meta从没说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是它的性价比显然更高。

换张卷子,成绩直接脚踝斩
简单介绍一下,Terminal-Bench测的是Agent真实干活的能力。
方法是丢给模型一个终端和一个模糊目标,剩下的全让它自己看着办。然后,系统得自行规划路径、调工具、写脚本,报错了还得自己去改。
在已经被业界刷了大半年的2.1版本上,这俩的成绩确实好看。
Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。

好家伙,一个Flash级的便宜模型,一个主打性价比的Meta新作,双双把两家顶级实验室的旗舰按在地上摩擦。
然后,4.0版本来了。
新卷子一共66道题,不仅砍掉了8道已经被「刷穿」的旧题,大修了19道,还统统加上8小时的超时限制。
防作弊机制同样上了极高强度。
主办方不仅设了35条评分细则,还加了一轮专门的「对抗性作弊试验」,故意让Agent自己去试着钻奖励机制的空子,只要钻得通的题就会被直接毙掉。
新榜一出,画风突变。

Claude Mythos 5.1(max)拿到60.9分稳住阵脚,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别拿到37.3分和23.6分。
相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis给出的图表,Muse Spark 1.3的成绩是33.3分。
总结一下就是。
旧榜上,Gemini 3.8 Flash还能压着GPT-6 Astra打;新榜上,它的分连人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。
不用抄答案,买套「密卷」就行
吵架归吵架,SemiAnalysis第二条推的点名才是真正的行业内幕。
在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝对不会傻到直接拿原题去训练,但他们绝对会去买数据,专门买那些被设计得无限贴近TB 2.1题型的训练数据。最后的效果其实跟作弊没差。
而这,就是2026年刷榜的高阶玩法。

以前的「污染」套路很糙,直接把原题混进预训练语料让模型死记硬背。
这种事一查一个准,洗一遍数据成绩就得现原形。
业界在这上面栽过不少跟头,比如HumanEval近四成样本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,换套私有代码库重测,分数直接腰斩。
所以现在大厂不碰原题了,大家改买「长得像考题的模拟卷」。也就是提供给模型试错并给奖励的封闭任务系统。
目前,这已经是一门明码标价的成熟生意。
单个训练任务售价200到2000美元,复杂的软件工程任务甚至能开到2万。
要是想克隆一个网站做成UI训练场,大约需要2万美元。
如果要求复刻一个Slack量级的产品,那就是30万美元起步。
遇到要求独家买断的客户,价格还能再翻4到5倍。
根据Epoch AI的调研,Anthropic内部讨论过每年在这上面砸10亿美元。单季合同动辄六七位数,有研究员透露均价在30万到50万美元一季。
供给侧至少有35家公司在做这门生意,绝大多数是20人以下的初创团队。老牌数据巨头也全在转型,Scale AI在被Meta入股前营收就超14亿,Surge的ARR也逼近10亿。
现在的局面非常魔幻。
一边是完全公开的榜单题库,另一边则是成熟的卖题产业链。想让模型在某个榜单上考高分,真不用费劲作弊,直接掏钱下单就行。
既当卖题机构,又当监考老师
随后,SemiAnalysis直接点名了一家叫Datacurve的公司。
在专测长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash拿到73.8分排在第四。
被指控刷榜的两位,一个第一,一个第四。
想必,你已经发现了这背后的猫腻。
这个榜是Datacurve办的,而Datacurve赚钱的门路,恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。
DeepSWE不仅是Datacurve自家的基准,跑分用的还是它自己运营的评测环境。
既当卖题的辅导机构,又当出卷的监考老师,可以说是彻底坐实了。

榜单的保质期,所剩无几
最后,SemiAnalysis顺势给整个行业的公开评测下了一道判词。
他们觉得这说到底就是所有优质公开基准的宿命。TB 4.0也不例外,它现在看着还准,仅仅是因为它才发布了两周。
只要它的题目还是公开的,用不了多久就会被所有标榜「前沿」的实验室盘出包浆。

SemiAnalysis最终给出的解药非常直接,那就是多做高质量的私有基准。
方向是对的,但代价同样惨痛。
一旦评测全部私有化,公开榜单就会彻底沦为各家的营销通稿。
真正有区分度的真实成绩,只会在实验室和私有评测机构之间暗箱流动。
大厂当然乐见其成,毕竟闭卷考试谁也没法提前背题。
但对于广大开发者来说,那把用来公平丈量所有模型的公共尺子,恐怕再也找不回来了。
参考资料:
https://x.com/SemiAnalysis_/status/2097112791471522292
编辑:摩西
相关新闻
关键词:AI模型- Kimi突发K2.8:性能逼近K3,百万上下文全员开放
- OpenAI 将为美国政府机构提供 AI 模型五折优惠,终止每年 1 美元试点项目
- OpenAI模型对美政府涨价:1美元年费试点结束 改为半价优惠
- NASA 与 IBM 联合发布开源月球研究基础大模型,可识别月表冰区与撞击坑
- DeepMind 工程师反驳“谷歌搞不出前沿模型”:Gemini 3.8 Cyber 已在多项测试中优于 Mythos
- GPT-6数学封神,遭顶尖数学家公开质疑“算力截胡”?OpenAI内部研究员撕开Astra真相:人脑更容易被污染,而AI只看概率
- 面壁智能开源 MiniCPM5-2B AI 模型:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力
- OpenAI:客户对Astra的需求史无前例

