平均6天一个新旗舰!大模型更新快到人类跟不上了
来源:凤凰网 8 小时前

新智元报道

太疯狂了,短短两天,竟然冒出了4个新模型!

前脚,老马的xAI才刚发完Grok 4.7。

紧接着,OpenAI突然甩出GPT-6 Sol和Luna,价格直接腰斩。同一天,Anthropic也把Claude Opus 5.5拍在了桌上,比上一代硬生生便宜40%。

9月22日,一张动图在X上被转疯,浏览量狂飙近百万。

2023年,大模型73天一更,到了2026年,18天一更。

从ChatGPT上线算起,OpenAI和Anthropic已经狂轰滥炸了42个重磅模型(算上当天发的GPT-6 Sol和Luna是44个)。

几小时后,Stability AI创始人Emad Mostaque转发了这张图,还加了一句预言。

「就像Alex说的,照这个速度,明年年初就是每天一个。」

两大巨头,卷出「半月一更」

其实,「18天一更」这个数还算保守,因为它只算了OpenAI和Anthropic两家。

今年初到9月22日,Anthropic发了8个旗舰模型,OpenAI发了6个,14个模型摊进265天,平均19天一个。

同一时间段里,国内十家主要大模型厂商又发了至少28个旗舰,平均9天多一个。

有几回还是扎堆发的,春节前一周,4家接连甩出新旗舰;4月20日到24日,5天里又是4家轮番上阵。

两边加在一起,平均6天多就冒出一个新旗舰,离Emad说的「一天一个」已经不算远了。

Anthropic的提速肉眼可见。

上半年它平均46天发一个模型,下半年压到了26天。Opus 4.8是5月28日,Opus 5是7月24日,Opus 5.5是9月22日。

OpenAI走的则是「憋大招,然后一套带走」的路线。

9月3日GPT-6 Astra刚把全网炸翻,才隔了19天,Sol和Luna就跟着下场。

下周还有DevDay大会,Altman感慨,这是他记忆里OpenAI头一回在备战发布会时喊出「要发的东西太多了」。

发布为什么越来越密,Anthropic在一份报告里给出了答案,AI已经在帮着造下一代AI。

今年2月,Claude能独立主导的AI研发工作还不到1%,之后几乎一个月上一个台阶,5月12%,7月22%,到了8月已经达到了26%。

OpenAI那边,截至8月中旬,AI智能体投入的工作日,已经是人类研究员的3.1倍(按每天8小时折算)。

在Anthropic,造模型的活,四分之一已经交给了Claude自己。下一个模型,只会一个接一个地来。

排队的已经堵到了门口。Anthropic的Mike Krieger放话,Sonnet 5.5和Haiku 5.5未来几周就到。

谷歌的Gemini 4早在7月就开始了「迄今最有野心的一次预训练」,外界普遍押在年底前后亮相。国内也至少有两家官宣了下一代旗舰,只差一个发布日期。

辛辛苦苦攒的「玄学」

两个月直接报废

大模型跑得越快,在下游写代码的人就越狼狈。

你7月底熬了几个通宵,刚把应用迁到Opus 5,参数一项项调得如丝般顺滑。两个月后Opus 5.5横空出世,你满心欢喜地一换接口——咔,一部分请求直接报错。

把这两家最近的官方提示词指南翻一遍,会发现他们在传达同一个事实,你给上一代模型写的那些祖传Prompt,很多都成了废纸。

头一件事是做减法。

OpenAI在Astra指南里明说,以前太细的流程指令,现在反而会拖后腿,「改代码前先通读文档」「切记跑测试」这种话,统统可以删掉。

Anthropic的指南也是这个意思。

以前的提示词里常要加一句「做完检查一遍」,可Opus 5已经会自己检查,这句不删,它反而会过度检查。

到了Opus 5.5,聊天场景里「回答前仔细想想」这种PUA话术也建议删掉,删了之后回复快了,质量也没有明显下降。

删完旧的,还得补新的,因为每一代都有新脾气。

Opus 5.5在多轮对话里老爱回头琢磨已经答完的问题,白白浪费算力,官方给了一句补丁,「已经答过的,就当过去了。」

参数和默认值也在悄悄变。

在Opus 5.5上,关掉思考模式的写法直接报错400;不写effort参数,默认档位从high降到了medium,成本和效果跟着洗牌。

对此,官方的建议是重新跑一遍effort测试,别把Opus 5的老设置直接搬过来。

一套提示词加一套参数,每一代都得扒层皮。调没调过,账单能差出一大截。

Anthropic的Lance Martin在视频里演示过,一份给Opus 4.8写的老提示词,每张工单成本2.45美分,直接换上Opus 5.5是2.02美分;再用官方工具洗一遍,准确率拉到92.0%,成本压到了1.83美分。

除了这些,模型本身的寿命也在缩短。

今年OpenAI已经发了9次弃用公告,涉及40多个模型和功能。

其中,4月23日刚发的GPT-5.5,10月14日就要从ChatGPT和Codex下架,活了不到半年。

甚至,就连OpenAI自家的Evals评测平台,也要在11月底关门。

刷榜?一套新考题,半年就被锤穿了

人跟不上就算了,现在连「考卷」都不够用了。

今年3月,号称专治AI、考智商不考背题的ARC-AGI-3上线。当时排第一的Gemini 3.1 Pro只拿了0.37%,人类是100%。

9月3日,GPT-6 Astra杀进考场,标准测试拿下62.7%,换上特定框架直接到了99.9%。在96%的关卡里,它用的步数比人类还少。

一套新考题,半年就被打穿,ARC官方已经开始琢磨下一代评测该怎么出。

写代码榜单(Next.js)上,Sol、Opus 5.5和Fable 5.1全是97%,并列第一;写作榜单上,Opus 5.5断层领先第二名307分。

这一分数是榜单有史以来最大的一次单次跳跃,博主看完直呼离谱,差点以为是自己的基准出了bug!

新模型每来一个,开发者就得像西西弗斯一样,把测试流程从头再推一遍。

照现在这个节奏,明年要是真到了「一天一更」的地步,你今天调好的提示词、配好的Agent链路,寿命可能都撑不过一个星期。

模型换代的速度,第一次彻底超过了人类适应它的速度。

如今跑得最慢的,竟然是使用AI的人。

简体中文 English