一水 发自 凹非寺
量子位 | 公众号 QbitAI
现在就预告了——中秋和国庆的13天假期,可能会是今年AI圈最忙最炸的两周。
盆友,别休了,别睡了,找好椅子瘫坐吧。
基模决战周,真要来了!!
硅谷那边已经暗流涌动。
Anthropic的新Claude,灰测动静早就传得沸沸扬扬。
谷歌更是直接,Gemini 4 Pro疑似已经披着马甲,偷偷混进Arena参加摸底考试了。
国内这边,全卡在假期前疯狂憋大招。
Kimi开始拿K3.1疯狂打哑谜,DeepSeek下一张Pro牌已经提前写进官方文档,Qwen4也直接亮出了新架构。
而擂台正中央,OpenAI月初才刚刚放出GPT-6 Astra——一款让OpenAI提前给AGI开香槟的基模。
好家伙,这架势整得像大家提前约好了一样:
该来的、可能来的、偷偷摸摸已经在考场里的,全赶到了一块儿。
节前最后一舞,Are you ready?
硅谷集体围攻OpenAI GPT-6 Astra
硅谷这边,A社、谷歌、马斯克的Grok几乎都有新动作传出。
A社Claude 5.2箭在弦上
最先坐不住的自然还是A社。
路透社最新爆料已经确认,Anthropic正在考虑推出一款新模型,只是最终什么时候发、叫什么,还没公开。
社区里呼声最高的是Claude Opus 5.2和Fable 5.2。
这两款模型之所以被社区盯上,主要还是因为最近冒出来的一系列灰测信号。
最早的线索来自Claude Code。
有开发者发现,自己明明选择的还是Opus 5,但部分复杂任务里的表现却和此前版本明显不同。
于是社区开始猜测:
Anthropic是不是已经在后台悄悄切换模型,把一部分请求路由到了新的内部checkpoint?
这个猜测很快被更多线索印证。
多位开发者反馈,原本调用Fable 5.1的请求,在后台被静默重定向到了新版本。
有人在高推理模式下实测,发现新模型的输出质量明显优于GPT-6 Astra,代价是速度更慢、成本更高。
最戏剧性的当属Opus 5.2的午夜惊魂。
9月17日晚间,Anthropic突然切断了Opus-Next(据传是Opus 5.2的内部代号)的灰度测试通道,活跃测试账号一度归零,开发者社区一片哀嚎。
但仅仅一天之后,灰测就重新上线,范围还从Claude Code扩大到了Chat和Cowork。
而这一系列动作的大背景是:
OpenAI月初发布的GPT-6 Astra,已经拿下了约13%的企业AI支出,Anthropic的Claude Fable则约为8%。
Anthropic选择在IPO前夕放出新模型的风声,很难说不是在抢回叙事主动权。
谷歌Gemini 4 Pro内测效果刷屏
更有节目效果的是谷歌。
最近Arena里出现了一个名叫gemini-3.8-flash的模型。
名字看着平平无奇,但不少测试者很快发现不对劲:
这玩意儿根本不像Flash。
众人一致推断,它很可能是谷歌下一代旗舰Gemini 4 Pro的隐身checkpoint,社区还流传其内部代号为Argon。
随后冒出来的一堆demo,更是直接把讨论度拉起来了。
AI圈祖传考题鹈鹕骑自行车,这次疑似Gemini 4 Pro的版本,不只是把鸟和自行车画出来,还进一步做成了带踩踏动作、光照变化和控制组件的完整交互页面。
相比普通3.8 Flash,复杂度肉眼可见地高了一截。
再比如画PS5 SVG,模型花了大约10分钟,直接用代码画出一套细节非常密的PS5矢量图,包含复杂曲线、阴影和机身结构。
测试者直接评价,这是自己从AI模型里拿到过最夸张的输出之一。
还有Voxel Pagoda(体素宝塔),这次模型直接搭了一个完整3D场景:
多层宝塔、地形、树木和周边环境一起生成,同时还保留了查看和灯光控制。
相比之前checkpoint,几何结构和整个场景的完整度明显提高。
以及一个传播很广的demo侧视家猫SVG,提示词非常简单:
画一只侧视的家猫。
测试者把疑似Gemini 4 Pro的结果和GPT-6 Astra Max、正式版Gemini 3.8 Flash摆在一起,主要看轮廓、四肢比例和空间关系(下图按此顺序)。
结果也因此在Reddit拿到了数百赞,成了这一波最火的对比图之一。
再往后,测试已经从SVG一路卷到了网页和3D场景。
有网友甚至用它做了一个奥特曼骑哥斯拉打怪兽小游戏:
SVG+HTML,鼠标点哪里就往哪里发射激光,还能加速。
当然,这些demo只能说明Arena里这个神秘checkpoint确实很能打。
它到底是不是Gemini 4 Pro,谷歌没官宣之前还得打个问号,但至少从测试密度来看——
下一代Gemini,已经离得很近了。
马斯克Grok 4.7正在烹制中
马斯克也没闲着。
此前有网友询问Grok 4.7进展,老马直接回复:
Grok 4.7 needs a few more days to cook.
掐指一算,也差不多这几天了。
不过按老马以前的风格,他一般是等其他人都发了再出现,主打一个黄雀在后(doge)。
买定离手,我先压一个。
国内热闹程度也不遑多让
国内这边,有人已经提前抢跑了——
就在刚刚,阶跃星辰突然发布新一代旗舰模型Step 5 Preview。
模型采用稀疏MoE架构,总参数600B、激活参数27B,支持百万Token上下文,并针对编程、Agent、专业知识工作等真实任务进行了优化。
在全球权威的Artificial Analysis Intelligence Index中,Step 5 Preview取得44分,位居全球开源模型前三,而且单任务成本仅为Claude Opus 5的1/8。
而阶跃刚把牌拍上桌,Kimi那边的谜底也已经快写脸上了。
最近其官方账号最近突然放出一串数字:415926535897932384626433832795……
乍一看像乱码,但把圆周率π拿出来对照一下就懂了。
π开头是:
3.1415926535897932384626433832795……
去掉最前面的3.1,剩下的刚好就是这串数字。
K3.1??好好好,是谁又悟了~(不过也有网友反手买,说这意味着没有3.1)
除了Kimi,DeepSeek这边也早就埋好了彩蛋。
9月10日发布DeepSeek V4.1 Flash时,官方文档里已经明确提到:
在V4.1 Pro上线之前,部分V4 Pro请求会被路由到V4.1 Flash。
换句话说,V4.1 Pro基本确定存在,只差什么时候翻牌。
而按以前发布节奏推测,V4.1 Pro最快可能会落在9月底到10月初这个窗口期。
Flash和Pro之间通常不会拖太久,此前V4系列发布时,Flash和Pro基本同步亮相。
更早的版本迭代中,轻量版本先行后,旗舰版本也往往会在数周内跟进。
再加上放假这个因素,一放假就发模型的戏码想必大家也不陌生了。
再往后是阿里Qwen。
阿里8月底开源Qwen3.8-Flash-Next时也把话挑明了:
这就是Qwen4底层架构的early preview。
而且官方强调,这次之所以提前把架构开出来,就是想让社区在完整Qwen4系列构建完成之前先行测试。
换句话说,Qwen4同样已经在路上。
现在,太平洋两岸的选手已经严阵以待,就看谁先出牌了。
当然,有新模型要发的要加班,没有新模型发的可能更要加班。
还讨论什么AI代替工作、AI自我进化RSI……咱这行一直都是一部分人铆足了劲,要么让另一部分人失业,要么让另一部分人加班。
十一假期,Are you ready?
参考链接:
[1]https://x.com/MaxForAI/status/2101254889296781439
[2]https://x.com/kimmonismus/status/2101268494901792968
[3]https://x.com/kimmonismus/status/2101226451861180711
[4]https://x.com/LuminaBench/status/2101359620472115598

