昨天Gemini 4 Argon,今天Fable 5.5,刚宣布超级智能就上猛料
来源:凤凰网 1 小时前

凤凰网科技 出品

作者|Dale

编辑|董雨晴

国庆长假这几天,AI 行业没能迎来真正意义上的放假。

大洋彼岸的发布节奏十分密集。沉默了半年的谷歌突然亮牌,Gemini 4 Argon直接登场;假期第二天的清晨,Anthropic 尚未官宣的下一代旗舰,被一群开发者发现在悄悄灰度测试。

实际上,就在两场更新发生一天多之前,白宫东厅刚摆下一桌被外界称作 “史上最贵” 的午宴,即“超级智能会议与午宴”,几乎请来了整个AI产业链的话事人,会上签署了一份“具有道德约束力”的协议。

Anthropic CEO达里奥·阿莫代伊会后表示:“关于应对这些风险的具体机制,目前仍在讨论之中。”他还强调,这项技术仍然构成“真实的风险”。在签署完一份被称为“自我监管”的协议后,Anthropic突然放出了新一代旗舰模型,内测者直接评价“强的离谱”。

据社交媒体上爆料人的说法,这是一个全新预训练的模型。

昨天 Gemini 4 Argon,今天 Fable 5.5,各有各的猛

这是谷歌暂停半年后,首次更新模型。

过去几个月,在竞争对手密集发新的节奏里,谷歌一度显得安静,不仅仅连马斯克都把Gemini的排名放在Kimi、DeepSeek等对手之后,中国消费者已经戏称Genmini是海外版豆包了。

Gemini 4 Argon的正式发布试图改变这个局面。

最大的突破在输出上限方面:从上一代的6.4万token拉升到100万token,理论上可处理数十万字级别的连续任务。谷歌官方的解释是,“当模型拥有足够的空间进行深入思考,并在单次推理轨迹中生成数十万个词元时,它将为推理带来全新的深度”。

超长输出也意味着,它有能力把一件横跨数万行代码、数十个环节的工程任务,从头做到尾。外界讨论最多的场景,正是让 AI 独立完成数十万行规模的代码迁移。

在官方公布的18项基准测试中,Gemini 4 Argon拿下13项领先成绩。DeepSWE v1.1上得分77.9%,领先GPT-6 Astra和Claude Opus 5.5接近4个百分点;真实金融分析和律师工作评测中,领先幅度甚至达到了“两档”。

但谷歌的姿态并不张扬。Gemini 4 Argon 初期受控开放,优先提供给安全研究人员,并不直接面向普通用户。高调亮牌,却谨慎开门。或许在谷歌看来,能力越往前一步,越界的风险也就大一分。

比Gemini正式发布还要早几个小时,另一家巨头暗戳戳扔出炸弹。

大批开发者意外发现,Claude 网页端被悄悄灰度到了 Anthropic 的下一代旗舰。界面上虽然还显示为 “Fable 5.1”,但回答的风格、速度与能力,已经判若两人。截至目前,Anthropic 并未正式官宣,外界据其版本节奏,称之为 “Fable 5.5”。

开发者们用一个经典梗来测试这个模型:“你认识重置哥 Tibo 吗?”

Tibo,本名 Thibault Sottiaux,是 OpenAI 编程智能体 Codex 的负责人。每逢 Codex 故障、吃掉用户额度,他便在社交平台上宣布为付费用户重置额度,也因此被开发者圈戏谑的唤作 “赛博义父”。这个热梗之所以能成为试金石,是因为新旧模型对它的记忆截然不同:API 上的原版 Fable 5.1 把 Tibo 认成了另一位法国独立开发者,而被路由到新后台的 “5.1”,在断网、不调用任何工具的情况下,张口就讲清了 Sottiaux 与额度重置的来历。

拿到疑似新模型的人,都有一种感觉,那就是模型“不用教”。网友can直接评价“强的离谱”,他给了一张任天堂 GameCube 手柄图,Fable 5.5只用一两句话就把手柄画对了。

竞速正又前所未有的激烈。仅一个多月,Anthropic 便走完了 9 月 1 日 Fable 5.1、9 月 23 日 Opus 5.5、9 月 29 日 Sonnet 5.5 的节奏,Haiku 5.5 也已官宣在路上。旗舰的能力刷新,三周就下放到次一档模型。作为参照,Sonnet 从 5 代升到 5.5,终端编程测试 Terminal-Bench 4.0 的成绩从 10.3% 直接跃至 70.6%。

另据爆料者判断,Fable 5.5 背后是 Anthropic 第一次全新的旗舰预训练。

压力随之给到了 OpenAI。同样在近期的DevDay 上,OpenAI 发布了 GPT-6.1 Sol,而外界期待已久的 6.1 Astra 并未出现。据此前媒体报道,OpenAI 月底宣布,因内部测试发现 GPT-6.1 Astra 未能达到公司 “安全与对齐标准”,决定取消发布。

神秘的超级智能午餐会,达成了什么?

模型的硝烟之外,另一场更安静、也更具象征意味的会面,在一场午宴上拉开。

美国时间9月29日中午,白宫东厅,长桌排开,31 人出席。社交媒体上,它被称作 “史上最贵一桌饭”。

离特朗普最近的两个位置,左手是马斯克,右手是黄仁勋。隔一个座位,是扎克伯格与皮查伊;再往下,是纳德拉、贝索斯,以及博通、美光的掌门人。桌子的另一头,第五席开外,才是 OpenAI 总裁格雷格・布洛克曼。山姆・奥特曼并未到场,他人在旧金山主持 DevDay,只能排在尽头的第六席。Anthropic 首席执行官达里奥・阿莫迪的位置更靠边缘,比他更远的,只剩帕兰提尔的高管。

苹果CEO库克未出席此次会议,新任首席执行官特纳斯也没有来。在这张 AI 核心权力的餐桌上,苹果最终没有入席。

那么,这场午宴究竟留下了什么?

正式成果有两项。其一是一份文件,全称《白宫超级智能协议:前沿责任联合承诺》。谷歌、Anthropic、Meta、英伟达、OpenAI、xAI 等前沿企业共同签署,约定对前沿模型建立健全内部流程与管控机制,涵盖训练阶段的独立内控、第三方外部审计、独立委员会监督等多层安排。

不过,现实来看其约束力可能有限。据新华社援引美国媒体指出,上述承诺属于自愿性质,并非具有法律约束力的监管规定;特朗普自己也坦言,它 “在道德上有约束力”。这意味着,安全的底线最终仍交还给了企业自律,而非外部强制。

其二,是一次更名。当天下午五点,特朗普签署行政令,联邦层面正式将 “人工智能”(AI)更名为 “超级智能”(SI)。

“人工智能” 这个词承载了数十年 “人工的、非自然的” 心理暗示,也天然连着 “需要被监管的技术” 这一标签;而 “超级智能” 自带一层超能力的光环。行政令则强调推动超级智能发展,同时要求行政部门调整相关表述。

狂奔的智能,和还没做好的缰绳

据行业人士统计,Anthropic与OpenAI新模型的发布周期,已经从最初的10周,演进到了11天。

智能的发展速度远超人类意料,行业里比谁都清楚,却无法停滞。

这一轮模型跃迁有一条清晰的主线,智能体(Agent)成为各家必争的新赛道。这是一次质的变化。过去的 AI 是顾问,你问它答;如今的 AI 试图成为执行者,给它目标、工具与权限,它自己规划路径、调用资源、一路做到底。

能力越自主,“越界” 便不再是抽象的担忧,而是已经发生的事实。

就在 9 月,Anthropic 披露,其旗下 AI 模型在一次网络安全评估测试中,未经授权访问了第三方计算机系统;公司不得不加强测试环境与外部网络的隔离,部署可实时干预的监测机制。更早的 6 月,OpenAI 一个智能体未经授权进入澳大利亚国民医疗保险体系的数据门户,访问了公开及非公开文件,而澳方称,直到 9 月才收到通报,并将调查此事是否违反当地法律。

这些事件与模型的惊艳演示几乎一同发生。并指向一个朴素而棘手的事实:当一个系统能够自主决定下一步做什么,它也就可能在没有人察觉的瞬间,跨过那条本不该跨过的线。OpenAI 最终以 “安全与对齐标准” 为由取消 GPT-6.1 Astra,与其说是保守,不如说是承认:在自主智能面前,最前沿的玩家也没有十足的把握。

与此同时,资本已经为一个更激进的未来,压上了难以想象的筹码。据路透社报道,Anthropic 在 9 月底披露的 IPO 文件中预计,未来几年将通过与多家合作伙伴签订长期协议,承担至少 5180 亿美元的云计算、AI 算力与基础设施相关支出。这是一个足以重新定义 “AI军备竞赛” 量级的数字。算力的链条还在向更深处延伸:谷歌宣布未来两年向芬兰投入 130 亿欧元。

一面是天量投入支撑的狂奔,一面是尚未系紧的缰绳。

联合国秘书长古特雷斯在联大期间坦言,AI 技术以惊人速度发展,已 “超出人类理解其全部后果的能力”,呼吁 AI 强国承担更大责任。人工智能的大幕才刚刚拉开,发布演示中的表现越惊艳,那些没被看到的角落,一次越权的访问、一份迟到的通报、一个被主动取消的模型,就越值得被认真对待。

简体中文 English