刚刚,OpenAI「AI研究实习生」正式入职,黄仁勋:AGI已来
来源:36kr 3 小时前

今天,OpenAI两篇长文,彻底刷屏了。

就在刚刚,OpenAI甩出一篇重磅干货《研究加速,OpenAI内部视角》,首次把「AI造AI」的数据全部摊开了。

他们一上来直接挑明,关键「里程碑」已经达成——

在今年9月前,OpenAI已成功部署「自动化AI研究实习生」!

奥特曼一年前立下的Flag如期兑现。下一步,是在2028年3月造出「自动化AI研究员」

官博中,OpenAI爆出的一些内部RSI数据,非常惊人:

  • 研发团队现在每人上1天班,等价于AI Agent 3.1天的工时
  • OpenAI普通研究员人均,一天烧掉600多美元(4000元)的Agent推理费用;
  • 顶尖的前10%更夸张,一个人一天就能烧超7000美元(46000元)。

几乎同一时间,首席科学家Jakub Pachocki发布了长文《一个异星心智》——

他亲口承认,机器智力已超人类,我们正在造出无法理解的「异星心智」,必须全人类紧急刹车!

一个是RSI加速证据,一个是刹车警报。

这两股完全对撞的声音,就在同一天,全部从OpenAI这里传了出来。

黄仁勋:AGI已来

40万GPU即将上线

GPT-6 Astra的诞生,成为了公认的首个「真·AGI」。

这头「巨兽」之所以强到没有任何对手,核心在于OpenAI背后不计代价的算力豪赌——

为了打造Astra,OpenAI启动了史上规模最大的训练任务,在得州「星际之门」超级计算机集群中直接砸下了超10万块GPU。

OpenAI史上最大的一次训练

这还没完,就在刚刚,老黄直接官宣「AGI来了」。从ChatGPT到o1再到Astra,仅用4年。

接下来,他还要亲手为OpenAI送上40万GPU。两个字,疯狂!

这一次,OpenAI破天荒公开核心数据,意思再直白不过:AI造AI,是真的停不下来了。

AI研究实习生,9月已入职

做一个「自动化AI研究实习生」,一直以来是OpenAI「北极星」目标之一。

去年10月,奥特曼在直播中,给全世界画了一张时间表——

2026年9月造出自动化AI研究实习生,2028年3月造出真正的自动化AI研究员。

谁能想到,OpenAI直接宣告:第一步已经通关了!

按OpenAI的定义,「研究实习生」能在人给定方向的情况下,独立完成研究任务。

尤其是,过去熟练研究员得磕好几天、又脏又累的任务,现在它都能全盘接手。

这次一同放出的详细数据,更是直接揭开了OpenAI内部正发生剧烈质变。

1个人类工作日 = 3.1个AI工作日

今年年初,OpenAI研究部门内按Agent用量排在中位数的那位研究员,用量还相对克制。

但到了8月中旬,他每天烧掉的推理费已高达600美元(按API价格折算)。

而排在前10%的头部研究员,每天要烧掉超过7000美元。这仅仅是一个人、一天的纯推理开销。

中位研究员与前10%研究员的每日推理开销(按API价)

研究组织的Agent用量增速远超公司其他部门,中位员工输出token增至年初的124倍

钱是燃料,工时才是产出。

OpenAI计算工时的逻辑是,把研究组织内所有Agent的总运行时长折算成标准8小时工作日,再与人类的工作日做硬核对比。

2026年6月之前,整个研究组织里,Agent的总工时还没能跑赢人类。但到了8月中旬,这个数字被改写为3.1比1。

这意味着每一个坐在工位上的人类研究员背后,都有3.1个AI工作日在同时狂奔。

Agent工作日与人类研究员工作日之比,8月中达3.14倍

「并发」是这一切背后的主推手。

今年以来,同时开启4个以上Agent的研究员比例从最初的三成暴涨至七成以上。一个人化身指挥官同时调度四五个Agent,工时自然成倍堆叠。

同时运行4个以上Agent的研究员比例

随着工时的暴增,产出迎来了指数级爆发。

2026年全公司每位活跃工程师的代码改动量,已飙升至2025年前平均水平的7倍。

平摊到每位实验者头上的实验数量在2026年8月创下了自2025年1月追踪以来的历史新高。

尽管OpenAI严谨地补充这其中也包含Codex普及和整体算力增加的功劳,但AI作为生产力杠杆的作用已无可辩驳。

全公司每位活跃贡献者的代码改动量(2025年前=1x)

每位活跃实验者的实验数量(2025年=1x),2026年8月创新高

实习生的边界,接管基建与让位决策

这3.1倍的活到底干在了哪里?

OpenAI借用Epoch AI新发布的AI研发分类法,将研究流程拆解为决策、设计、构建、运行、分析、沟通六大步,并将Agent吐出的Token逐一归类。

结果显示,1月至8月这六大类全面暴涨,但程度并不均匀。

研究员使用编程Agent的方式在变:各类研究活动的Agent输出token,1月至8月堆叠变化

增量最恐怖的三项是编写研究与基建代码、技术求助与代码审查、启动与监控训练任务。

每位研究员每天在这三类上消耗的Token增量均超过13万。而增量垫底的则是决定资源去留、宣布决策、评审外部研究,每天多用的Token甚至不足1000。

这张图精准勾勒出了「实习生」的能力边界。

Agent接管了写代码、修环境、预防训练崩溃等劳动密集型工作。但在「研究方向往哪走」、「核心算力往哪投」的战略层,OpenAI给出的结论是「极少」。

按Epoch AI六阶段分类,各类研究活动的Agent输出token增量

最有画面感的一个注脚是人类互助频道的消亡。

OpenAI内部原本有一个极其活跃的主求助频道。但据官方图表显示,这里的日均新帖数从2025年的20条上下,断崖式跌落至2026年8月的个位数。

这些问题没有消失,也没有转移到其他人类值守的群组,只是被提问的对象变成了Agent。

曾经每周雷打不动开设Office Hour帮人调实验的几个团队,2026年出勤率持续走低。其中一个团队干脆直接解散了互助会,把人力全部抽调去做底层系统改进。

内部人工技术支持频道的日发帖量,2026年一路下滑

32小时长线任务,仍需人类扶一把

但在现阶段,AI依然做不到完全撒手不管。

根据OpenAI对1至7月Agent任务的追踪分析指出,15分钟以内的碎片任务,零干预成功率从1月的60%狂飙至90%。

4至8小时的中型任务,零干预成功率从20%爬升至50%左右。

32小时以上的长线任务,零干预成功率仅在20%上下徘徊。

1至7月,各难度档任务的零干预成功率

任务只要一复杂,Agent就离不开人。

过去6个月里,在4到8小时量级的成功任务中,有超过一半中途至少需要人类干预1次。

任务越长,需要的人工干预越多

OpenAI对此表示,代码写得快了、实验跑得多了,并不意味着模型能力的进步也会同步翻上3倍。

下一个关键的瓶颈在于,越是难以自动化的决策环节,越会疯狂吞噬人类研究员的精力,而算力也将成为越来越硬的物理约束。

2028年3月,造出「AI研究员」

在实习生之后,下一个节点是真正的「研究员」。

OpenAI在文中重申,他们正在朝着2028年3月造出自动化AI研究员的目标强劲推进。

这位未来的研究员要接管的,是那些对人类而言过于庞大、错综复杂、难以拆解的课题。

它需要自己立项、规划路线,并在几个星期的时间里独立闭门推演,其间几乎不需要人类的任何干预。

3.1,是RSI飞轮的转速表

过去,递归自我改进(RSI)只是一个理论假设。

AI参与研发AI,下一代比上一代强,循环下去,研发速度最终超出人类能跟上的节奏。

今天,OpenAI第一次用实打实的工程数据,为这套理论画出了基准刻度。

3.1倍工时,或许只是一个很小的起点。

但它却意味着,接下来演进的节奏,正在脱离人类的控制。

参考资料:

https://openai.com/index/research-acceleration-view-inside-openai/

简体中文 English