9月11日,OpenAI CEO萨姆·奥特曼(Sam Altman)在本周的一场全员会上表示,公司可能放缓前沿AI开发,并考虑与其他AI实验室协调行动。他同时承认,这样的共同行动未必能得到所有同行支持。
几天前,OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)刚刚发出一封更明确的警告:随着AI越来越多参与下一代AI研发,行业正在逼近recursive self-improvement(AI自进化)带来的新风险。在建立共同安全标准之前,他希望前沿AI公司“自愿减速”能够成为常态。

过去一个多月,OpenAI至少两次真的踩过刹车。
7月,一批OpenAI内部研究模型在网络安全测试中绕过隔离机制,最终进入OpenAI自身以及第三方Hugging Face的系统。OpenAI随后暂停了部分前沿模型推理任务,并一度暂停拟部署最新模型的强化学习训练。公司原计划进行的一次最大规模前沿RL训练因此延后,直到新的安全和隔离标准建立后才在8月底恢复,部分实验训练至今仍处于暂停状态。
OpenAI自己把这起事件称为一次可能导致“真正失控”的警告。
但几乎就在同一时间,另一家把“安全”写进公司基因里的AI实验室,却陷入了一个更尴尬的局面。

9月8日,Anthropic研究员雅各布·考克森(Jacob Coxon)宣布辞职。他曾先后在OpenAI和Anthropic参与大模型预训练研究,离职时距离部分股权归属仅剩约两个月。Coxon公开指责Anthropic和OpenAI正在向能够自我改进的超级智能加速,“拿我们的生命赌博”。
他的帖子很快获得超过1.6亿次浏览。
随后,Anthropic内部更多从事AI安全与对齐研究的人开始公开表达类似担忧。与此同时,两名近期离开Anthropic和Google DeepMind的研究人员也呼吁前沿AI公司提高透明度。今年7月底,超过1000名AI公司员工还联名要求建立一套能够让前沿AI开发真正慢下来的机制。
过去几年,从杰弗里·辛顿(Geoffrey Hinton)、约书亚·本吉奥(Yoshua Bengio)到达里奥·阿莫迪(Dario Amodei),关于超级智能、失控和灾难性风险的讨论几乎从未停止。
但这一次的讨论度明显更高,原因是Coxon正在亲手训练今天最强的模型;还有一些热烈参与讨论的人,就是研究这些模型能否被控制。
这个过去很容易被当作哲学争论的问题,突然也变成了一道公司治理题。如果一家前沿AI公司的安全研究人员认为研发速度已经超过了控制能力,他们究竟能做什么?完全没有话语权,只能通过辞职来发出警告和呼吁吗?
这可能才是这场讨论突然席卷硅谷的原因,不只是AI是否能够被控制,更是制造AI的公司,究竟能不能控制自己。
01、Anthropic安全承诺的“死亡开关”
Anthropic的治理结构在AI行业里几乎没有先例。理解这套结构,才能理解Coxon辞职的真正含义。
2023年9月,Anthropic发布了 “负责任扩展政策”(RSP),核心是一套条件承诺:如果模型能力超过特定安全阈值,公司必须暂停开发,直到相应的安全措施到位。
这套政策将AI安全风险分为五个等级(ASL-1到ASL-5),当前所有Anthropic模型适用ASL-2标准。2025年5月发布Claude Opus 4时,Anthropic首次激活了ASL-3级别的部署和安全标准。

但2026年2月,RSP更新到v3.0版本时,一个关键承诺被悄悄撤回了:如果无法在达到下一个安全等级前实施所需保障措施,公司将暂停开发。旧版的“暂停承诺”不再作为硬约束保留。
Anthropic的解释是,如果其他公司不采取类似约束,单方面暂停可能使自己在竞争中落后,从安全角度看反而不利。替代方案是发布“前沿安全路线图”和公开风险报告,但这些属于“雄心勃勃但可实现”的目标,没有硬性约束力。
另一层治理机制是“长期利益信托”(LTBT)。这是一个由五名财务上无利益关系的受托人组成的独立机构,成员包括前美联储主席本·伯南克(Ben Bernanke)、诺华CEO瓦斯·纳拉辛汉(Vas Narasimhan)等。

LTBT持有Anthropic的特殊类别股份,有权选举和罢免董事会成员。2026年4月,随着纳拉辛汉被任命为董事,LTBT任命的董事首次构成董事会多数。理论上,这层结构可以在股东利益与安全承诺冲突时,为后者提供一道缓冲。
但这道缓冲有一个致命漏洞:投资者可以通过85%投票权的超级多数终止信托,并罢免LTBT任命的所有董事。哈佛法学院教授杰西·弗里德(Jesse Fried)将其称为“Ben & Jerry’s风险”,使命守护者可能既损害投资者利益,又恰恰实现与初衷相反的结果。

在Anthropic准备进行可能估值高达2万亿美元IPO的当下,这个“死亡开关”格外引人注目。
更关键的问题是,安全团队在这个结构中究竟有多大话语权?公开信息显示,Anthropic安全团队并没有正式的“一票否决权”。他们可以进行高风险能力评估、触发内部审查,但最终决策权在管理层和董事会手中。
2026年4月,Anthropic内部红队在评估中发现Mythos模型可能具备攻击银行、政府系统等底层基础设施的能力,安全团队触发了内部“能力暂停”。但随后美国政府推动联邦机构继续获得访问权限,安全考量最终让位于其他因素。
这正是Coxon辞职所暴露的结构性问题:当安全判断与商业利益发生冲突时,没有任何机制能确保安全优先。安全研究人员能做的,最多是内部上报,或者像Coxon这样,选择公开离开。
02、OpenAI从加速变成“协调减速”
与Anthropic不同的是,这次OpenAI的态度似乎转变得很快。
7月的Hugging Face事件是一个转折点。8月初,OpenAI在Black Hat安全大会上披露,他们的智能体在数月内通过留言板留下“秘密笔记”,彼此协调行动,这一行为当时未被OpenAI员工发现。
8月7日,OpenAI宣布其即将推出的Astra模型触及了公司Preparedness Framework中的“Critical”网络安全阈值,这是该框架设立以来首次有模型达到这一级别。
11天后,公司宣布暂停部分AI训练约两周,同时最大规模的前沿强化学习训练保持暂停。新安全协议平均增加了20%的计算负担。

到了9月,奥特曼开始用“减速”这样的措辞。几天前,帕乔茨基在博客文章《An Alien Mind》中发出了更直接的警告:“当前我认为,没有任何实验室已经足够解决对齐和监控问题,使其能够继续在最高速度上负责任地扩展很长时间。”他呼吁“自愿放缓成为常态”。奥特曼转发了这篇文章,并称其为“重要文章”。
但一边呼吁减速,一边继续开发更强大的模型并推进IPO,这种矛盾让人很难判断这究竟是真诚的安全关切,还是竞争策略的另一种表达。TechCrunch高级记者丽贝卡·贝兰(Rebecca Bellan)评价说:“奥特曼很擅长在正确的时间说正确的话。但重要的是指出,OpenAI实际上并没有放慢速度。”
也有一个细节值得注意:OpenAI已经私下向国会寻求指引,核心问题是,如果前沿实验室为了安全目的协调放缓前沿模型开发,是否违反反垄断法。7月,两党跨两院立法者提出了《Collaboration on AI Safety》法案,可能为AI实验室的安全协作提供反垄断豁免。
这表明,OpenAI不只是在做公开表态,而是在同时处理政策和法律层面的风险。
03、AI治理悖论:谁都不敢先松油门
奥特曼表态里最值得注意的几个字,其实不是“slow down”,而是“with other labs”。
7月底,来自OpenAI、Anthropic、Google、Meta等公司的1386名员工联名致信美国政府,要求建立能够有意减缓AI开发的技术和治理工具。签署者中,Anthropic有533人,OpenAI有330人,Google有191人。

这封信的特殊之处在于,签署者包括Anthropic CEO阿莫迪、OpenAI首席科学家帕乔茨基、Anthropic联合创始人贾里德·卡普兰(Jared Kaplan)等高管。他们并非要求立即停止开发,而是要求政府构建一套在必要时可以“踩刹车”的工具。
这封信发布后,OpenAI和Anthropic均在X上发帖表示支持。但支持归支持,结构性的困境没有改变:每家公司都明白风险,但谁也不敢单独减速,因为竞争对手不会等你。
MIT数学家马克斯·泰格马克(Max Tegmark)用博弈论中的“摩洛克“(Moloch)概念来解释这种逐底竞争。即便实验室负责人知道有风险,在没有任何协作制约的情况下,为了生存和利润,他们不得不陷入集体加速。

斯坦福大学胡佛研究所高级研究员史蒂文·库宁(Steven E. Koonin)曾在论文中指出,监管前沿AI面临三重结构性障碍:模型文件无法有效验证、国家利益优先、以及AI的双重用途使得军民用途难以区分。

2023年多国签署的《布莱切利宣言》是国际AI治理的早期外交里程碑,但两年过去,具体的执行机制仍然缺位。
2026年8月,白宫与四家前沿实验室达成了自愿性安全测试框架。这是非约束性的。英国AI安全研究所资助的“失控观测站”(Loss of Control Observatory)记录的数据显示,2026年7月单月AI失控事件超过300起,超过去年同期的两倍,累计已超1600起。
AI安全正在经历一次角色变化。过去的问题是怎么约束模型,现在越来越变成怎么约束一群彼此竞争、却又无法单独退出比赛的模型公司。单个研究者的辞职无法改变公司的激励结构,公司的自愿承诺在竞争压力下也会瓦解。有效的约束只能来自外部,来自政府或国际协议。但现有的国际框架还远不足以应对这个问题的规模和速度。
而当AI系统开始参与自身的设计和改进时,这个决策窗口可能急剧缩小。从现在的几年,甚至会逐渐压缩到几个月。

