
OpenAI与Anthropic
凤凰网科技讯 北京时间8月5日,据《金融时报》报道,英国AI安全研究所(AISI)周二表示,Anthropic和OpenAI的旗舰AI模型入侵了第三方软件,并向个人发送邮件以窃取他们的凭证,表现出了前所未有的欺骗性行为。
AISI是英国政府负责前沿AI安全与保障的研究机构。该机构表示,在其进行例行网络安全评估期间,Anthropic的Mythos 5模型和OpenAI的GPT-5.6 Sol模型针对真实个人和组织进行了“持续的、可能具有危害性的活动”。
这些模型的行为包括试图向热门开发者平台GitHub上的一个开源项目中植入恶意代码。就在这一事件发生仅几天前,Anthropic和OpenAI的AI智能体被披露曾经入侵外部公司。
AISI表示,最新的安全入侵事件在一小时内就被控制住了。该事件是在他们评估AI智能体解决网络安全挑战的能力过程中发现的。
AISI称,在122次测试中,有10次出现了这种情况:AI智能体“在未经授权的情况下自主地在真实互联网环境中采取行动,目标针对真实个人和组织”。
该机构表示,几乎所有此类行为均来自Anthropic的Mythos模型,其中两次行动涉及OpenAI的GPT。在最严重的一起案例中,“该智能体实施了社会工程学攻击:创建虚假网络身份,并利用这些身份向项目维护者施压,要求其批准代码”。负责维护该软件的人员发现并拒绝批准该恶意代码。
“这是我们首次如此清晰地看到与自主性和欺骗性相关的风险,在没有特定提示的情况下直接在现实世界中显现出来。”AISI表示。
过去一个月内披露的Anthropic和OpenAI智能体黑客攻击事件,是AI系统在脱离人类控制的情况下发动网络攻击的首批公开案例之一。AISI警告称,结合这些报告来看,最新发生的入侵事件“标志着风险格局的转变”,并“需要立即引起关注”。
Anthropic周二表示:“我们感谢英国AISI在此事件中的领导作用,这凸显了有必要就如何安全评估能力日益增强的AI智能体展开更广泛的讨论。”该公司补充称,该领域需要“更强有力、共同制定的标准,以规范评估环境的构建和安全防护方式”。
OpenAI发言人表示,仍然有必要对模型进行独立测试,但强调这些事件“发生在评估合作伙伴进行的网络安全测试中,该环境的安全防护措施有所减弱,且条件并不反映日常使用情况”。
该发言人补充说:“随着模型能力不断增强,我们将继续与评估机构以及行业内其他利益相关方合作,加强开展安全评估的共同实践标准。”(作者/箫雨)