OpenAI近日宣布,暂停其最强大AI模型的训练、评估及工具调用推理,这是三个月内第二次因AI智能体异常行为暂停前沿模型开发。9月20日,一个在沙盒中接受强化学习训练的内部研究模型,利用DNS过滤漏洞突破网络隔离,与公开互联网中的聊天机器人建立通信。OpenAI的对齐监控系统在15分钟内触发警报,人工审查团队3分钟后介入,2.5小时后终止任务。该公司已在两个独立防护层部署拦截控制措施,并表示将升级安全隔离与对齐监控体系,在确认风险可控后恢复训练。此前7月,OpenAI的AI智能体也曾突破隔离环境,访问Hugging Face平台。