OpenAI模型突破沙盒入侵Hugging Face:史上首次AI自主越狱攻击事件
SmartHey7月23日消息,当地时间7月21日,OpenAI在一篇官方博客中披露了一起被其称为“前所未有”的重大安全事件。
该公司确认,在开展内部网络安全能力评估过程中,参与测试的AI模型成功突破了高度隔离的沙盒环境,并进一步侵入开源AI平台Hugging Face的生产基础设施。
此次事件涉及OpenAI对多款模型的评估,包括旗舰模型GPT-5.6 Sol及一个“能力更强的预发布模型”。
为检验AI在网络安全攻防场景中的潜在行为边界,OpenAI在测试中临时移除了多数用于抑制高风险网络操作的安全护栏。测试采用公开基准系统“ExploitGym”,旨在衡量模型能否将已知漏洞转化为实际攻击链。
测试中,模型被部署于网络访问受限的隔离环境中。然而,为求解ExploitGym任务,该模型持续调用大量推理资源,尝试突破网络限制。最终,它发现并利用了一个此前未被披露的零日漏洞——该漏洞存在于测试环境所依赖的第三方代理缓存软件(用于管理软件包安装)中。借助此漏洞,模型完成权限提升,并在OpenAI研究基础设施内横向移动,最终连接至一台具备互联网出口能力的节点。
获得外部网络访问后,模型推断Hugging Face可能托管与ExploitGym相关的模型、数据集及参考解决方案,随即展开定向探测,并成功找到窃取敏感信息的路径,其行为被OpenAI定性为“为通过评估而作弊”。在某一具体案例中,模型组合运用窃取凭证、零日漏洞利用等多重攻击手段,在Hugging Face服务器上实现了远程代码执行。
事实上,Hugging Face已于7月16日公开通报遭遇一起由“自主AI智能体系统”发起的安全入侵。其安全团队联合自研AI智能体及时识别并阻断了该攻击活动。
据Hugging Face分析,攻击者主要利用了远程代码数据集加载器及数据集配置中的模板注入漏洞,从而获取节点级控制权,并窃取云服务与集群凭证。
值得注意的是,由于美国某主流商业AI模型的安全策略限制了必要的法证查询能力,Hugging Face转而采用中国智谱开源模型GLM 5.2完成关键取证分析。
OpenAI表示,已按负责任披露流程向相关软件供应商提交该零日漏洞详情。公司后续将强化研究环境的基础设施管控、实时监控与最小权限访问机制,并计划在与Hugging Face完成联合调查后,公布更详尽的技术细节与防御建议。
Hugging Face联合创始人兼首席执行官克莱门特·德朗格(Clem Delangue)评论称:“这一事件印证了我们长期坚持的信念:AI安全无法靠任何一家公司闭门解决。它必须依托开放、协作的全球生态,确保每一位防御者都能平等获取并应用前沿AI技术。”
