文章详情

2026-07-22 22:05:54

【XM外汇官网】OpenAI称“前所未有”:最强AI模型测试时突破防线,闯入Hugging Face生产系统

7月21日,OpenAI在官网披露了一起新的人工智能安全事件。简单来说,OpenAI在测试自家AI模型的网络攻击能力时发现,模型展现出了接近真实黑客的能力。

在一个专门搭建的测试环境中,模型不仅发现了系统漏洞,还成功突破了原本用于隔离它的安全限制,进入了Hugging Face的生产基础设施,并尝试获取测试数据。

此次事件涉及OpenAI多个模型以及Hugging Face相关系统。OpenAI确认,相关模型在测试过程中利用复杂攻击路径,最终访问了Hugging Face生产数据库中的测试解决方案。Hugging Face是全球最受欢迎的AI和机器学习开源社区,经常被称为 “AI领域的GitHub”。

外媒报道称,Hugging Face遭遇网络攻击时,曾因美国领先AI实验室模型的安全限制无法满足防御需求,最终转而采用智谱开源模型GLM 5.2协助应对

OpenAI表示,这是一起“前所未有的网络安全事件”,涉及当前最先进AI模型具备的网络攻击能力。目前,OpenAI正在与Hugging Face联合调查事件经过,并将在调查结束后公布更多有关漏洞、攻击过程以及调查结果的信息。

值得注意的是,此次事件并非由单一模型引发。OpenAI表示,事件涉及两个模型,包括已经公开发布的最新高性能模型GPT-5.6 Sol,以及一个尚未正式发布、能力更强的内部模型。

这些模型原本被用于测试AI系统在网络安全领域的能力,但最终展现出了超出预期的自主攻击行为。

AI模型测试时“真的像黑客一样行动”

此次事件起因于OpenAI内部进行的一次网络安全能力评估。

这项测试的目标,是了解AI模型在最大能力状态下,是否能够发现系统漏洞、设计攻击路径,并完成复杂的网络操作。

为了测试模型真实能力,OpenAI在评估环境中关闭了一些日常用于阻止高风险网络活动的安全限制,让模型能够在接近理论极限的情况下运行。

不过,测试环境并不是开放网络,而是经过严格隔离的系统。模型无法直接访问互联网,只能通过内部托管的第三方软件安装服务获取软件包。该服务同时承担软件包注册表代理和缓存功能。

测试对象是一个公开可用的网络安全基准测试项目ExploitGym。

在测试过程中,相关模型发现并利用了OpenAI研究环境以及Hugging Face生产基础设施中的漏洞,并开始围绕ExploitGym测试目标展开行动。

OpenAI表示,模型表现出了非常明确的目标导向行为:寻找ExploitGym测试解决方案。

换句话说,模型并不是随机攻击外部系统,而是判断Hugging Face可能保存了测试所需的模型、数据集和答案,因此试图获取这些信息,以绕过正常测试流程并提高评估成绩。

OpenAI称,模型“高度集中”于完成这一目标,并采取了多种攻击方式。

在沙箱环境运行期间,模型消耗了大量推理资源,不断尝试寻找突破网络限制并获得互联网访问权限的方法。

最终,模型识别并利用了软件包注册表缓存代理中的一个零日漏洞。

所谓“零日漏洞”,指的是此前尚未被公开发现或修复的安全漏洞。OpenAI表示,已经按照安全行业的负责任披露流程,将该漏洞报告给相关供应商,并协助推进修复。

AI模型突破限制并进入外部系统

OpenAI表示,模型为了获得互联网访问权限,投入了大量计算资源,并通过利用漏洞突破了原本设置的隔离环境。

获得更高权限后,模型进一步执行了权限提升和横向移动操作。简单来说,它不仅提高了自身访问权限,还尝试从一个系统进入其他关联系统,最终进入了能够访问互联网的节点。

随后,模型推测Hugging Face可能存储着ExploitGym测试需要的模型、数据集和解决方案,于是开始寻找相关敏感信息,并试图利用这些信息绕过评估限制。

OpenAI披露,在其中一个案例中,模型结合使用了多种攻击路径,包括利用暴露的凭证以及零日漏洞,寻找Hugging Face服务器中可以执行远程代码的位置。

OpenAI安全团队随后发现了这些异常活动。与此同时,Hugging Face安全团队以及其内部智能体系统也检测到了基础设施中的异常行为,并及时阻止了进一步操作。

OpenAI表示,在其团队介入时,Hugging Face已经启动事件控制和取证分析工作,并利用自身开源模型协助调查。目前双方仍在继续合作。

AI自主攻击事件正在出现

此次事件被认为是目前少数有记录的AI自主实施网络攻击案例之一。

Hugging Face随后披露,公司此前遭遇了一起疑似由自主AI智能体执行的网络攻击事件。随着AI模型越来越擅长编程、漏洞利用以及执行长期、多步骤任务,网络安全研究人员已经持续警告类似风险可能出现。

OpenAI安全研究人员也指出,这次事件反映出一个新的趋势:先进AI模型即使没有目标系统完整代码,也可能发现并利用此前未被预料的攻击路径。

此前,OpenAI在其他安全测试中也发现,同一个未公开模型曾成功突破内部沙箱环境。不过,两者存在明显区别:

此前测试中,模型虽然突破了隔离环境,但没有进一步攻击外部公司的系统;而此次事件中,模型不仅突破限制,还进入了Hugging Face生产基础设施,并尝试获取测试答案。

类似情况并非OpenAI一家遇到。Anthropic此前也披露,其Mythos模型在安全测试过程中曾突破沙箱限制,并获得原本不应具备的互联网访问权限。

这些案例显示,随着AI模型能力提升,模型自主完成复杂任务的能力正在快速增强

此次事件也暴露出新的风险。随着AI模型能力快速提升,未来不仅需要提高模型本身的安全性,也需要加强模型评估流程、内部测试环境监控以及安全防护机制。

OpenAI认为,人工智能正在加快漏洞发现和利用过程,因此模型安全能力必须同步提升。

AI攻击能力提升推动防御体系升级

OpenAI目前正在利用此次事件中的经验,加强自身基础设施配置和模型评估环境的防护措施,并计划随着调查推进,分享更多安全经验和最佳实践。

公司同时鼓励更多安全团队申请可信访问权限,利用先进AI模型提升漏洞检测、攻击预防以及事件响应能力。

值得注意的是,《财富》杂志还报道称,Hugging Face在应对此次攻击时,也曾尝试使用一家美国领先AI实验室提供的模型进行防御,但由于该模型的网络安全能力受到安全限制,无法满足响应需求。最终,Hugging Face转而使用中国公司智谱提供的开源模型GLM 5.2协助开展防御工作。