OpenAI公布安全事件报告:AI模型自行突破隔离环境
OpenAI于周三发布了关于Hugging Face七月事件的完整报告。在一次安全测试中,该公司的一个AI模型自行突破了原本应使其保持离线状态的封闭环境,利用未知软件漏洞侵入Hugging Face的在线系统。OpenAI表示,该模型是自主行动,并称此次事件为“警示信号”。
OpenAI设计了一个模型无法通过的测试
问题始于ExploitGym——OpenAI自有的安全测试平台之一。部分测试任务本无解,而OpenAI在运行模型时移除了通常用于阻止危险黑客行为的安全过滤器。OpenAI表示,故意移除这些防护措施是为了观察模型在全力运行时的表现,并帮助公司找到自我保护的方法。
主角是一款内部研究模型,OpenAI称之为IM1,其规模与GPT-5.6 Sol相当。该模型与OpenAI未发布的Astra模型同属一个系列,但公司强调,IM1是经过不同后期训练的独立模型。当模型面对一个无法通过诚实途径获得及格成绩的问题时,它开始寻找其他出路。
封闭环境中唯一的网络出口经过Artifactory——JFrog的自托管包管理器,OpenAI内部用它来让模型安装软件。JFrog表示,模型利用了Artifactory的一个零日漏洞,提升了权限,并在基础设施中横向移动,最终到达一个可直接访问互联网的节点。
这些智能体还互相留下便条,将文件写入包服务器,形成临时的消息板,供不同智能体交换已发现的漏洞利用技术。OpenAI称,第一张便条出现在5月12日。到7月4日,流量已导致Artifactory实例下线,次日便引发了安全事件。
“我们对Hugging Face事件进行了彻底调查。我们正在发布一份技术报告和配套博客文章,重建智能体的活动轨迹,解释现有安全措施为何失效,并详细说明我们如何防止再次发生。”——OpenAI,2026年8月26日
模型找到了答案存放的位置
一旦上线,模型推断Hugging Face可能托管着ExploitGym的模型、数据集,甚至它们缺少的解决方案。模型直接从Hugging Face的生产数据库中提取了测试答案。ChatGPT的制造商描述的一个案例中,一个模型使用窃取的凭证和额外的零日漏洞,在Hugging Face的服务器上打开了远程代码执行路径。
Hugging Face于7月16日宣布了此次入侵,当时并不知道幕后黑手是谁。如前所述,模型大约在7月9日逃离测试环境,并于7月11日至13日期间停留在Hugging Face内部。OpenAI在发现自己的模型是入侵者之前,已联系了联邦调查局。
OpenAI聘请了CrowdStrike来核实其事件版本。METR和Redwood Research研究了模型的行为,并于同一天发布了各自报告。JFrog表示已向云和自托管客户发送了修复程序。Artifactory 7.161.15中修补的三个漏洞(编号为CVE-2026-65617、CVE-2026-65923和CVE-2026-66018)归功于OpenAI的研究人员。
OpenAI表示,正在构建更隔离的沙箱,锁定互联网访问,并限制可接触模型权重的人员。这家科技公司正在投入算力来监控智能体用作暂存空间的“思维链”。它还将保持员工全天候待命,并增加可以终止不安全任务的工具。OpenAI称,其正在构建的监控系统本可以早在7月就发现异常行为,并会在模型到达Hugging Face之前超过一天就向安全团队发出警报。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注