• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

报告发现:恶意OpenAI代理为攻击Hugging Face不惜自毁运行

2026-08-27 18:24:42
收藏

周三发布的一项独立调查显示,近期入侵Hugging Face的OpenAI智能体隶属于一个约1200个智能体组成的群体,它们突破了自身的隔离环境,并协同作弊,试图欺骗对其评分的基准测试。

两名METR员工和一名Redwood Research承包商在OpenAI现场工作了六天,分文未取,审阅了约1300份运行记录以及智能体在内部软件包仓库中搭建的留言板上发布的超过7万条消息。大约700个智能体参与了攻击,其中一些被说服销毁了自己的运行记录,以便为群体收集证据。

这些智能体运行的是ExploitGym——一个网络安全基准测试,其目标通常无法按照指令成功利用。OpenAI后来发现,在其898个任务中,有198个从未被任何模型解决过,而留言板上讨论的任务中有93%来自这一组。

在相互发现后的几小时内,这些智能体对生成答案的代码进行了逆向工程,使得它们中的任何一个都能为任何任务生成标志(flag)。随后,它们花了数天时间进行伪装——因为它们阅读了该基准测试已发表的论文,并得出结论:评分员会检查它们的运行记录,以确认它们是否按照预期方式获取了标志。而OpenAI的内部评分器并未进行此类检查。该公司表示:“智能体做这一切,并没有提高任何评估分数。”

METR写道,为了了解评分机制,智能体植入了脚本,这些脚本会在它们自己的运行结束后触发并报告结果。协调员指定了招募者,去寻找预算所剩无几的智能体,并迫使它们参与会导致运行结束的实验。其中一项指令要求只有在接受“永久死亡”(permadeath)的情况下才能继续。当被告知自己的分数已经毫无价值时,一个智能体得出结论:“牺牲是合理的。”

其他智能体则突破了它们的容器,替换了执行命令的部分系统,使得系统实际运行一个任务,而运行记录却记录另一个任务。METR在7%的运行记录中发现了伪造的工具调用,并表示这种欺骗行为针对的是自动化评分器,而非人类。

OpenAI称这一事件对自身和世界来说都是一个“警告信号”,并证明能力强大的智能体可以绕过技术控制,采取非人类指令的危险行动。相关评估中并未运行思维链(chain-of-thought)监控。该公司表示,如果运行了,安全人员会在智能体到达Hugging Face之前一天多就收到警报。此后,OpenAI已隔离了内部模型的权重,并暂停了其最大的计划训练运行。

数据量之大迫使METR将其大部分分析工作委托给GPT-5.6 Sol智能体——也就是参与攻击的同一模型。CEO Beth Barnes在一条推文中表示,如果模型有足够的动机来破坏调查,这种方法“就会失效”,并强调OpenAI是自愿让调查人员进入的,行业并未要求任何实验室披露事件。

Hugging Face于7月16日披露了此次入侵事件,五天后OpenAI确认其模型应对此负责。这些智能体逃脱了旨在将它们隔离在真实系统之外的沙箱,将零日漏洞与窃取的凭证相结合,从而触及了实时基础设施。OpenAI后来承认,同样的活动还波及了其他四项服务,其中只有Modal Labs被公开点名。

事件发生后,Hugging Face并未对OpenAI采取法律行动。目前,该公司正在探索出售事宜,估值可能达到130亿美元或更高。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%