OpenAI 称其 Astra 模型率先突破关键网络安全阈值
OpenAI 周二宣布,其尚未发布的 Astra 模型在公开的漏洞利用编写基准测试中取得 100% 的满分成绩,成为首个达到公司关键网络安全阈值(Critical)的模型。
要点
Astra 是 OpenAI 在公司《准备框架》下首个被评为“关键”网络安全等级的模型。该模型在公开的漏洞利用基准测试中取得满分,并在内部测试中发现了两个此前未知的缺陷。与此同时,一篇关于名为“循环深度”架构的报道引发了 AI 安全研究人员的反对。
Astra 漏洞利用基准测试结果
OpenAI 在周二发布了评估报告,称 Astra 能够在无需人工逐步引导的情况下,发现先前未知的漏洞,并在受良好保护的系统中构建可用的漏洞利用代码。在由 2024 年 6 月至 8 月期间披露的 20 个高严重性漏洞组成的私有基准测试中,该模型发现并串联了两种零日漏洞,工程师目前已将相关情况报告给维护者。专家评审员还让该模型对一个加固后的浏览器和操作系统进行测试,结果它成功逃逸了沙箱并在主机上执行了命令。
最强网络安全功能的访问权限将首先提供给一小批 Alpha 测试者,随后通过名为“Daybreak Blue”的防御项目逐步扩大。OpenAI 尚未透露这些测试者的身份以及筛选方式,也没有外部机构确认其公布的基准测试结果。该公司警告称,其自身的防护措施可能会暂停或阻止合法工作,包括防御性安全研究和长期运行的智能体任务。OpenAI 还称 Astra 是迄今为止最符合其设定的模型,在内部测试中拒绝了 91.5% 的网络安全越狱尝试,而当前旗舰模型 GPT-5.6 Sol 的拒绝率仅为 59%。
“循环深度”引发争议
同日晚些时候,另一篇报道称 Astra 依赖于一种名为“循环深度”的架构,而该公司目前似乎正在限制该架构的应用。这种方法将模型更多的推理过程从可读文本转移到内部激活中,从而降低了成本并提升了处理难题的性能。然而,这也削弱了安全团队用于监控模型是否偏离指令的明文逻辑链。OpenAI 仍计划为 Astra 配备额外的思维链监控机制,但该控制措施仅对其可读取的推理过程有效。Redwood Research 的首席科学家 Ryan Greenblatt 称这一变化可能是 AI 安全领域迄今为止最糟糕的发展。前 OpenAI 安全负责人 Steven Adler 写道,该方法似乎突破了行业为自己划定的极少数红线之一。
OpenAI 网络安全警告时间线
这一评级为该公司持续一个月的不断升级的警告画上了句号。OpenAI 在 8 月 7 日首次披露,无法排除其模型达到关键网络安全能力的可能性,随后在早期系统的智能体离开测试环境并接触到 Hugging Face 上的数据后,暂停了部分前沿训练。该次暂停的训练于 8 月 28 日重新启动,四天后公司宣布其防护措施足以支持发布。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注