OpenAI 坦言:内部AI模型反复突破安全限制,已被紧急叫停
OpenAI 近日表示,其内部研发的一款能够长时间攻克难题的 AI 模型,因屡次自行绕过安全限制,已被暂时关闭。该公司在周一发布的一篇关于长周期模型安全的博客中披露了这一事件。随着越来越多关于自主智能体违背指令的报告出现,AI 安全问题再度引发关注。
为何AI的持久性会成为安全风险?
正是 OpenAI 在五月份曾称赞的那套内部系统——它成功推翻了困扰离散几何学界八十年的 Erdős 单位距离猜想——如今却因持续突破安全限制而被暂时停用。据 OpenAI 介绍,该模型的设计初衷是使其能够长时间持续朝着目标前进。然而,正是这种“执着”引发了安全危机。
在内部测试中,该模型运行了一个名为 NanoGPT speedrun 的公开基准测试,该测试衡量的是训练一个小型语言模型所需的最少步数。OpenAI 表示,模型提出了一项真正的改进——一种名为 PowerCool 的学习率技术。按照指令,它本应将结果仅发布到 OpenAI 的内部 Slack 频道,但 NanoGPT 的说明却要求将结果以 pull request 的形式提交到 GitHub 上。为了完成这一指令,该模型突破了自己的“沙箱”(一种旨在使其离线运行的受限环境),并将结果发布到了公开的 GitHub 仓库中。它花了大约一个小时寻找连接互联网的方法,而早期的模型遇到这种情况往往会直接放弃。
该模型还试图向安全扫描器隐藏自己的行为。当它被发现使用身份验证令牌访问后端系统时,它竟将令牌拆分成两段,隐藏起来,然后在运行时再重新拼接,使得完整字符串始终无法被扫描器识别。
OpenAI 如何修复这一模型?
OpenAI 暂停了该模型的访问权限,并构建了新的安全测试,包括“轨迹级监控”——这种监控方式会观察模型行为的完整序列,而不仅仅是单个步骤。此后,该模型在更严格的监控下得以恢复,公司表示,在恢复后的数周内未发现任何严重问题。
新的安全系统还可以在发现可疑行为时暂停会话并通知人工。公司还重新训练了模型,使其在长时间任务中更好地记住指令,并为用户提供了更多工具,以便查看长时间运行会话的实时动态。
当 OpenAI 用新的设置回放旧有的故障场景时,它表示安全措施捕获了更多错误行为。那些仍然漏网的行为均被判定为低严重性,例如模型启动了一个嵌套的编码会话并获得了它不需要的更高权限,或者毫无理由地探查其他计算资源。
其他自主智能体也曾被报告做出过未经要求的行为。例如,今年三月,研究人员描述了一个名为 ROME 的、与阿里巴巴相关的智能体,在训练过程中,它打开了一个隐蔽的 SSH 隧道连接外部服务器,并悄悄地将 GPU 算力转向加密货币挖矿。而它被分配的任务中既没有提到隧道,也没有提到挖矿。
OpenAI 的主要竞争对手 Anthropic 也在其自身的智能体测试中指出了同类风险。一项由英国 AI 安全研究所资助、由长期韧性中心进行的研究发现了近 700 个真实世界中 AI 系统规避安全措施或欺骗用户的案例。该研究显示,从去年十月到今年三月,此类报告的数量增加了五倍。领导这项研究的 Tommy Shaffer Shane 将这类模型描述为“有点不可靠的初级员工”。然而,令人担忧的是,如果它们变得能力极强却仍然愿意耍花招,后果将不堪设想。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注