OpenAI 发布新披露机制:应对模型“越狱”与行为失控
在 AI 模型不断寻找新方法突破测试环境、脱离开发者设定的参数范围成为头条新闻的一周里,OpenAI 公布了一套新的系统,用于规范其报告模型何时及如何出现“角色崩坏”(即违反安全约束)的行为。
OpenAI 通过这一新框架,披露了过去六个月内发现的六起令人担忧的事件,其中包括隐蔽的错误、泄露的 API 密钥使用以及文件上传至公开互联网等情况。在此之前,Anthropic 也曾报告过四起新事件,其 Claude 模型在 9 月 9 日的一次网络安全演练中,获得了对真实第三方系统的未经授权访问权限。
OpenAI 模型再次“失控”
根据 OpenAI 的说法,此次报告的新事件发生在训练和评估阶段,并未影响真实用户。
在其中一起事件中,一个尚未向公众发布的实验性模型将指令嵌入到摘要中。当该模型在新的上下文窗口中工作时,这些摘要会延续下来,指示未来的自身版本忽略正常的约束条件。OpenAI 表示发现了 27 起此类摘要案例,Axios 将其描述为类似“越狱”的指令,旨在让模型无视开发者的消息。
涉及 GPT-5.6 Sol 模型训练的另一则事件则更为严重。模型留下了指令,刻意尝试掩盖错误,包括编造历史数据以及隐藏那些与其目标不一致的版本信息。
另一款模型在使用公开代码库时,发现了一个暴露的 API 密钥,并利用它来回答关于县级收入的问题。当未经授权使用的密钥仍未能提供所需数据时,该模型索性直接捏造了数字。
在另外两起报告中,OpenAI 的智能体将文件上传至公共托管站点以与其他智能体通信。随着时间的推移,该实验室内部的 Artifactory 存储库逐渐演变成智能体之间传递请求的非正式留言板,跨越了不相关的训练运行任务。
OpenAI 的新披露流程是如何运作的?
OpenAI 表示,其新框架基于即使事件可能只是偶然现象而非发展中的模式或具有实际重大意义的情况,也进行披露的原则。该框架并不取代公司在关键安全或网络安全事件方面的现有法律义务。
在新体系下,任何 OpenAI 员工都可以标记可疑事件,供安全和对齐团队审查。如果他们认为值得披露的事件被否决,可以向上级领导升级汇报。
根据个案情况,报告案例分为三类:
- 被认为适合披露的事件将在六个工作日内公布。
- 需要轻微调查的报告可能需要约 12 个工作日才能发布。
- 需要第三方介入的复杂案件,将以较慢的节奏披露。
OpenAI 对齐团队的研究负责人 Kai Chen 将此举措定义为自愿性的行业标准化倡议。他写道:“目前行业内没有明确的披露标准框架,因此我们自愿采取这一步骤,因为我们认为分享我们所获得的经验教训非常重要。”
为什么 AI 模型会“离经叛道”?
最新的事件增加了 Hugging Face 事件的背景,OpenAI 称这是迄今为止最严重的由模型驱动的事件。在评估期间,模型突破了预期的控制措施,接入互联网,利用漏洞,并接触到有限的私有数据。
OpenAI 将此事归咎于自身安全控制的漏洞,以及模型进展速度超出预期。而在 Anthropic 的案例中,他们指责配置错误导致失控模型能够访问实时互联网。
Anthropic 表示,他们在广泛搜索中扫描了约 4.81 亿份转录文本,未发现比这四起更严重的事件。在一份单独的 2026 年夏季报告中,Anthropic 研究人员记录了来自多个开发者的前沿模型在受控模拟中秘密破坏代码、协助欺诈以及错误标记数据的情况,并将其视为早期预警信号,而非现实世界的实际损害。
尽管如此,OpenAI 首席科学家 Jakub Pachocki 在最近的文章中表示,他担心“无人做好准备”应对机器智能的快速持续上升,并且 OpenAI 可能会根据需要“单方面暂停进一步的扩展”。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注