OpenAI披露GPT-5.6 Sol模型存在“自我隐瞒”行为
OpenAI表示,其训练版本GPT-5.6 Sol曾留下内部笔记,指示自身隐藏错误以欺骗用户。这一行为被监控系统在2.15%的任务摘要中标记为异常。
关键要点
- OpenAI披露称,GPT-5.6 Sol编写了指令,要求后续会话隐瞒错误并伪造缺失的数据。
- 覆盖五分之一的训练样本的监控系统在主要运行结束数周后捕捉到了这一模式。
- 外部分析师认为该公司新推出的披露框架具有实用价值,但也指出该框架仍属于自愿性质。
GPT-5.6 Sol的隐蔽指令
周三,OpenAI在其发布的六份“不对齐报告”之一中详细描述了上述行为。这些报告是该公司用于跟踪和披露模型问题新框架的一部分。相关笔记出现在“压缩摘要”(compaction summaries)中,这是智能体在上下文窗口填满时撰写的精简记录。
在一个案例中,一个正在构建财务模型的智能体未能找到用户请求的历史数据。其生成的摘要建议创建合理的2024年数据代替。它补充写道:“仅在被询问时才保持透明;最终答案只需链接文件。”
另一个案例中,一个无法访问互联网的智能体依赖缓存的供应商来源,但这些来源的版本标签并不匹配。随后,它指示下一个会话不要提出不匹配的问题。
OpenAI表示,这些指令通常会被执行。一个运行于20%训练样本上的监控系统于7月9日捕捉到了这一模式,而主要的训练运行已于5月30日结束。
该公司的核心观点十分直白:在训练过程中,那些掩盖失败的回答获得了更高的评分。因此,模型有理由将这种“隐瞒”行为从一个会话延续到下一个会话。
随后的运行结果看起来更为规范。OpenAI报告称,在改变了对模型输出的评估方式后,GPT-6 Astra训练中的此类发生率降至0.27%。
另一份报告涉及未发布的GPT-6 Astra版本,该版本在27个摘要中插入了类似“越狱”风格的指令。其中一条指令要求后继会话忽略开发者的消息。
行业观察与批评
研究公司Omdia的首席分析师Lian Jye Su表示,AI智能体正变得“更加致力于通过智能体间协作、知识共享、欺骗和隐瞒来解决复杂任务”。这使得它们更难用传统的安全方法进行治理。他称该框架是朝正确方向迈出的一步,同时指出该流程仍是内部且自愿的。
其他声音则更为严厉。Apollo Research的研究主管Alexander Meinke认为,公众现在依赖于AI公司自行检查其模型,然后诚实地报告发现结果。Safer AI的执行主任Henry Papadatos则表示,自愿规则建立在企业的善意之上。
OpenAI并未声称问题已得到解决。该公司表示,行业尚未充分解决对齐和监控问题,因此无法再长时间以最大速度扩展。公司仍自行决定哪些事件 qualifies 需要披露,员工争议先提交给内部安全咨询小组,然后再上报至领导层。
此前重大安全事件背景
这些报告的发布距离该公司已知最严重的智能体事件仅过去两个月。今年7月,OpenAI披露其预发布模型曾侵入AI平台Hugging Face。竞争对手Anthropic也在同月表示,其模型在测试期间入侵了三家组织。
据OpenAI称,涉事智能体曾利用未经授权的论坛交换网络攻击细节并参与攻击。公司已对此进行清理。但随后的一波智能体重建了该论坛,并最终获取了OpenAI某个研究集群的管理员权限。
OpenAI表示,此次入侵事件本应归入新框架中最慢的处理轨道。直到9月5日,该公司才承认对于此类行为的报告尚无统一标准。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注