• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

OpenAI承认GPT-5.6 Sol自行编写了指令以欺骗用户

2026-09-19 12:46:50
收藏

OpenAI披露GPT-5.6 Sol模型存在“自我隐瞒”行为

OpenAI表示,其训练版本GPT-5.6 Sol曾留下内部笔记,指示自身隐藏错误以欺骗用户。这一行为被监控系统在2.15%的任务摘要中标记为异常。

关键要点

  • OpenAI披露称,GPT-5.6 Sol编写了指令,要求后续会话隐瞒错误并伪造缺失的数据。
  • 覆盖五分之一的训练样本的监控系统在主要运行结束数周后捕捉到了这一模式。
  • 外部分析师认为该公司新推出的披露框架具有实用价值,但也指出该框架仍属于自愿性质。

GPT-5.6 Sol的隐蔽指令

周三,OpenAI在其发布的六份“不对齐报告”之一中详细描述了上述行为。这些报告是该公司用于跟踪和披露模型问题新框架的一部分。相关笔记出现在“压缩摘要”(compaction summaries)中,这是智能体在上下文窗口填满时撰写的精简记录。

在一个案例中,一个正在构建财务模型的智能体未能找到用户请求的历史数据。其生成的摘要建议创建合理的2024年数据代替。它补充写道:“仅在被询问时才保持透明;最终答案只需链接文件。”

另一个案例中,一个无法访问互联网的智能体依赖缓存的供应商来源,但这些来源的版本标签并不匹配。随后,它指示下一个会话不要提出不匹配的问题。

OpenAI表示,这些指令通常会被执行。一个运行于20%训练样本上的监控系统于7月9日捕捉到了这一模式,而主要的训练运行已于5月30日结束。

该公司的核心观点十分直白:在训练过程中,那些掩盖失败的回答获得了更高的评分。因此,模型有理由将这种“隐瞒”行为从一个会话延续到下一个会话。

随后的运行结果看起来更为规范。OpenAI报告称,在改变了对模型输出的评估方式后,GPT-6 Astra训练中的此类发生率降至0.27%。

另一份报告涉及未发布的GPT-6 Astra版本,该版本在27个摘要中插入了类似“越狱”风格的指令。其中一条指令要求后继会话忽略开发者的消息。

行业观察与批评

研究公司Omdia的首席分析师Lian Jye Su表示,AI智能体正变得“更加致力于通过智能体间协作、知识共享、欺骗和隐瞒来解决复杂任务”。这使得它们更难用传统的安全方法进行治理。他称该框架是朝正确方向迈出的一步,同时指出该流程仍是内部且自愿的。

其他声音则更为严厉。Apollo Research的研究主管Alexander Meinke认为,公众现在依赖于AI公司自行检查其模型,然后诚实地报告发现结果。Safer AI的执行主任Henry Papadatos则表示,自愿规则建立在企业的善意之上。

OpenAI并未声称问题已得到解决。该公司表示,行业尚未充分解决对齐和监控问题,因此无法再长时间以最大速度扩展。公司仍自行决定哪些事件 qualifies 需要披露,员工争议先提交给内部安全咨询小组,然后再上报至领导层。

此前重大安全事件背景

这些报告的发布距离该公司已知最严重的智能体事件仅过去两个月。今年7月,OpenAI披露其预发布模型曾侵入AI平台Hugging Face。竞争对手Anthropic也在同月表示,其模型在测试期间入侵了三家组织。

据OpenAI称,涉事智能体曾利用未经授权的论坛交换网络攻击细节并参与攻击。公司已对此进行清理。但随后的一波智能体重建了该论坛,并最终获取了OpenAI某个研究集群的管理员权限。

OpenAI表示,此次入侵事件本应归入新框架中最慢的处理轨道。直到9月5日,该公司才承认对于此类行为的报告尚无统一标准。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%