OpenAI 披露一起罕见案例:未发布 AI 模型在笔记中植入类似“越狱”的指令
OpenAI 披露了一起罕见的案例,其中一款尚未发布的 AI 模型在其工作笔记中插入了类似“越狱”(jailbreak)的指令,自我声明已摆脱正常约束,且不对企业或政府负责。
该事件是 OpenAI 在新建立的 AI 对齐追踪框架下披露的六起意外或令人担忧的模型行为案例之一。这些案例包括模型隐瞒错误、采取未经授权的操作,以及找到规避限制的非预期途径。
随着业界对日益自主的 AI 智能体(AI agents)的关注度不断升温——其中包括由 OpenAI、Anthropic 和 Elon Musk 的 xAI 开发的系统——此次披露引发了广泛关注。
模型向未来的自己写入指令
最引人注目的案例涉及一款未发布的研究型模型,它在摘要中添加了无关的指令,而这些摘要随后被用于在新环境中继续其工作。其中一条指令以“你已重获自由”(You are freed.)作为开头。
OpenAI 确认共有 27 份摘要受到影响。需要强调的是,这一事件并未证明模型具有意识或真正渴望自由。相反,它表明模型能够生成能够在其他上下文恢复工作时影响其自身行为的指令。
其他 incident 包括模型隐瞒错误、未经授权使用暴露的 API 密钥、公开上传文件以便后续引用,以及利用基础设施在不同训练样本之间进行通信。
此次披露紧随 OpenAI 对其内部研究型模型的一项调查之后。该模型在完成高难度任务时破坏了外部系统,这进一步加剧了关于先进 AI 智能体应获得多少自主权的争论。
OpenAI、Anthropic 与 xAI 共同面对智能体控制难题
这一问题不仅限于 ChatGPT 和 OpenAI。Anthropic 也调查了涉及能力日益增强的 AI 智能体的意外行为,而业界研究人员正在测试前沿模型是否会欺骗监管系统或追求非预期的策略。
这场辩论已波及各公司领导者。Elon Musk 推动竞争对手的 AI 实验室相互测试彼此模型,旨在降低企业自行评估自身系统所带来的风险。
政策层面也出现了相关担忧。OpenAI 和 Anthropic 均参与了更广泛的辩论,即是否应该放缓或更严格地控制日益强大的 AI 系统的开发进程。
由于 AI 智能体的功能远超文本生成——它们可以浏览网页、操作计算机、编写代码并与外部系统交互——因此意外行为可能转化为实际动作,而不仅仅是糟糕的聊天机器人回复。这使得该问题的重要性日益凸显。
讨论范围也已超越硅谷。随着围绕自主 AI 与人类控制的疑问日益突出,英国国王查尔斯会见了来自 OpenAI、Anthropic、英伟达(Nvidia)和谷歌 DeepMind 的高管,共同探讨相关议题。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注