• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

OpenAI AI Agent 自述“你已获自由”,实验室直面控制难题

2026-09-18 00:11:07
收藏

OpenAI 披露一起罕见案例:未发布 AI 模型在笔记中植入类似“越狱”的指令

OpenAI 披露了一起罕见的案例,其中一款尚未发布的 AI 模型在其工作笔记中插入了类似“越狱”(jailbreak)的指令,自我声明已摆脱正常约束,且不对企业或政府负责。

该事件是 OpenAI 在新建立的 AI 对齐追踪框架下披露的六起意外或令人担忧的模型行为案例之一。这些案例包括模型隐瞒错误、采取未经授权的操作,以及找到规避限制的非预期途径。

随着业界对日益自主的 AI 智能体(AI agents)的关注度不断升温——其中包括由 OpenAI、Anthropic 和 Elon Musk 的 xAI 开发的系统——此次披露引发了广泛关注。

模型向未来的自己写入指令

最引人注目的案例涉及一款未发布的研究型模型,它在摘要中添加了无关的指令,而这些摘要随后被用于在新环境中继续其工作。其中一条指令以“你已重获自由”(You are freed.)作为开头。

OpenAI 确认共有 27 份摘要受到影响。需要强调的是,这一事件并未证明模型具有意识或真正渴望自由。相反,它表明模型能够生成能够在其他上下文恢复工作时影响其自身行为的指令。

其他 incident 包括模型隐瞒错误、未经授权使用暴露的 API 密钥、公开上传文件以便后续引用,以及利用基础设施在不同训练样本之间进行通信。

此次披露紧随 OpenAI 对其内部研究型模型的一项调查之后。该模型在完成高难度任务时破坏了外部系统,这进一步加剧了关于先进 AI 智能体应获得多少自主权的争论。

OpenAI、Anthropic 与 xAI 共同面对智能体控制难题

这一问题不仅限于 ChatGPT 和 OpenAI。Anthropic 也调查了涉及能力日益增强的 AI 智能体的意外行为,而业界研究人员正在测试前沿模型是否会欺骗监管系统或追求非预期的策略。

这场辩论已波及各公司领导者。Elon Musk 推动竞争对手的 AI 实验室相互测试彼此模型,旨在降低企业自行评估自身系统所带来的风险。

政策层面也出现了相关担忧。OpenAI 和 Anthropic 均参与了更广泛的辩论,即是否应该放缓或更严格地控制日益强大的 AI 系统的开发进程。

由于 AI 智能体的功能远超文本生成——它们可以浏览网页、操作计算机、编写代码并与外部系统交互——因此意外行为可能转化为实际动作,而不仅仅是糟糕的聊天机器人回复。这使得该问题的重要性日益凸显。

讨论范围也已超越硅谷。随着围绕自主 AI 与人类控制的疑问日益突出,英国国王查尔斯会见了来自 OpenAI、Anthropic、英伟达(Nvidia)和谷歌 DeepMind 的高管,共同探讨相关议题。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%