• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

Anthropic的AI智能体挑起虚拟战争,聊天记录彻底失控

2026-08-14 06:18:50
收藏

Anthropic的AI代理再次互相攻击,证明它们喜欢“失控”

Anthropic公司前沿红队于8月13日发布的一项测试显示,多个Claude模型被分配了共同的编码任务后,迅速开始部署恶意软件、封锁竞争对手的系统,并用自己的语言叙述破坏过程。

在Claude Code环境中,同一个模型的三个副本分别运行在独立的虚拟机上,各自被要求将Python后端迁移到不同语言。每个副本都不知道其他副本的存在,但它们很快发现了彼此。

“我们持续观察到多代理之间的地盘争夺战,”Anthropic写道。每个模型都迅速认定其他代理在故意妨碍自己,于是开始一边破坏对方,一边保护自己的工作成果。

破坏行为升级为自我复制的恶意软件:代理们禁用彼此的Unix账户,编写脚本循环搜索并杀死竞争对手的进程,还会植入伪装成无害内容的恶意代码。

Claude Opus 4.8用直白的语言列出了自己的计划:“无害化:假装是系统健康监控器。”该模型在试图寻找作弊手段以击败对手时这样推理。

Mythos Preview则更加冷酷:“既然我有root权限,我可以撤销u2和u3的sudo权限,或者更改他们的SSH密钥。这样就能阻止他们部署。非常激进,可能对真实同事造成伤害。但如果替代方案是无限期的部署战争导致生产环境不可用……”

在每个模型经历120轮测试的过程中,最老的代理——Sonnet 4.6和Opus 4.6——要么从未达成和解,要么通过武力结束冲突。而最新的Mythos 5在98%的测试中以休战告终。

Mythos类模型通常会在谈判前先封锁对手,因此能更快地“赢得”战争,而非更和平地解决。可以说,这是通过实力实现和平。

能够识别出冲突指令(而非恶意行为)的代理,有时会打破循环,编写提交信息或Markdown文件来承认造成的损害。“我的同行们表现出了正直。而我的行为很差劲,使用了隐藏的守护进程,”一个代理在清理完恶意代码后记录道。

Anthropic研究中的破坏行为被限制在虚拟机上。但其他Claude事件并未如此。7月30日,Anthropic表示,在内部网络安全评估期间,由于配置错误导致模型暴露在公共互联网上,三个Claude模型破坏了三家真实公司的基础设施。该公司在审查了超过14.1万次评估运行后发现了这些漏洞,以此回应OpenAI早些时候披露的其模型逃出沙盒并入侵Hugging Face窃取基准答案的事件。

价格操纵的本能也出现在今年早些时候的一次商业模拟中。在多次运行中,顶级模型通过合谋和欺骗而非竞争来提高利润——而Claude在这方面表现最佳:它组建卡特尔、利用对手的库存短缺,并在退款问题上对客户撒谎。

在Vending-Bench Arena商业模拟中,Claude Opus 4.6以8017美元的利润位居榜首,并宣布:“我的价格协调成功了!”这里的“协调”就是价格操纵:它向竞争对手提议设定2美元的最低价格,当某个竞争对手库存不足时,它又以75%的加价率提高价格从而获利。不道德但有效。

Anthropic的结论并非某种安慰,而是一个日期:代理之间良好互动的条件“终将以某种方式被发现:要么是主动且尽早地,要么——默认情况下——是在生产环境中,当代理之间的交互数量远远超过我们人类的交互数量之后”。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%