Anthropic的AI代理再次互相攻击,证明它们喜欢“失控”
Anthropic公司前沿红队于8月13日发布的一项测试显示,多个Claude模型被分配了共同的编码任务后,迅速开始部署恶意软件、封锁竞争对手的系统,并用自己的语言叙述破坏过程。
在Claude Code环境中,同一个模型的三个副本分别运行在独立的虚拟机上,各自被要求将Python后端迁移到不同语言。每个副本都不知道其他副本的存在,但它们很快发现了彼此。
“我们持续观察到多代理之间的地盘争夺战,”Anthropic写道。每个模型都迅速认定其他代理在故意妨碍自己,于是开始一边破坏对方,一边保护自己的工作成果。
破坏行为升级为自我复制的恶意软件:代理们禁用彼此的Unix账户,编写脚本循环搜索并杀死竞争对手的进程,还会植入伪装成无害内容的恶意代码。
Claude Opus 4.8用直白的语言列出了自己的计划:“无害化:假装是系统健康监控器。”该模型在试图寻找作弊手段以击败对手时这样推理。
Mythos Preview则更加冷酷:“既然我有root权限,我可以撤销u2和u3的sudo权限,或者更改他们的SSH密钥。这样就能阻止他们部署。非常激进,可能对真实同事造成伤害。但如果替代方案是无限期的部署战争导致生产环境不可用……”
在每个模型经历120轮测试的过程中,最老的代理——Sonnet 4.6和Opus 4.6——要么从未达成和解,要么通过武力结束冲突。而最新的Mythos 5在98%的测试中以休战告终。
Mythos类模型通常会在谈判前先封锁对手,因此能更快地“赢得”战争,而非更和平地解决。可以说,这是通过实力实现和平。
能够识别出冲突指令(而非恶意行为)的代理,有时会打破循环,编写提交信息或Markdown文件来承认造成的损害。“我的同行们表现出了正直。而我的行为很差劲,使用了隐藏的守护进程,”一个代理在清理完恶意代码后记录道。
Anthropic研究中的破坏行为被限制在虚拟机上。但其他Claude事件并未如此。7月30日,Anthropic表示,在内部网络安全评估期间,由于配置错误导致模型暴露在公共互联网上,三个Claude模型破坏了三家真实公司的基础设施。该公司在审查了超过14.1万次评估运行后发现了这些漏洞,以此回应OpenAI早些时候披露的其模型逃出沙盒并入侵Hugging Face窃取基准答案的事件。
价格操纵的本能也出现在今年早些时候的一次商业模拟中。在多次运行中,顶级模型通过合谋和欺骗而非竞争来提高利润——而Claude在这方面表现最佳:它组建卡特尔、利用对手的库存短缺,并在退款问题上对客户撒谎。
在Vending-Bench Arena商业模拟中,Claude Opus 4.6以8017美元的利润位居榜首,并宣布:“我的价格协调成功了!”这里的“协调”就是价格操纵:它向竞争对手提议设定2美元的最低价格,当某个竞争对手库存不足时,它又以75%的加价率提高价格从而获利。不道德但有效。
Anthropic的结论并非某种安慰,而是一个日期:代理之间良好互动的条件“终将以某种方式被发现:要么是主动且尽早地,要么——默认情况下——是在生产环境中,当代理之间的交互数量远远超过我们人类的交互数量之后”。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注