Claude Opus 5 自主构建的第一人称射击游戏
Claude Opus 5 发布仅仅两天后,AI 投资者、前 HyperWrite 首席执行官 Matt Shumer 就发布了一段视频,展示了一个完全可玩的第一人称射击游戏——该模型完全自主构建了这款游戏。
“Claude Opus 5 一次就搞定了这个游戏,”他写道,并补充说整个构建过程中没有使用任何外部资源。
你可能会认为,要生成如此高质量的输出,需要一份冗长、详细且精心设计的提示词,才能引导 AI 模型完成构建一款精良第一人称射击游戏的复杂流程。再想想吧。
背后的提示词只有短短三段,完整发布在 GitHub 上。它指示 Opus 5 构建一款达到最新《使命召唤》水平的射击游戏,展开多个子代理——每个子代理拥有独立的记忆和狭窄的任务——分别处理各个部分,并且针对每个部分反复使用一个独立的、严厉的评判者,直到该部分在盲测对比中能与真实的《使命召唤》画面一较高下。根据提示词,最终结果应该是“绝对完美”。
这与提示词工程师以往教导人们的工作方式截然相反。在“氛围编码”热潮中,建议是明确具体标准而非使用形容词:说出“好”的标准是什么,而不是仅仅要求“好”。代码应该考虑什么,而不是说“AAA 级”。
Shumer 的版本几乎反其道而行之,它要求自己的子代理“彻底震撼”,而将实际定义留给 Opus 5 自己构建的评判者去决定。
这几乎就是全部的指令要求。Shumer 后来写道,他从未指定渲染器,没有列出游戏系统,也没有定义“AAA 级质量”需要包含哪些内容。他开始将这种方法称为“试炼循环”:交给一个代理一个真实可检验的标准,而不是模糊的指令;让它将任务拆分成小块;然后将每个小块交给一个评判者——该评判者永远不会看到构建者对自己选择的理由。
Claude Code 的两个特性实现了这个循环。子代理在隔离的上下文窗口中启动,拥有各自的指令和工具访问权限,因此评判者在评估武器模型时,不会继承构建者关于其外观为何如此的解释。Ultracode 是 Claude Code 的一个设置,它将模型推向最高推理能力,并让其自行编写编排计划,将工作分散到多达 16 个代理上,每次运行上限为 1000 个。
Anthropic 内置的 /loop 技能,专为重复的“修复-测试-调整”循环而设计,确保了在游戏看起来还不错时,运行不会停止。Shumer 从未指定轮数。他让评判者不断指出新的差距,并让构建者持续追赶数小时,直到他自己关闭会话。
最终构建的代码运行在 Three.js 和纯 WebGL2 上,大约 55000 行代码分布在 11 个子系统中。每个纹理、网格、动画和声音都在浏览器加载时生成——没有下载模型、HDR 环境贴图、图片文件或音频文件。Shumer 自己发布的评判者日志显示,评分从 10 分制中的 3.59 分攀升至略高于 5 分,但每一轮仍然落后于真实游戏。
怀疑者认为背后有数小时的隐藏手动编码,因此 Shumer 发布了完整的提示词和代码库。随后,模仿者开始出现。
同样的技巧,三位不同的构建者
前对冲基金经理兼播客主持人 James Altucher 使用了相同的提示词,并报告称花费了“略多于十小时”以及大约 130 万个 token(在 Opus 5 上)才达到目标。他的构建作品《Operation Blackout》在浏览器中免费运行,效果看起来很棒。
Prompt Silo 的开发者则将该请求指向了 OpenAI 的竞品旗舰模型,并发布了“使用相同提示词的 Sol 5.6 Ultra”——Sol 是 OpenAI 于 7 月 9 日与更便宜的 Terra 和 Luna 版本一同发布的 GPT-5.6 系列三模型中的顶级版本。
开发者 Leon Lin 尝试了相反的做法,使用了通常的详细提示词。他没有复制 Shumer 的简短版本,而是着手“逆向工程这款游戏的提示词”,生成了一份约 20 节的文档,详细说明了从布娃娃物理到级联阴影贴图的一切。他将这份文档输入到 Cursor 中,使用普通 Opus 5 的高努力模式,没有子代理,也没有 Ultracode,结果是一款名为《Dust Corridor》的街头射击游戏,同样在浏览器中运行,看起来也很棒。
后续的构建作品都未经过 Shumer 在他自己项目上进行的盲测。他的评判者日志显示,真实的《使命召唤》在他记录的每一轮中都胜出——这正是 Altucher 和 Atom Tan Studio 用他精确的三段提示词所追求的标准,也是 Leon Lin 用他自己大约 20 节内容所追求的标准。
像 Claude Code 这样的代理编码工具编写软件的方式,类似于一位受监督的初级工程师:它们读取文件、运行代码、查看生成的截图,并将任务块交给子代理和评判者,由后者根据既定目标检查结果。这个循环是真实的,而 Shumer 的“试炼循环”是一种组织它的有效方式。然而,所有这些本身并不能证明该模型是凭想象力设计了一款游戏,而不是重新组合了它已经吸收的代码模式。
Three.js 将指针锁定相机控制作为官方示例,这种基础模式——鼠标视角、WASD 移动、用于射击的射线检测——已经通过 GitHub、gist 和开发者论坛被复刻和教程化超过十年。一个基于公共代码库训练的编码模型,在读到 Shumer 的提示词之前,几乎肯定已经见过数百甚至数千个几乎相同的射击游戏。
这并不意味着《Claude of Duty》是假的,但它使得“从头开始构建”这一说法更难被完全采信,所以请对这些结果持保留态度。
研究代码生成模型的研究人员为这个更广泛的问题起了一个名字:数据污染。当模型在某个任务上表现出色,主要是因为它训练数据中已经存在几乎相同的示例,而不是因为它推理出了新东西。
已发布的第一人称射击游戏构建作品都没有检查这种污染。Shumer 自己的代码库中确实包含了 Claude 自身的创造力(如果这样称呼是公平的话)。这正是一个理由,让我们将“一次搞定 AAA 级游戏”解读为一个能干的代理在编程领域中被记录最多的类型之一中工作,而不是证明 AI 设计了一款没有任何先前作品可借鉴的射击游戏。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注