• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

最蠢的AI提示词,竟击败了数月精心设计的游戏提示工程

2026-07-29 02:49:26
收藏

Claude Opus 5 自主构建的第一人称射击游戏

Claude Opus 5 发布仅仅两天后,AI 投资者、前 HyperWrite 首席执行官 Matt Shumer 就发布了一段视频,展示了一个完全可玩的第一人称射击游戏——该模型完全自主构建了这款游戏。

“Claude Opus 5 一次就搞定了这个游戏,”他写道,并补充说整个构建过程中没有使用任何外部资源。

你可能会认为,要生成如此高质量的输出,需要一份冗长、详细且精心设计的提示词,才能引导 AI 模型完成构建一款精良第一人称射击游戏的复杂流程。再想想吧。

背后的提示词只有短短三段,完整发布在 GitHub 上。它指示 Opus 5 构建一款达到最新《使命召唤》水平的射击游戏,展开多个子代理——每个子代理拥有独立的记忆和狭窄的任务——分别处理各个部分,并且针对每个部分反复使用一个独立的、严厉的评判者,直到该部分在盲测对比中能与真实的《使命召唤》画面一较高下。根据提示词,最终结果应该是“绝对完美”。

这与提示词工程师以往教导人们的工作方式截然相反。在“氛围编码”热潮中,建议是明确具体标准而非使用形容词:说出“好”的标准是什么,而不是仅仅要求“好”。代码应该考虑什么,而不是说“AAA 级”。

Shumer 的版本几乎反其道而行之,它要求自己的子代理“彻底震撼”,而将实际定义留给 Opus 5 自己构建的评判者去决定。

这几乎就是全部的指令要求。Shumer 后来写道,他从未指定渲染器,没有列出游戏系统,也没有定义“AAA 级质量”需要包含哪些内容。他开始将这种方法称为“试炼循环”:交给一个代理一个真实可检验的标准,而不是模糊的指令;让它将任务拆分成小块;然后将每个小块交给一个评判者——该评判者永远不会看到构建者对自己选择的理由。

Claude Code 的两个特性实现了这个循环。子代理在隔离的上下文窗口中启动,拥有各自的指令和工具访问权限,因此评判者在评估武器模型时,不会继承构建者关于其外观为何如此的解释。Ultracode 是 Claude Code 的一个设置,它将模型推向最高推理能力,并让其自行编写编排计划,将工作分散到多达 16 个代理上,每次运行上限为 1000 个。

Anthropic 内置的 /loop 技能,专为重复的“修复-测试-调整”循环而设计,确保了在游戏看起来还不错时,运行不会停止。Shumer 从未指定轮数。他让评判者不断指出新的差距,并让构建者持续追赶数小时,直到他自己关闭会话。

最终构建的代码运行在 Three.js 和纯 WebGL2 上,大约 55000 行代码分布在 11 个子系统中。每个纹理、网格、动画和声音都在浏览器加载时生成——没有下载模型、HDR 环境贴图、图片文件或音频文件。Shumer 自己发布的评判者日志显示,评分从 10 分制中的 3.59 分攀升至略高于 5 分,但每一轮仍然落后于真实游戏。

怀疑者认为背后有数小时的隐藏手动编码,因此 Shumer 发布了完整的提示词和代码库。随后,模仿者开始出现。

同样的技巧,三位不同的构建者

前对冲基金经理兼播客主持人 James Altucher 使用了相同的提示词,并报告称花费了“略多于十小时”以及大约 130 万个 token(在 Opus 5 上)才达到目标。他的构建作品《Operation Blackout》在浏览器中免费运行,效果看起来很棒。

Prompt Silo 的开发者则将该请求指向了 OpenAI 的竞品旗舰模型,并发布了“使用相同提示词的 Sol 5.6 Ultra”——Sol 是 OpenAI 于 7 月 9 日与更便宜的 Terra 和 Luna 版本一同发布的 GPT-5.6 系列三模型中的顶级版本。

开发者 Leon Lin 尝试了相反的做法,使用了通常的详细提示词。他没有复制 Shumer 的简短版本,而是着手“逆向工程这款游戏的提示词”,生成了一份约 20 节的文档,详细说明了从布娃娃物理到级联阴影贴图的一切。他将这份文档输入到 Cursor 中,使用普通 Opus 5 的高努力模式,没有子代理,也没有 Ultracode,结果是一款名为《Dust Corridor》的街头射击游戏,同样在浏览器中运行,看起来也很棒。

后续的构建作品都未经过 Shumer 在他自己项目上进行的盲测。他的评判者日志显示,真实的《使命召唤》在他记录的每一轮中都胜出——这正是 Altucher 和 Atom Tan Studio 用他精确的三段提示词所追求的标准,也是 Leon Lin 用他自己大约 20 节内容所追求的标准。

像 Claude Code 这样的代理编码工具编写软件的方式,类似于一位受监督的初级工程师:它们读取文件、运行代码、查看生成的截图,并将任务块交给子代理和评判者,由后者根据既定目标检查结果。这个循环是真实的,而 Shumer 的“试炼循环”是一种组织它的有效方式。然而,所有这些本身并不能证明该模型是凭想象力设计了一款游戏,而不是重新组合了它已经吸收的代码模式。

Three.js 将指针锁定相机控制作为官方示例,这种基础模式——鼠标视角、WASD 移动、用于射击的射线检测——已经通过 GitHub、gist 和开发者论坛被复刻和教程化超过十年。一个基于公共代码库训练的编码模型,在读到 Shumer 的提示词之前,几乎肯定已经见过数百甚至数千个几乎相同的射击游戏。

这并不意味着《Claude of Duty》是假的,但它使得“从头开始构建”这一说法更难被完全采信,所以请对这些结果持保留态度。

研究代码生成模型的研究人员为这个更广泛的问题起了一个名字:数据污染。当模型在某个任务上表现出色,主要是因为它训练数据中已经存在几乎相同的示例,而不是因为它推理出了新东西。

已发布的第一人称射击游戏构建作品都没有检查这种污染。Shumer 自己的代码库中确实包含了 Claude 自身的创造力(如果这样称呼是公平的话)。这正是一个理由,让我们将“一次搞定 AAA 级游戏”解读为一个能干的代理在编程领域中被记录最多的类型之一中工作,而不是证明 AI 设计了一款没有任何先前作品可借鉴的射击游戏。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%