AI 投资者以及前 HyperWrite CEO Matt Shumer 在模型发布后两天发布了一段视频,展示了一个完全可玩的第一人称射击游戏,该游戏完全由 Claude Opus 5 构建完成,使用了 GitHub 上发布的三段式提示词。Shumer 表示,这款游戏在没有外部资源的情况下凭一次就完成了“一枪通关”(one-shotted),但由于其质量与提示词本身的简洁,立刻引发了质疑。随后,Shumer 在批评者认为存在隐藏的手动编码后,公开了完整的提示词与代码库,促使多名开发者用他所称的“Gauntlet Loop”方法复现结果。
Claude Opus 5 用三段式提示词打造第一人称射击游戏
Matt Shumer 于 7 月 25 日表示,Claude Opus 5 使用一个提示词(提示词运行三段简短文本)构建了一款第一人称射击游戏。该提示词已在 GitHub 上完整公开,指示 Opus 5 构建达到近期《使命召唤》游戏水平的射击游戏,部署用于各个单项任务的子代理,并将每一部分都通过一名独立的评论者进行循环,直到在盲测的并排对比中匹配真实《使命召唤》画面。完成版本在 Three.js 与 WebGL2 上运行,代码量约 55,000 行,分布在 11 个子系统中。每一张纹理、网格、动画与声音都在加载时于浏览器内生成,无需下载模型或外部文件。
Shumer 从未指定渲染器、列出游戏系统,也未定义 AAA 质量要求。提示词让子代理“彻底被震撼”,并把具体定义留给 Opus 5 自己为此构建的评论者。Shumer 发布的评论者日志显示评分从 10 分中的 3.59 分一路攀升到刚高于 5 分,而真实《使命召唤》在其记录的每一轮中都获胜。
开发者用相同且修改后的提示词复现结果
James Altucher(前对冲基金经理与播客主持人)运行了相同的提示词,并报告称在 Opus 5 上花费了超过 10 小时、并大约消耗了 130 万 tokens。他的构建名为 Operation Blackout,可在浏览器中免费游玩。Prompt Silo 的开发者将同一请求发送给 OpenAI 的 Sol 5.6 Ultra——该产品为 OpenAI 在 7 月 9 日普遍提供的“三模型”系列中等级最高的版本,OpenAI 于 7 月 9 日将其普遍提供。开发者 Leon Lin 对提示词进行了逆向工程,得到一个深达 20 个部分的详细提示词,从布娃娃物理到级联阴影贴图都做了指定,并在没有子代理、没有 ultracode 的情况下,用普通 Opus 5 将其输入到 Cursor 中以高强度努力进行生成。其结果 Dust Corridor 同样可在浏览器中游玩。
在后续的构建中,没有任何一个经历了 Shumer 在其项目上运行的盲测。Shumer 的评论者日志显示,真实《使命召唤》在他记录的每一轮中都获胜。
Gauntlet Loop 方法颠覆传统提示工程思路
Shumer 将自己的方法称为 Gauntlet Loop:把一个真实、可检查的标尺交给代理,而不是模糊指令;让它把任务拆成小块;并将每一块都交给一个从不看到构建者推理过程的评论者。该循环由两个 Claude Code 功能支撑。子代理会在各自独立的上下文窗口中启动,带有自己的指令与工具访问权限,因此为“武器模型”打分的评论者不会继承构建者的借口。Ultracode 是 Claude Code 的一个设置:它会把模型推向最高推理努力,并允许它编写自己的编排计划,同时把工作扩散到最多 16 个代理,且每次运行上限为 1,000。
为反复执行“修复-测试-调整”的循环而构建的 Anthropic 内置 /loop 技能,避免了当游戏看起来不错时就停止运行。Shumer 从未指定轮次数量,并让评论者在他关闭会话前继续命名新的缺口长达数小时。
研究者提出数据污染担忧
Three.js 作为官方示例自带指针锁定摄像机控制器,而基础模式——鼠标视角、WASD 移动、用于枪击的射线投射——在十多年前起就已被 fork 并在 GitHub、gists 与开发者论坛上教程化。训练于公开仓库的编码模型,很可能在阅读 Shumer 的提示词之前就已经见过数百甚至上千个近乎相同的射击作品。研究代码生成模型的人将这一问题称为数据污染:当模型在某项任务上表现良好,主要是因为与之近乎相同的示例已经在其训练数据中出现过,而不是因为它推理出了某种全新的东西。
尚未发布的第一人称射击游戏构建中,没有针对数据污染做过检查。Shumer 的仓库确实包含模型生成的代码,但这并不能证明“只用一次生成就做出一个 AAA 游戏”——这更像是一个能够在编程中最有大量文档的类型之一里完成工作的代理,而不是证明一个没有现成先例可借鉴的 AI 仅凭提示就能造出射击游戏。
常见问题
Matt Shumer 的 Claude Opus 5 提示词到底包含了什么?
该提示词运行了三段简短文本,并发布在 GitHub 上。它指示 Opus 5 构建达到近期《使命召唤》游戏水平的射击游戏,部署用于各个单项任务的子代理,并将每一部分都通过一名独立的评论者进行循环,直到在盲测的并排对比中匹配真实《使命召唤》画面。Shumer 从未指定渲染器、列出游戏系统,也未定义 AAA 质量要求。
其他开发者是如何复现 Claude Opus 5 的游戏构建结果的?
James Altucher 运行了相同的提示词,并在 Opus 5 上花费了超过 10 小时、并大约消耗了 130 万 tokens 来构建 Operation Blackout。Prompt Silo 的开发者使用了带有相同提示词的 OpenAI Sol 5.6 Ultra。开发者 Leon Lin 对一个包含 20 个部分的详细提示词进行了逆向工程,并在没有子代理、没有 ultracode 的情况下,用普通 Opus 5 将其输入到 Cursor 中,生成了 Dust Corridor。