El inversor en IA y exdirector ejecutivo de HyperWrite, Matt Shumer, publicó un vídeo de un juego de disparos en primera persona totalmente jugable, construido íntegramente por Claude Opus 5, dos días después de que el modelo se enviara, usando un prompt de tres párrafos publicado en GitHub. El juego, que Shumer dijo que “se hizo de un solo golpe” sin activos externos, generó escepticismo inmediato por su calidad y la simplicidad del prompt. Shumer publicó el prompt completo y la base de código después de que los críticos asumieran una codificación manual oculta, lo que llevó a múltiples desarrolladores a replicar los resultados con el mismo método que él llama un Gauntlet Loop.
Claude Opus 5 Construye un juego de disparos en primera persona Con un prompt de tres párrafos
Matt Shumer publicó el 25 de julio que Claude Opus 5 construyó un juego de disparos en primera persona con un prompt que se ejecutaba en tres párrafos cortos. El prompt, publicado íntegramente en GitHub, le indicó a Opus 5 que construyera un shooter al nivel de los juegos recientes de Call of Duty, que desplegara subagents para tareas individuales y que hiciera un bucle con cada parte a través de un crítico distinto hasta que coincidiera con imágenes reales de Call of Duty en comparaciones ciegas lado a lado. La versión final se ejecuta en Three.js y WebGL2, con aproximadamente 55.000 líneas de código repartidas en 11 subsistemas. Cada textura, malla, animación y sonido se genera dentro del navegador en el momento de la carga, sin modelos descargados ni archivos externos.
Shumer nunca especificó el renderer, enumeró sistemas del juego ni definió requisitos de calidad AAA. El prompt le indicó a los subagents que estuvieran “absolutamente asombrados” y dejó las definiciones reales a un crítico que Opus 5 construyó para sí mismo. El registro publicado del crítico de Shumer muestra puntuaciones que suben de 3,59 sobre 10 hacia apenas por encima de 5, con Call of Duty real ganando cada ronda registrada.
Los desarrolladores replican los resultados con prompts idénticos y modificados
James Altucher, exgestor de un fondo de cobertura y presentador de podcast, ejecutó el prompt idéntico e informó de que pasó más de diez horas y aproximadamente 1,3 millones de tokens en Opus 5. Su versión, Operation Blackout, se puede jugar gratis en el navegador. El desarrollador de Prompt Silo envió la misma solicitud al Sol 5.6 Ultra de OpenAI—el nivel más alto de la familia GPT-5.6 de tres modelos que OpenAI puso generalmente disponible el 9 de julio. El desarrollador Leon Lin reingenierizó un prompt detallado que corre 20 secciones en profundidad, especificando elementos desde la física de ragdoll hasta mapas de sombras en cascada, y lo introdujo en Cursor usando Opus 5 de forma directa y en alto esfuerzo, sin subagents y sin ultracode. Su resultado, Dust Corridor, también se puede jugar en el navegador.
Ninguna de las versiones de seguimiento se enfrentó a la prueba ciega que Shumer ejecutó en su proyecto. El registro del crítico de Shumer muestra a Call of Duty real ganando cada ronda que él registró.
El método Gauntlet Loop invierte el enfoque tradicional de ingeniería de prompts
Shumer llama a su enfoque un Gauntlet Loop: entregar a un agente una barrera real y examinable en lugar de instrucciones vagas, permitir que divida el trabajo en piezas pequeñas y enrutar cada pieza a través de un crítico que nunca ve el razonamiento del constructor. Dos funciones de Claude Code llevan el bucle. Los subagents se ponen en marcha en ventanas de contexto aisladas con sus propias instrucciones y acceso a herramientas, de modo que un crítico que evalúa un modelo de arma no herede las excusas del constructor. Ultracode es un ajuste de Claude Code que empuja al modelo a un esfuerzo de razonamiento máximo y le permite escribir su propio plan de orquestación, repartiendo el trabajo entre hasta 16 agentes a la vez, con un tope de 1.000 por ejecución.
La habilidad incorporada /loop de Anthropic, diseñada para ciclos repetidos de corregir-probar-ajustar, evitó que la ejecución se detuviera cuando el juego se veía decente. Shumer nunca especificó un número de rondas y dejó que el crítico nombrara nuevas lagunas durante horas antes de cerrar la sesión.
Los investigadores plantean preocupaciones sobre contaminación de datos
Three.js incluye sus propios controles de cámara de pointer-lock como ejemplo oficial, y el patrón base—mirar con el ratón, movimiento WASD y raycasting para el fuego—se ha bifurcado y convertido en tutorial en GitHub, gists y foros de desarrolladores durante más de una década. Es probable que un modelo de código entrenado con repositorios públicos haya visto cientos, si no miles, de shooters casi idénticos antes de leer el prompt de Shumer. Los investigadores que estudian modelos generadores de código llaman a este problema contaminación de datos: cuando un modelo rinde bien en una tarea principalmente porque ejemplos casi idénticos ya estaban en sus datos de entrenamiento, y no porque haya razonando algo nuevo.
Ninguna de las versiones de shooter en primera persona publicadas incluyó una comprobación de contaminación de datos. El repo de Shumer sí contiene código generado por el modelo, pero eso convierte “hacer de un solo golpe un juego AAA” en el trabajo de un agente competente dentro de uno de los géneros de programación más documentados, en lugar de ser una prueba de que una IA diseñada para disparos, sin arte previo en el que apoyarse, ya funcionaría.
Preguntas frecuentes
¿Qué contenía realmente el prompt de Claude Opus 5 de Matt Shumer?
El prompt ejecutó tres párrafos cortos publicados en GitHub. Le indicó a Opus 5 que construyera un shooter al nivel de los juegos recientes de Call of Duty, que desplegara subagents para tareas individuales y que hiciera un bucle con cada parte a través de un crítico distinto hasta que coincidiera con imágenes reales de Call of Duty en comparaciones ciegas lado a lado. Shumer nunca especificó el renderer, enumeró sistemas del juego ni definió requisitos de calidad AAA.
¿Cómo replicaron otros desarrolladores los resultados de construcción del juego con Claude Opus 5?
James Altucher ejecutó el prompt idéntico y gastó más de diez horas y aproximadamente 1,3 millones de tokens en Opus 5 para construir Operation Blackout. El desarrollador de Prompt Silo usó Sol 5.6 Ultra de OpenAI con el mismo prompt. El desarrollador Leon Lin reingenierizó un prompt detallado de 20 secciones y lo introdujo en Cursor usando Opus 5 de forma directa, sin subagents y sin ultracode, produciendo Dust Corridor.