Photon-1 de Induction Labs supera a Google Gemini con 30× menos cómputo

Induction Labs presentó Photon-1 el 23 de jul. de 2026, el primero de lo que llama “modelos de imaginación”: una nueva clase de arquitectura base diseñada para aprender a partir de vídeo a escala de internet sin ejemplos de acciones etiquetadas durante el preentrenamiento. El transformador sparse mixture-of-experts con 106 mil millones de parámetros y 5 mil millones de parámetros activos se entrenó con aproximadamente 575 millones de fotogramas de grabaciones de pantalla de ordenador, equivalente a 18 años de vídeo muestreado a un fotograma por segundo. La empresa afirma que Photon-1 supera a Gemini 3.1 Flash-Lite de Google en benchmarks internos de uso de ordenadores, pese a haberse entrenado con al menos 30 veces menos cómputo, mientras que cuesta aproximadamente tres veces menos por millón de tokens para servir a 0,11 USD, frente a los 0,36 USD de Gemini. El modelo desafía una suposición arraigada en IA: que enseñar a las máquinas a actuar requiere ejemplos meticulosamente etiquetados de cada acción que deberían realizar. El enfoque de Induction Labs elimina un cuello de botella crítico al permitir que las máquinas aprendan conocimiento procedimental simplemente observando vídeo sin etiquetar de interfaces de ordenador en uso.

Photon-1 Architecture and Training Specifications

Photon-1 se entrenó desde cero durante una sola época en un conjunto de datos destilado a partir de un índice inicial de 2 mil millones de vídeos públicamente disponibles, filtrados hasta aproximadamente 2 millones de grabaciones de pantalla y con fotogramas redundantes eliminados por un modelo interno de detección de fotogramas clave. El proceso de entrenamiento requirió aproximadamente 30.000 horas de GPU NVIDIA H200 y 4,4 × 10²² FLOPs. Cada fotograma de vídeo se comprime en 960 tokens discretos mediante cuantización escalar finita, ocupando solo 2,2 kilobytes—aproximadamente 100 veces menos que las representaciones OCR y multimodales existentes—mientras preserva texto, diseño y cambios de estado. Un codificador latente diferencial procesa los fotogramas como pares, codificando diferencias entre estados consecutivos en lugar de contenidos absolutos del fotograma. El modelo predice fotogramas futuros de forma autorregresiva en un espacio de representación aprendido usando una función objetivo de token latente siguiente. Los resultados de benchmark citados por Induction Labs incluyen advertencias importantes: el benchmark es interno y no se ha publicado, lo que significa que los resultados no son reproducibles de forma independiente, y la estimación de cómputo de Gemini es una proyección conservadora de Induction Labs, no datos verificados.

Imagination Models' Compression and Finetuning Process

Convertir conocimiento observacional en un agente funcional requirió una segunda etapa. Induction Labs ajustó Photon-1 con menos de 35.000 trayectorias etiquetadas de uso de ordenador para enseñarle el formato correcto de acción, añadiendo tokens especiales que permiten al modelo emitir comandos de teclado y ratón. En la inferencia, el sistema opera en dos pasos: primero imagina el siguiente estado que haría avanzar la tarea y luego genera la acción destinada a alcanzar ese estado. Después se siguió con aprendizaje por refuerzo en línea, con ejecuciones en tiempo real en máquinas virtuales Linux en cinco entornos de escritorio, resultados verificados de forma programática y señales de recompensa que impulsaron una mejora adicional. Al ajustarse con 20.000 partidas de checkers de torneo, Photon-1 superó tanto un modelo base con codificador de visión como un modelo base de lenguaje de tamaño similar, tanto en simulación del mundo como en calidad de movimiento. En 10.000 juegos de billar generados sintéticamente, logró un error absoluto medio de 0,47 en la predicción de la posición de la bola, frente a 1,15 del baseline LLM y 1,44 del baseline de visión. El modelo también captó patrones de comportamiento humano a partir de sus datos de preentrenamiento: aprendió a solicitar instrucciones a un clon de ChatGPT dentro de una máquina virtual, a comprobar sus salidas y a dirigir la conversación hasta que la tarea se completó.

World Model Developments in 2026

Photon-1 llega en un momento en el que la industria de IA se está pivotando hacia lo que los investigadores llaman en general “world models”: sistemas que construyen representaciones internas de cómo evolucionan los entornos en respuesta a acciones, en lugar de limitarse a predecir texto o generar clips de vídeo aislados. En mayo, Google DeepMind publicó Genie 3, un world model interactivo en tiempo real capaz de generar entornos 3D persistentes a 24 fotogramas por segundo a partir de texto o imágenes, con física aprendida por sí mismo en lugar de reglas codificadas. La plataforma Cosmos de NVIDIA, que ofrece modelos base de world foundation con pesos abiertos entrenados con 20 millones de horas de datos del mundo real, ha superado los dos millones de descargas y está siendo adoptada por empresas de robótica, incluidas 1X, Figure AI y Agility, para la generación de datos de entrenamiento sintéticos. World Labs de Fei-Fei Li lanzó Marble, un sistema disponible comercialmente para crear mundos 3D editables a partir de texto, imágenes o vídeo. AMI Labs de Yann LeCun—según se informa valorado en 3 mil millones de euros antes de lanzar un producto—recaudó 500 millones de euros para perseguir arquitecturas estilo JEPA que aprenden representaciones abstractas prediciendo en el espacio latente en lugar de píxeles. Otros avances notables incluyen Gen-4.5 de Runway, que la empresa enmarca explícitamente como un “world model” con física realista, y DreamZero, un modelo de acción del mundo con 14 mil millones de parámetros que demostró una fuerte transferencia entre corporalidades desde vídeo humano a control de robots usando solo información visual, sin etiquetas de acciones.

FAQ

¿Qué presentó Induction Labs el 23 de jul. de 2026?

Induction Labs presentó Photon-1, el primer “modelo de imaginación”: un transformador sparse mixture-of-experts con 106 mil millones de parámetros y 5 mil millones de parámetros activos entrenado con aproximadamente 575 millones de fotogramas de grabaciones de pantalla de ordenador sin etiquetar. El modelo aprende a usar un ordenador viendo vídeo sin etiquetas de acciones durante el preentrenamiento.

¿Cómo se compara el rendimiento de Photon-1 con Gemini 3.1 Flash-Lite de Google?

Induction Labs afirma que Photon-1 supera a Gemini 3.1 Flash-Lite de Google en benchmarks internos de uso de ordenadores, pese a haberse entrenado con al menos 30 veces menos cómputo. La empresa informa un coste de inferencia de 0,11 USD por millón de tokens frente a los 0,36 USD de Gemini. El benchmark es interno y no se ha publicado, y la estimación de cómputo de Gemini es una proyección de Induction Labs.

¿Qué desarrollos de world model ocurrieron en 2026?

En mayo, Google DeepMind publicó Genie 3, un world model interactivo en tiempo real que genera entornos 3D persistentes a 24 fotogramas por segundo. La plataforma Cosmos de NVIDIA superó los dos millones de descargas y está siendo adoptada por empresas de robótica, incluidas 1X, Figure AI y Agility. World Labs de Fei-Fei Li lanzó Marble para crear mundos 3D editables. AMI Labs de Yann LeCun recaudó 500 millones de euros para perseguir arquitecturas estilo JEPA.

Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios