Japón descubrió la mayor falla de IA de OpenAI… y los medios occidentales lo pasaron por alto
Un sitio japonés de videojuegos adelantó la noticia de que GPT-6 Astra apenas puede resolver los rompecabezas de física de Portal. La verdadera lección no es que lo logró, sino qué revelan sus formas de fallo sobre el razonamiento de la IA de vanguardia.
El informe que nadie en Occidente vio venir
El 7 de septiembre, gamespark.jp publicó un informe sobre algo mucho más interesante de lo que su titular sugiere. El último modelo de OpenAI, GPT-6 Astra —ampliamente considerado como un escalón hacia la inteligencia artificial general— puede vencer a Portal, el juego de puzles de Valve de 2007, en menos de dos horas de juego. El número real, sin embargo, es de veintitrés horas y treinta y ocho minutos. Esa brecha lo cuenta todo.
El usuario de GitHub cozyblaze documentó el experimento. El método es sencillo: ejecutar el juego durante unos segundos, pausarlo, capturar una captura de pantalla, alimentarla al GPT-6 Astra, dejar que el modelo piense mientras el juego permanece en pausa, y luego ejecutar el movimiento de cámara y la pulsación de botón que el modelo decida. Repetir. Seis mil novecientas veinticinco operaciones. Quinientos setenta y uno dólares en coste de tokens.
El modelo terminó. Pero cómo terminó importa más.
El problema de la física
Un vídeo de YouTube de la partida muestra a GPT-6 Astra usando el arma de portales con competencia razonable. Coloca portales en paredes y suelos, navega por habitaciones, resuelve ese tipo de puzles de lógica espacial para los que Portal fue diseñado. Donde tropieza —y esta es la parte que debería alarmar a cualquiera que siga la capacidad de la IA de vanguardia— es con el momento cinético.
Plataformas móviles. Puzles dependientes de la velocidad. Situaciones donde el movimiento correcto depende de entender cuánto recorrerás después de dejar una superficie. El modelo vacila, se equivoca, a veces se lanza por bordes que debería haber evitado.
Esto no es un modo de fallo menor. Es estructural.
GPT-6 Astra procesa fotogramas individuales. No mantiene un modelo interno continuo del movimiento a través del tiempo. Cada decisión es una tarea de clasificación discreta disfrazada de lenguaje de razonamiento. El modelo puede entender que una plataforma se mueve, pero no puede simular con facilidad hacia adelante lo que ocurrirá cuando pise una y lleve momento cinético a través de un hueco. No es un problema de datos. Es un problema de arquitectura.
Las implicaciones van mucho más allá de un juego de puzles. El diseño basado en momento cinético de Portal obliga a los jugadores a interiorizar una física que no pueden ver: calcular trayectorias, estimar la transferencia de velocidad, confiar en que una acción tomada ahora producirá un resultado específico más tarde. Un jugador humano desarrolla esta intuición mediante la práctica encarnada. El modelo no tiene nada de eso. Ve un fotograma. Predice un movimiento. No conserva un modelo coherente del mundo de un momento a otro.
Los investigadores que han estudiado la alineación y robustez de la IA han advertido durante mucho tiempo que los sistemas de reconocimiento de patrones fallan de maneras previsibles cuando se los empuja a situaciones nuevas. El experimento de Portal hace esto visible en tiempo real. Observa al modelo entrar en una cámara con una plataforma móvil y observa cómo trata el problema como estático. La plataforma se mueve. El modelo no se ajusta. Dispara un portal basado en dónde estaba la plataforma, no en dónde estará. Esto no es un error. Es la salida natural de un sistema que razona en instantáneas.
Por qué Japón llegó primero
Los medios occidentales han cubierto los lanzamientos de GPT-6 Astra a grandes trazos: puntuaciones de benchmarks, titulares sobre proximidad a la IAG, el circuito habitual. No parece que ninguna publicación importante en inglés haya cubierto el experimento de Portal. Gamespark, un sitio construido alrededor de noticias de videojuegos japonesas, sí lo hizo.
El escritor, K.K., es graduado en psicología que cubre videojuegos para el sitio desde 2022. Su biografía menciona su afición por la ciencia ficción, los juegos de mundo abierto y la ficción militar. También admite que es denso ante los sentimientos románticos de los demás pero que entiende mejor las emociones animales —y luego le echa la culpa a no tener cola ni orejas. La pieza en sí es factual y medida, pero está archivada bajo una sección sobre capacidades de IA en videojuegos, que es exactamente donde pertenece esta historia.
La brecha en la cobertura no es de calidad. Es de atención. Los medios tecnológicos occidentales persiguen la narrativa de la IAG con una ferocidad que deja poco margen para el tipo de pruebas granulares y poco glamurosas que realmente revelan qué pueden y no pueden hacer estos modelos. Un medio de videojuegos japonés ejecutando un speedrun de Portal con un agente de IA es lo opuesto a un titular. Es una nota al pie. Precisamente por eso se escribió.
También hay una razón estructural que merece la pena señalar. Japón tiene una larga tradición de tratar los videojuegos como objetos culturales serios dignos de análisis riguroso. El periodismo de videojuegos allí tiende a priorizar la artesanía, la mecánica y la experiencia del jugador por encima de los ciclos de hype. Cuando un medio de videojuegos prueba una IA contra un juego de puzles, aborda la pregunta desde un ángulo diferente al de un blog tecnológico que lo aborda desde la disrupción del mercado o los hitos de capacidad. La cobertura japonesa se centró en cómo la IA jugaba, no en si representaba un avance. Esa diferencia de encuadre es en sí misma una especie de señal.
El coste de un pensamiento
571 dólares por completar Portal no es trivial. Tampoco es sorprendente si comprendes la mecánica. Cada una de las 6.925 operaciones requiere una entrada de imagen y una salida de texto. El modelo pausa el juego mientras piensa. En un juego donde la ejecución en tiempo real permitiría a un jugador diestro resolver la cámara final en menos de tres minutos, GPT-6 Astra pasó unas veinte horas en tiempo puro de toma de decisiones.
La mayoría de esas decisiones fueron correctas. La mayoría no fueron rápidas. El modelo está intercambiando computación por razonamiento de una manera que los jugadores humanos no necesitan. Un jugador ve una plataforma móvil y sabe, sin cálculo, si puede hacer el salto. El modelo ve un fotograma estático, lo procesa por una tubería de razonamiento y produce una acción. La diferencia no es inteligencia. Es encarnación.
El coste financiero plantea una pregunta práctica que la cobertura ha ignorado mayoritariamente: ¿en qué punto este enfoque se vuelve viable para algo más allá de experimentos novedosos? 571 dólares por Portal es caro. Escala eso a un entorno más complejo —un juego que requiera cientos de horas de interacción, múltiples sistemas físicos, cambios ambientales dinámicos— y los costes de tokens se vuelven prohibitivos. Ni siquiera GPT-6 Astra puede sostener esta estrategia indefinidamente. El experimento es impresionante precisamente porque es antieconómico.
Efectos de segundo orden
El experimento de Portal repercutirá en varias comunidades de maneras que ya son visibles. Las comunidades de speedrunning, que han pasado décadas optimizando la finalización de Portal mediante explotación de glitches e inputs perfectos por fotograma, están tratando la ejecución de la IA con una mezcla de fascinación y menosprecio. Algunos lo ven como una nueva categoría de juego. Otros lo ven como un no-jugador compitiendo en un espacio diseñado para la expresión humana. La tensión entre estas posturas es productiva. Obliga a una conversación sobre qué cuenta como logro en los sistemas interactivos.
Los investigadores de seguridad de la IA están tomando nota por una razón diferente. Los modos de fallo observados aquí —mal juicio del momento cinético, falta de continuidad temporal, sobreconfianza en el razonamiento estático— son las mismas clases de error que aparecen cuando estos modelos se despliegan en robótica, sistemas autónomos y diagnósticos médicos. Un modelo que no puede rastrear de forma fiable la física cambiante en un juego simple es improbable que gestione la incertidumbre continua del mundo real. El experimento de Portal es pequeño. La advertencia que lleva no lo es.
También hay un ángulo económico. El coste de 571 dólares por ejecución genera presión sobre la industrialización de los benchmarks que OpenAI y otros laboratorios han construido. Si las pruebas más creíbles de razonamiento requieren miles de llamadas de inferencia discretas por minuto, el coste de validación escala de forma no lineal. Esto podría incentivar benchmarks más baratos pero menos honestos —los que miden reconocimiento de patrones superficial en lugar de razonamiento genuino. El experimento de Portal, al ser costoso y lento, pone de manifiesto inadvertidamente la fragilidad del ecosistema de evaluación actual.
Qué pasará después
cozyblaze ha dicho que quiere probar el mismo experimento con Portal 2. Eso vale la pena observar. Portal 2 introduce puzles de momento cinético más complejos, peligros ambientales que requieren temporización, y una estructura narrativa que exige memoria a través de capítulos. Si GPT-6 Astra tiene dificultades con plataformas móviles básicas, Portal 2 expondrá las limitaciones con más crudeza. La secuela también añade geles que alteran propiedades físicas, superficies compatibles con portales que cambian según la colocación del jugador, y torretas que requieren razonamiento táctico sobre líneas de visión y ciclos de recarga. Cada nueva mecánica es otra prueba de estrés para un sistema que ya vacila en la simplicidad.
En términos más amplios, este experimento revela algo que la conversación sobre la IAG sigue ignorando. Aprobar un benchmark —incluso uno clevermente construido— no significa que un modelo entienda el mundo. Significa que ha aprendido a mapear entradas visuales a salidas de acción en un contexto específico. El modelo resolvió Portal. No lo resolvió como lo hace un humano. Lo resolvió como lo hace una calculadora muy cara: fotograma a fotograma, pausa a pausa, dólar a dólar.
La verdadera historia aquí no es que GPT-6 Astra pueda jugar a Portal. Es que la prensa occidental ignoró el informe por completo, y que los modos de fallo embebidos en el éxito son exactamente los que más importan para cualquiera que siga si estos sistemas se acercan al razonamiento general o simplemente están mejorando en el reconocimiento de patrones en entornos confinados.
Japón ya lo sabía. La pregunta es si el resto del mundo se pondrá al día —o si el próximo experimento que importe volverá a pasar desapercibido mientras todos miran el tráiler equivocado.