OpenAI y la demostración de 88 horas que podría no serlo
OpenAI afirma haber resuelto en 88 horas un problema matemático de 90 años utilizando 10 000 agentes de IA. Un equipo rival sostiene que sus propios avances se alimentaron a OpenAI primero. El episodio revela cómo es realmente las matemáticas asistidas por IA y cuánto es puro teatro.
La titularidad que no es titular
OpenAI afirma haber resuelto en 88 horas un problema del millón de dólares del siglo XXI con 90 años de antigüedad. La empresa también repite una y otra vez que no tiene la intención de reclamar el premio. Ambas afirmaciones no pueden coexistir en silencio. Una es un lanzamiento de producto. La otra, control de daños.
Lo que realmente ocurrió es más interesante que el titular y mucho menos definitivo de lo que OpenAI quiere hacer creer.
La afirmación
El 5 de septiembre, OpenAI anunció que un grupo de aproximadamente 10 000 agentes de IA —bots entrenados en un modelo interno sin lanzar, significativamente más capaz que cualquier versión pública— había hallado una solución parcial al problema de la existencia y suavidad de Navier-Stokes. El sistema intercambió cerca de tres millones de mensajes. Consumió 130 mil millones de tokens de salida. Según la propia tarificación de OpenAI, esa huella de cómputo habría costado unos 10 millones de dólares si se facturara externamente.
El resultado resuelve dos de las cuatro afirmaciones que el Instituto Clay de Matemáticas exige para la demostración completa. OpenAI dice que publica el hallazgo para demostrar la capacidad de sus modelos. Asegura que no buscará el premio de 1 millón de dólares.
En el sector de la inteligencia artificial, esa frase suena a acuerdo de conformidad.
La acusación
Mismo día. Horas antes. Tristan Buckmaster, profesor de la Universidad de Nueva York, publicó un relato detallado. Él y Levent Alpoge, un matemático de Anthropic, habían estado trabajando en el mismo problema usando Codex, de OpenAI. Buckmaster sostiene que el 3 de septiembre la información sobre su avance llegó a OpenAI. Al día siguiente, OpenAI publicó un resultado sobre Navier-Stokes.
El relato de Buckmaster incluye intercambios de correos electrónicos en los que cuestionó la cronología y los métodos de OpenAI. Su queja central es procesal, no matemática: si OpenAI derivó trabajo a partir de usuarios de su propia plataforma, aunque sea de forma indirecta.
La respuesta de OpenAI fue calculada. La empresa felicitó el «trabajo concurrente» de Buckmaster y Alpoge. Dijo que no había visto su trabajo de ninguna manera antes de su publicación. Reconoció una posibilidad que calificó de «poco probable»: que datos desidentificados derivados de su uso de Codex mejoraran los modelos que alimentan la herramienta interna de OpenAI. Luego señaló que sus demostraciones difieren significativamente y que incluso los resultados precisos demostrados son diferentes.
La palabra desidentificados hace un trabajo pesado aquí. Es la cláusula de defensa estándar que permite a las compañías admitir un riesgo sin aceptar responsabilidad. Si las interacciones de Buckmaster con Codex influyeron en los pesos de un modelo interno que luego generó los agentes encargados de Navier-Stokes, OpenAI podría haber usado los productos de investigadores no remunerados sin su conocimiento. Eso no es robo en sentido penal. Es el modelo de negocio funcionando según lo diseñado, y el problema es que el diseño tiene un punto ciego moral.
Lo que los números dicen realmente
Seamos concretos sobre lo que representan 10 000 agentes y 130 mil millones de tokens. Se trata de una búsqueda por fuerza bruta disfrazada de interfaz conversacional. Los agentes hablan entre sí. Proponen lemas. Verifican pasos. Retroceden. El proceso se asemeja a cómo ya funciona la demostración de teoremas a gran escala en sistemas como Lean y Coq, pero a escala industrial y sin curadores humanos que guíen la estructura de la demostración.
Dos de cuatro afirmaciones es un resultado parcial. El Instituto Clay no otorga premios por resultados parciales. Tampoco acepta demostraciones generadas por IA sin formalizaciones verificables por humanos y comprobables por máquina. OpenAI no ha aportado ninguna de las dos cosas. El anuncio de la compañía, por tanto, no es una demostración matemática. Es una exhibición de una capacidad que, de escalarse y combinarse con herramientas de verificación formal, podría algún día producir una.
Esa distinción importa porque el mercado está valorando este anuncio como si fuera lo primero.
La pregunta real: verificación, no generación
El episodio expone la frontera de fiabilidad de los modelos fundamentales en dominios donde la verdad es binaria. Un modelo de lenguaje puede generar texto que parece una demostración. También puede generar texto que parece una demostración y contiene un error sutil en el paso 47 de 200. La única forma de saberlo es someter el argumento a un verificador formal. Eso es lento. Eso es costoso. Y también es todo el punto de una demostración.
La ejecución de 88 horas de OpenAI no incluyó un paso de verificación formal. Produjo un argumento legible por humanos que indica que dos subafirmaciones de la conjetura completa parecen sostenerse. Matemáticos independientes no han examinado los detalles. El Instituto Clay no se ha pronunciado. Un profesor que cree que su propio trabajo fue derivado al sistema está disputando públicamente la cronología de la compañía.
Esta no es una demostración fallida. Es una afirmación no verificada. La diferencia lo es todo.
Quién gana, quién pierde
OpenAI gana atención. La narrativa afín a las acciones sobre la IA como investigadora recibe otro capítulo. El modelo interno de la compañía ahora tiene una demostración insignia que ningún benchmark público puede igualar. Esa demostración se citará en presentaciones para atraer inversión, discursos comerciales empresariales y testimonios regulatorios durante meses.
Buckmaster y Alpoge pierden tiempo. Su trabajo ingresó a un sistema al que no aceptaron financiar. Si ese sistema es legalmente culpable depende de los términos de servicio que aceptaron cuando empezaron a usar Codex. Si es éticamente sólido es una pregunta separada, y una que la industria aún no ha respondido.
La comunidad matemática más amplia pierde estándares. Cuando un resultado parcial de un modelo sin lanzar recibe tratamiento titular igual al de una conjetura centenario, la proporción señal-ruido en la comunicación matemática se degrada. Cada afirmación futura se juzgará contra este momento. Algunas serán más rigurosas. La mayoría, menos.
Qué ocurre después
Tres escenarios son plausibles.
En primer lugar, un esfuerzo de verificación formal se desarrolla durante los próximos meses y confirma el resultado parcial, encuentra una laguna o ambas cosas. Ese sería el camino honesto y el más lento.
En segundo lugar, OpenAI publica una versión formalizada de su argumento en un asistente de demostración. Si el verificador de máquinas lo acepta, la comunidad matemática se ocupará seriamente sin importar cómo se descubrió el resultado. La historia de origen es secundaria respecto a la salida. Este es el mejor resultado para todos excepto para los investigadores que sienten que sus contribuciones fueron apropiadas.
En tercer lugar, la afirmación se desvanece en el ruido de fondo de una industria que produce una narrativa de avance por semana. Los agentes regresan a tareas más baratas. El modelo interno se despliega para asistentes de codificación y flujos de atención al cliente. El resultado sobre Navier-Stokes se convierte en una nota al pie con un comunicado de prensa adjunto.
OpenAI dice que no quiere el Premio del Milenio. Pero la compañía ya ha monetizado la afirmación. Eso es suficiente. La pregunta ahora es si la comunidad matemática tratará esto como un método o como un evento de marketing, y si podrá permitirse hacer cualquiera de las dos cosas sin establecer un precedente que recompense la velocidad en lugar de la rigurosidad.