Brecha de credibilidad: las afirmaciones matemáticas de OpenAI
OpenAI publicó cientos de demostraciones matemáticas que no cumplieron con los estándares que decía seguir. La brecha entre el marketing de la IA y los resultados verificables se amplía, y los matemáticos están señalándolo.
Las directrices del grupo asesor eran claras. OpenAI las ignoró en su mayor parte.
Cuando OpenAI lanzó esta semana cientos de supuestas soluciones a algunos de los problemas matemáticos más difíciles del mundo, el laboratorio afirmó que había consultado a un grupo asesor de matemáticos de élite, presumiblemente para evitar la controversia que acompañó su último gran anuncio sobre resolución de problemas. No sirvió de nada.
OpenAI no alcanzó los estándares que decía seguir, especialmente en lo que respecta a la insistencia de los matemáticos en que la comprensión humana es un componente innegociable de cualquier resultado matemático real. Esa brecha entre lo declarado y lo logrado se está convirtiendo en la historia definitoria del problema de credibilidad de la inteligencia artificial.
El Grupo Asesor sobre Matemáticas e Inteligencia Artificial (AGMAI), alojado en el Instituto de Estudios Avanzados de la Universidad de Princeton, publicó sus directrices para los laboratorios de vanguardia a finales de septiembre. Nueve investigadores prominentes de todo el mundo forman parte del grupo. Su primera recomendación era tajante: dejar de evaluar problemas matemáticos avanzados en modelos propietarios. El lanzamiento de OpenAI afirmaba explícitamente que estaba haciendo exactamente eso.
El laboratorio siguió algunos principios —publicar los resultados con rapidez, incluir información sobre cómo los modelos llegaron a sus conclusiones— pero de forma selectiva. Solo 10 de los 719 manuscritos incluían la cadena de pensamiento del modelo. Para los artículos que los humanos aún no comprenden, AGMAI recomendó la formalización mediante herramientas como Lean, un lenguaje de programación que verifica demostraciones compilándolas como código. Solo el 42 por ciento de las demostraciones de OpenAI había pasado por ese proceso.
Más importante aún, el grupo le pidió a OpenAI que ayudara a financiar a los matemáticos humanos que harían falta para dar significado a esas soluciones. No hubo indicios de que el laboratorio se comprometiera a ello. Cuando AGMAI solicitó metadatos legibles por máquina que correlacionaran las demostraciones en lenguaje natural con los artefactos formales —esencialmente un mapa para que los humanos pudieran seguir la traducción—, OpenAI no los proporcionó.
Una mala traducción que no debe ignorarse
Un artículo de esta semana, firmado por matemáticos de la Universidad de Cambridge y el King’s College London, documenta el riesgo concreto de omitir la supervisión humana. Los investigadores hallaron al menos dos discrepancias entre la explicación en lenguaje natural de una solución y el código Lean subyacente en la demostración propuesta por OpenAI para un problema derivado de las ecuaciones de Navier-Stokes, las célebres ecuaciones de dinámica de fluidos que conllevan un Premio Millennium de un millón de dólares.
Las discrepancias no desmienten necesariamente la solución. Pero demuestran que los laboratorios de vanguardia no pueden simplemente automatizar la traducción desde el lenguaje matemático comprensible para humanos hasta código verificable por máquina y dar por terminado el trabajo. El proceso es frágil. Los autores del artículo escribieron que estas demostraciones de Lean autoformalizadas “no deben confiarse a simple vista sin el mismo proceso de revisión por pares y escrutinio al que se someten otras demostraciones”.
Esa es una barra baja. Todo resultado matemático publicado pasa por revisión por pares antes de ingresar al canon. Los lanzamientos de OpenAI saltan ese proceso por completo.
El problema de la comprensión
Terence Tao, el matemático de Stanford y medallista Fields que ha sido abiertamente crítico con el enfoque de OpenAI, lo expresó con claridad en redes sociales después del lanzamiento: los problemas se resuelven de forma autónoma por “prompters de IA que no muestran interés en el campo en su conjunto una vez resuelto su objetivo inicial, y que no entienden lo suficiente la salida de la IA como para responder preguntas sobre el resultado, dar conferencias o interactuar de otro modo con el resto del campo”.
Ese último punto es el núcleo del problema. Cuando un matemático humano descubre un resultado, asume la responsabilidad sobre él. Lo publica. Lo presenta en seminarios. Responde preguntas de colegas. La comunidad lo escruta, lo amplía y lo aplica. La comprensión se profundiza. El resultado se convierte en parte de la base de conocimientos compartida en lugar de ser una salida de caja negra.
“Cuando un modelo se solicita resolver un problema difícil y escupe una solución, no hay comprensión humana de la misma en el momento del lanzamiento, y ahora comienza el trabajo”, dijo la profesora de matemáticas de Harvard Melanie Wood. En otras palabras, el lanzamiento del modelo no es el final del proceso, sino el comienzo. Y por ahora, nadie está recogiendo el testigo.
Por qué esto importa más allá de las matemáticas
El episodio de las matemáticas de OpenAI no se trata solo de si un puñado de demostraciones resisten el chequeo. Es un estudio de caso sobre lo que ocurre cuando una industria acelera por encima de la verificación en busca de victorias narrativas. El laboratorio quería posicionarse como responsable: consultar a un grupo asesor, publicar con rapidez, ofrecer transparencia. Pero la sustancia no coincidía con el marco presentado.
Este es el patrón que se repite en toda la evaluación por benchmarks de la IA. Los modelos afircan puntuaciones en evaluaciones que miden algo cercano al razonamiento, pero no el razonamiento completo. Los resultados se publican antes de la revisión por pares. Las afirmaciones controvertidas circulan porque son llamativas, no porque hayan sobrevivido al escrutinio.
Los matemáticos de Cambridge y el King’s College son claros sobre lo que está en juego: si se quiere que las demostraciones generadas por IA sean aceptadas como contribuciones reales al campo, necesitan sobrevivir a los mismos procesos a los que sobreviven las contribuciones reales. No un comunicado de prensa. No una sesión fotográfica con un grupo asesor. Un compromiso humano real con el trabajo.
AGMAI no respondió a la solicitud de TechCrunch de una evaluación más exhaustiva del último lanzamiento de OpenAI. Ese silencio puede ser elocuente. Las directrices del grupo eran específicas. Los resultados de OpenAI estaban disponibles públicamente. La brecha entre ambos es ahora cuestión de registro.
Lo que ocurra a continuación dependerá de si la comunidad matemática trata estos lanzamientos como puntos de partida para la colaboración o como curiosidades para archivar. La primera vía beneficia a todos. La segunda convierte las matemáticas generadas por IA en exactamente lo que Tao advirtió: salidas sin dueños, soluciones sin comprensión y afirmaciones sin rendición de cuentas.