Los 722 artículos de matemáticas de OpenAI no demuestran lo que
OpenAI publicó 722 artículos de matemáticas generados por IA en GitHub, afirmando avances en problemas relacionados con la Hipótesis de Riemann. El detalle: muchos carecen de demostración formal, el grupo asesor que se pronunció en contra de esta práctica y un patrón de exageración.
La afirmación que se sale de la evidencia
OpenAI anunció el 6 de octubre que su modelo frontera interno produjo 722 manuscritos de matemáticas, muchos respaldados por pruebas formales en Lean, y los publicó en GitHub. El énfasis de la prensa recaía en la Hipótesis de Riemann. La realidad es más compleja y, en varios aspectos, más interesante.
El modelo no demostró la Hipótesis de Riemann. Produjo resultados sobre problemas relacionados, específicamente regiones donde los ceros de la función zeta no pueden existir. Un artículo sobre ese tema fue editado por un humano para mejorar su legibilidad. El resto se generó mediante un pipeline consistente en un modelo no publicado, con un promedio de cómputo equivalente a tres horas de razonamiento de ChatGPT Pro por manuscrito.
Eso importa. No se trata de un descubrimiento puntual. Es una operación en volumen.
El filtro era el punto
OpenAI partió de unos 4000 problemas. Conservó 722 tras filtrar por significancia. Eso significa que casi el 80 por ciento de los resultados fueron descartados. La empresa no publicó el conjunto completo. No describió con detalle los criterios de rechazo. No ofreció ningún recuento de problemas que no pudo resolver.
Esta es la primera señal de alarma para cualquier lector escéptico. En la práctica matemática normal, los resultados negativos y los enfoques fallidos son tan valiosos como los éxitos. En el lanzamiento de OpenAI, están ausentes. Los 722 representan selección, no completitud.
La selectividad en sí misma no es inherentemente deshonestad —toda revista la practica—, pero la asimetría es llamativa. Un grupo de investigación que publica 722 resultados verificados junto con cero intentos fallidos crea una imagen distorsionada de la capacidad. Los lectores familiares con la cultura matemática absorberán una narrativa de éxito imparable. Esa narrativa tiene valor de marketing. También tiene costo epistémico.
Las consecuencias de segundo orden ya son visibles. Hilos en Twitter y publicaciones en blogs citan el lanzamiento como evidencia de que la inteligencia artificial ha «resuelto» o «descifrado» la Hipótesis de Riemann. La brecha entre el encuadre cuidadoso de la empresa y la interpretación del público se amplía más rápido de lo que cualquiera dentro de OpenAI puede corregirlo. Para cuando circule una aclaración, el titular ya habrá cumplido su trabajo.
Lean no es una garantía
Muchos artículos incluyen pruebas formales verificadas por Lean. Eso es notable. La verificación de pruebas en Lean es uno de los pocos métodos que puede eliminar la ambigüedad humana en un argumento matemático. Una prueba de Lean verificada se acerca a un certificado de corrección.
Pero no todos los resultados están formalizados. OpenAI lo reconoció abiertamente y dijo que pueden existir problemas en trabajos no formalizados. La empresa prometió correcciones. Eso es responsable a primera vista. También es una auditoría diferida. Cualquier persona que quiera verificar los resultados ahora debe revisar 722 manuscritos, identificar cuáles carecen de cobertura Lean y comprobarlos manualmente. La carga se ha trasladado del editor a la comunidad.
Este es un problema estructural, no moral. OpenAI no puede verificar formalmente todo lo que genera a esta escala. Pero tampoco puede reclamar pruebas para todo lo que publica. La ambigüedad entre ambos bandos es donde vive la controversia.
Aquí también hay una tensión más profunda. La formalización en Lean requiere traducir el razonamiento matemático informal a un formato legible por máquina. Ese proceso de traducción en sí mismo puede introducir errores: lemas omitidos, hipótesis mal atribuidas o vacíos lógicos sutiles que se escapan a las verificaciones automatizadas. El hecho de que una prueba exista en Lean es una evidencia fuerte de corrección, pero no es infalible. La comunidad ha visto ejemplos en los que pruebas formalmente verificadas requirieron revisión posterior cuando surgieron casos límite.
El grupo consultor que dijo que no
OpenAI consultó al Grupo Asesor sobre Matemáticas e Inteligencia Artificial, o AGMAI, antes de publicar. Las recomendaciones de septiembre del grupo son instructivas. Solicitaron repositorios independientes, divulgación completa de modelos y prompts, transparencia sobre tiempos y costos, verificación formal cuando fuera posible, y recuentos de problemas sin resolver junto con los resueltos.
Luego AGMAI emitió una declaración aclaratoria el mismo día del lanzamiento. Dijo que sus consejos no respaldaban los resultados de OpenAI. Dijo que el grupo no representa a la comunidad matemática. Dijo que la evaluación corresponde a los matemáticos, no a los asesores.
El subtexto es claro: AGMAI recomendó estándares que OpenAI solo cumplió en parte, y el grupo ya se está distanciating del resultado. La relación consultiva se parece menos a un sello de aprobación y más a un límite de responsabilidad.
Lo que revela este episodio es la creciente fricción entre los laboratorios de inteligencia artificial y las instituciones que podrían mantenerlos bajo responsabilidad. Grupos asesores como AGMAI ocupan un terreno intermedio incómodo: prestan credibilidad sin comandar autoridad. Sus recomendaciones son fáciles de ignorar cuando conviene y fáciles de citar cuando resulta útil. Ningún resultado fortalece su posición. La comunidad matemática, ya suspicaz ante las empresas tecnológicas que apropian su lenguaje, está observando de cerca. Si OpenAI trata la guía de AGMAI como opcional en lugar de fundamental, otros laboratorios interpretarán eso como permiso para hacer lo mismo.
El patrón es el problema
Esta no es la primera vez que OpenAI tropieza con una exageración. En septiembre, la empresa afirmó que su modelo interno había resuelto el problema de la existencia y suavidad de Navier-Stokes, uno de los Problemas del Milenio. Los matemáticos que trabajan en el campo respondieron con fuerza. La afirmación no resistió el escrutinio.
En agosto, OpenAI reportó resultados de una versión interna de su próximo modelo insignia llamado Astra sobre 10 problemas abiertos. En octubre de 2025, una publicación de un ejecutivo sobre la resolución de problemas de Erdős con GPT-5 fue eliminada tras las críticas.
El patrón es consistente. OpenAI genera resultados ambiciosos, los anuncia públicamente y luego enfrenta resistencia de expertos que encuentran lagunas en el razonamiento o en el encuadre. Cada episodio erosiona la confianza. Cada ciclo normaliza la idea de que la inteligencia artificial puede resolver problemas difíciles, incluso cuando la evidencia es tenue.
El efecto acumulativo importa más que cualquier incidente individual. Cuando las empresas de inteligencia artificial anuncian repetidamente medias verdades sobre el progreso matemático, el público en general pierde la capacidad de distinguir los avances genuinos de los performáticos. Esto crea una trampa de credibilidad: incluso cuando OpenAI produce algo verdaderamente significativo después, la audiencia educada en titulares sensacionalistas tenderá por defecto al escepticismo. La empresa está gastando su capital de reputación en anuncios incrementales.
Quién gana, quién pierde
OpenAI gana atención. El repositorio de GitHub es buscable. Los 722 artículos están indexados. Los investigadores pueden extraer de ellos ideas, lemas o enfoques computacionales. Ese es un valor real. La investigación matemática siempre ha prestado de trabajos afines. Una inteligencia artificial que produzca grandes volúmenes de resultados verificados formalmente podría acelerar ese proceso.
Los matemáticos pierden algo más sutil. Su autoridad sobre lo que cuenta como prueba se está diluyendo. Cuando un modelo frontera genera resultados que pasan parcialmente las herramientas de verificación, la línea entre la asistencia de la máquina y la autoría de la máquina se difumina. La revisión por pares no puede seguir el ritmo del volumen de producción. El sistema se adaptará, pero la adaptación será desordenada y lenta.
El público en general pierde claridad. Los titulares dirán que OpenAI probó algo sobre la Hipótesis de Riemann. No dirán que la empresa no probó nada de eso. La brecha entre el titular y el documento se ampliará con cada lanzamiento.
También hay un perdedor menos discutido: la paciencia colectiva de la comunidad matemática. Cada vez que una empresa enmarca mal sus resultados, los matemáticos deben dedicar tiempo a corregir el registro en lugar de hacer su propio trabajo. Ese tiempo no es renovable. Con ciclos repetidos, se convierte en un gasto real de recursos, que afecta desproporcionadamente a investigadores en etapa temprana de carrera que ya están muy sobrecargados.
Qué viene después
OpenAI planea un taller y programas especiales para ayudar a los matemáticos a entender los resultados generados por inteligencia artificial. Dice que está trabajando hacia un lanzamiento general responsable del modelo. Está considerando espacios de publicación gestionados por la comunidad más allá de GitHub. Estos son pasos sensatos. No borran los problemas con este lanzamiento.
La pregunta más importante no es si la inteligencia artificial puede ayudar a hacer matemáticas. Puede. La pregunta es si las empresas que construyen estos sistemas adoptarán estándares que permitan a la comunidad verificar, replicar y rechazar sus afirmaciones a escala. El último producto de OpenAI es un hito. También es una advertencia. El modelo puede producir. La infraestructura para la rendición de cuentas aún está poniéndose al día. Hasta que esa infraestructura madure, la comunidad matemática debería tratar estos lanzamientos con la misma optimismo cauteloso que aplica a cualquier preimpresión: agradecida por la señal, no convencida por el hype, y lista para mantener la línea cuando se confundan ambos.