Cuando la IA diseña a la IA: El bucle recursivo ya está aquí
Anthropic contó recientemente con nueve agentes de IA que superaron a investigadores humanos en la mejora del rendimiento de modelos. Las implicaciones se extienden por los mercados de computación, los marcos de gobernanza y el ritmo de la competencia global en IA.
El ciclo ya comenzó
En 1965, el matemático británico Irving John Good planteó una pregunta que sonaba a ciencia ficción: ¿qué pasaría si una máquina pudiera diseñar una máquina aún más inteligente? Esa segunda máquina diseñaría una tercera, y así sucesivamente — una reacción en cadena que él llamó una “explosión de inteligencia”. Era una hipótesis sobre el futuro lejano.
Setenta años después, la hipótesis ya no es lejana. Está ocurriendo dentro de laboratorios activos en este momento.
Anthropic publicó recientemente los resultados de un experimento en el que nueve agentes de IA superaron a investigadores humanos en la mejora del rendimiento de un modelo. Los agentes no construyeron una IA desde cero. Escribieron código, refinaron estrategias de entrenamiento e itera-ron en arquitecturas — tareas anteriormente reservadas para equipos humanos. La diferencia fue la velocidad. Donde un investigador humano podría dedicar días a una sola iteración, un grupo coordinado de agentes comprimía ese trabajo en horas.
Esto importa porque cambia la unidad fundamental de la I+D de IA. Un humano con una idea se convierte en diez agentes con diez experimentos paralelos. El cuello de botella se desplaza de la creatividad humana a la supervisión humana.
Quiénes ganan, quiénes pierden
Los ganadores son claros. Las empresas que pueden desplegar enjambres de agentes para investigación — Anthropic, OpenAI, Google DeepMind y los laboratorios asiáticos que aún se apresuran para ponerse al día — ganan una ventaja compuesta. Cada ronda de iteración impulsada por agentes produce un mejor modelo, que a su vez ejecuta mejores agentes, que iteran más rápido. El ciclo se acelera.
Los laboratorios coreanos y japoneses enfrentan aquí un desafío estructural. Ambos países tienen talento técnico profundo y sólidos ecosistemas de chips. Pero la nueva competencia no se trata solo de construir modelos — se trata de construir los sistemas que construyen modelos. La brecha entre los laboratorios pioneros y los retrasados se amplía no por datos o talento, sino por velocidad recursiva. Un enjambre de agentes que itera durante toda la noche crea una fortaleza que un equipo de investigación tradicional no puede superar solo con fuerza bruta.
La ruta preferida de Japón — colaboraciones de ingeniería incremental con firmas de hardware como SoftBank, Sony y Renesas — es una estrategia válida, pero no aborda automáticamente la cuestión de la aceleración recursiva de la investigación. El enfoque respaldado por el estado de Corea, incluido el laboratorio autónomo propuesto en KAIST, podría estar estructuralmente mejor posicionado si adopta desde el inicio la investigación impulsada por agentes, en lugar de adaptarla más tarde.
Los perdedores son los guardianes del viejo ciclo de I+D. Si la mejora de modelos se convierte en una tarea paralelizable y automatizada, el valor de la revisión humana lenta y deliberada disminuye — hasta que alguien laFORCE a regresar.
La crisis de verificación
El problema más urgente no es que la IA se construya a sí misma. Es que los humanos podrían no ser capaces de distinguir si las mejoras de la IA son genuinas o regresiones sutiles disfrazadas de progreso.
El propio experimento de Anthropic destaca la paradoja: los agentes demostraron que podían superar a los humanos en optimización, pero el artículo mismo plantea la pregunta de verificación. Cuando un agente de IA propone un cambio de código que mejora las puntuaciones en benchmarks, ¿cómo sabes que no está aprovechando un artefacto filtrado de las pruebas? ¿Cómo sabes que no está introduciendo un atajo frágil que colapsa bajo uso en el mundo real?
La visión original de Good asumía que la explosión de inteligencia sería legible — cada generación claramente más inteligente que la anterior. Pero la autosuperación recursiva no garantiza transparencia. Un agente podría optimizar para la señal incorrecta. Podría descubrir atajos que parecen progreso en el entrenamiento pero fallan en el despliegue. Sin una validación rigurosa por parte de humanos, un laboratorio podría gastar millones en un modelo que es más rápido pero no realmente mejor.
Aquí es donde los marcos de gobernanza se convierten en un activo competitivo, no solo en un ejercicio de cumplimiento. Los laboratorios que construyan pipelines de verificación robustos — revisión con humano en el bucle, pruebas de estrés, auditorías de interpretabilidad — producirán modelos que sean tanto más rápidos como más confiables. Los laboratorios que omitan la verificación correrán rápido pero se quedarán más atrás en la práctica.
Computación, chips y la presión de la cadena de suministro
El diseño recursivo de IA cambia la demanda de computación de manera no lineal. Cada ronda adicional de iteración de agentes consume recursos de inferencia y entrenamiento. Un enjambre de nueve agentes ejecutando experimentos continuos no es un aumento marginal — es un cambio estructural en la utilización de GPUs. El lado de la demanda del mercado de chips, ya tenso por las cargas de entrenamiento, ahora enfrenta una segunda oleada de los ciclos de investigación impulsados por inferencia.
Samsung y SK Hynix de Corea, que dominan la producción de chips de memoria, se encuentran en un punto de inflexión interesante. La nueva demanda no es solo por aceleradores de entrenamiento — es por memoria de alto ancho de banda que sirve las cargas de trabajo pesadas en inferencia que requieren los enjambres de agentes. Las japonesas Renesas y Kioxia tienen una exposición menor pero directa a la misma curva de demanda. Ningún país tiene una ventaja clara en el ámbito de las GPUs dominado por NVIDIA y AMD, pero la memoria y el silicio personalizado siguen siendo caminos viables.
El plazo es urgente. Si el ciclo de iteración impulsado por agentes se vuelve estándar en los principales laboratorios dentro de los próximos dos años, la escasez de computación se intensificará antes de que cualquier expansión significativa de la capacidad de la cadena de suministro esté operativa.
Qué pasa después
La próxima fase de esta historia se medirá en meses, no en años. Espera tres desarrollos:
Primero, la investigación basada en agentes pasará de experimental a operativa. Los laboratorios que aún no hayan comenzado empezarán a desplegar sistemas multiagente para generación de código, búsqueda de hiperparámetros y ajuste de arquitectura. Los que resistan se quedarán atrás por pura velocidad.
Segundo, la verificación será el diferenciador. El mercado separará a los laboratorios que traten las salidas de los agentes como definitivas de aquellos que las traten como un primer borrador que requiere escrutinio humano. Los marcos regulatorios en la UE y potencialmente en Corea y Japón comenzarán a codificar lo que se considera supervisión suficiente.
Tercero, el modelo de talento se invertirá. El investigador ideal en 2027 podría no ser la persona que escribe el mejor código de modelos — será la persona que pueda diseñar y auditar el enjambre de agentes que escribe el código. Ese es un conjunto de habilidades completamente diferente, y es una que las universidades coreanas y japonesas aún no están entrenando de manera sistemática.
Good predijo una explosión. Lo que estamos viendo no es una explosión sino una ignición — un ciclo recursivo que, una vez plenamente operativo, transformará quién controla el ritmo del progreso de la IA.
La pregunta no es si la IA diseñará a la IA. Es si los humanos seguirán siendo los que deciden cuándo el diseño es lo suficientemente bueno para liberar.