science 6 min de lectura

La apuesta de los 20 vatios de Sutton: por qué un cerebro de billones de parámetros podría revolucionar la IA

Richard Sutton dice que la IA actual está estancada: el aprendizaje se detiene en cuanto se despliegan los modelos, y la respuesta de la industria ante la hambruna de datos es solo un gran error. Su alternativa: aprendizaje continuo con potencia similar a la del cerebro. La pregunta es si Oak Lab puede demostrarlo.

  • Richard Sutton
  • eficiencia de la IA
  • aprendizaje continuo
  • LLM
  • datos sintéticos
  • AI Paradigm

La bomba de 20 vatios

Richard Sutton acaba de decirle al mundo de la inteligencia artificial que todo lo que ha construido en los últimos cuatro años es un desvío.

El autor más citado en aprendizaje por refuerzo —el hombre que dio a DeepMind su columna vertebral teórica y escribió el ensayo que muchos consideran el manifiesto intelectual del campo, “La lección amarga”— ha declarado que el actual paradigma centrado en los LLM está fundamentalmente roto. Y no solo hace un diagnóstico: se ha ido. A través de un podcast de Sequoia Capital, Sutton anunció la creación de Oak Lab, una startup construida alrededor de lo que describe como una idea radicalmente más simple: la inteligencia no necesita megavatios. Necesita aprendizaje continuo a 20 vatios.

Ese número —20 vatios— es el presupuesto energético de un cerebro humano. Tu refrigerador consume más. Un centro de datos que aloja un único modelo de lenguaje grande consume suficiente energía para alimentar a un pueblo pequeño. El argumento de Sutton es contundente: si puedes hacerlo con 20 vatios, toda la carrera armamentista computacional es innecesaria.

El diagnóstico: un aprendizaje que se detiene

El golpe más agudo de Sutton apunta hacia algo que la mayoría de los usuarios nunca nota: porque es el estado predeterminado de cada LLM desplegado hoy en día. Una vez que un modelo se congela y se pone en producción, no aprende nada. No se adapta. No mejora. Tampoco olvida, lo cual es otra forma de decir que no vive.

Esto es lo que Sutton llama el “defecto fatal”: sistemas que reclaman experiencia a nivel de doctorado y dejan de acumular conocimiento en el instante en que entran en producción. Son, en efecto, monumentos parlantes.

Su alternativa es el “aprendizaje continuo”: modelos que actualizan continuamente sus pesos mediante la interacción con su entorno, tal como lo hace un cerebro. No se trata de ajuste fino sobre un conjunto de datos estático. Ni de RLHF con preferencias humanas. Se trata de actualizaciones reales y constantes de los pesos impulsadas por retroalimentación del entorno.

La objeción obvia es el olvido catastrófico: el problema bien conocido donde una red neuronal, al aprender información nueva, sobrescribe el conocimiento adquirido previamente. Sutton lo reconoce directamente. Su solución propuesta es un algoritmo que su equipo denomina “backpropagation continuo”, el cual asigna tasas de aprendizaje individualizadas a cada peso de la red, preservando el conocimiento existente mientras inyecta unidades estocásticas nuevas que permiten la adaptación continua.

Suena plausible en teoría. La pregunta es si escala.

Los datos sintéticos como trampa

La crítica de Sutton se extiende hasta el remedio actual de la industria ante el agotamiento de datos: los datos sintéticos. Los desestimó sin ceremonia —“simplemente un gran error”— y su colaborador Kuram Zaveed respaldó el razonamiento. Validar datos sintéticos termina requiriendo juicio de expertos humanos, lo que crea un cuello de botella que colapsa todo el modelo económico.

Aquí es donde la “Hipótesis del Gran Mundo” de Sutton hace el trabajo pesado. El mundo físico es infinitamente más complejo que cualquier simulación que un ser humano pueda construir. Las simulaciones elaboradas por humanos, por definición, están limitadas por la comprensión humana. No puedes sintetizar tu salida de un problema de complejidad cuya fuente no puedes modelar por completo.

La implicación resulta incómoda para cada empresa de inteligencia artificial que actualmente apuesta miles de millones en pipelines de generación de datos. Si Sutton tiene razón, esos pipelines no resuelven el problema de los datos: simplemente lo desplazan un paso más abajo hacia mano de obra humana que a su vez se convertirá en la restricción.

Quién se ve sacudido

La posición de Sutton y Zaveed golpea el centro de la narrativa dominante de la IA: que la escala es el único camino hacia la inteligencia. Cada laboratorio importante está actualmente compitiendo para construir modelos más grandes, entrenar por más tiempo y gastar más. Su justificación es que la inteligencia es una función del cómputo: más parámetros, más tokens, más FLOPs.

Sutton dice que eso es un error de categoría. La inteligencia, como ha argumentado desde “La lección amarga” en 2019, es una función de los algoritmos que explotan el cómputo —no del cómputo en sí mismo. La lección amarga siempre fue que los métodos que automatizan la búsqueda y el aprendizaje mediante algoritmos de propósito general superan consistentemente a los enfoques diseñados a mano. El paradigma actual, afirma ahora, es el enfoque diseñado a mano a escala masiva.

Para las grandes tecnológicas, la amenaza es existencial de una manera que la mayor parte de la cobertura periodística pasa por alto. Si el aprendizaje continuo puede lograr lo que el preentrenamiento masivo afirma lograr —y hacerlo con una fracción del costo energético—, entonces la zanja construida sobre capacidad de GPUs y acceso a datos se evapora. La ventaja pasa de quienes pueden gastar más a quienes pueden aprender mejor.

Por eso importa la conexión con Sequoia. Esto no es un ejercicio académico. Oak Lab se está construyendo como una empresa, no como un grupo de investigación.

La parte difícil: demostrar que funciona

Zaveed es honesto sobre la brecha de ingeniería. Almacenar un billón de parámetros a 20 vatios es actualmente imposible dadas las restricciones de la arquitectura de memoria. La predicción es de 5 a 10 años. Ese es un camino largo en tiempos de IA, donde un año puede parecer una década.

Sutton también hizo una elección de encuadre provocativa durante la conversación: cuando los críticos llaman a su postura “radical”, respondió que él se mantiene en la visión llana y estándar y que el campo ha enloquecido. Usó el ejemplo de una ardilla navegando obstáculos físicos para ilustrar que la inteligencia sensoriomotora —el tipo que requiere interacción en tiempo real con un mundo complejo— se encuentra muy por encima de los sistemas actuales basados en lenguaje. El lenguaje, argumenta, representa solo alrededor del 20 % de la verdadera inteligencia.

Esto es un desafío directo a la narrativa del LLM como AGI que domina la industria. Situía a Sutton firmemente en el campo que ve el aprendizaje interactuado y corporal como el ingrediente que falta —una posición compartida por una minoría de investigadores pero mayoritariamente ignorada por los mercados de capitales.

Qué sigue

El impacto inmediato es limitado. Oak Lab está en etapa temprana. Las afirmaciones algorítmicas no han sido revisadas por pares ni reproducidas de forma independiente. El objetivo de 20 vatios es aspiracional. Nadie debería leer esto como una amenaza a corto plazo para el paradigma dependiente de cómputo intensivo.

Pero la señal a largo plazo es clara. Sutton es uno de los teóricos más respetados en aprendizaje por refuerzo y nunca ha tenido miedo de cuestionar la ortodoxia. Su participación en una startup fundada sobre una arquitectura alternativa le otorga a esa alternativa más credibilidad de lo que recibe la mayoría de los nuevos enfoques. Si Oak Lab demuestra incluso un éxito parcial —un modelo que aprende de forma continua sin olvido catastrófico y con una ganancia de eficiencia significativa—, toda la tesis de inversión en entrenamiento a escala masiva enfrentará escrutinio.

El objetivo de 20 vatios es casi con certeza optimista para el cronograma ofrecido. Pero la dirección es inequívoca: la pregunta no es si el campo incorporará eventualmente principios de aprendizaje continuo. Es si el paradigma actual será desmantelado o simplemente complementado por ellos.

Sutton diría que ya sabemos la respuesta a eso. Sus críticos aún están escribiendo sus artículos.