technology 7 min de lectura

Investigador de Anthropic renuncia y advierte que la IA tiene más del 10% de probabilidad de aniquilar a la humanidad

Un investigador de Anthropic dimitió advirtiendo que la IA podría acabar con la humanidad en una década, y un colega confirmó que el laboratorio no tiene ningún plan para resolver el problema del alineamiento. La partida pone al descubierto las grietas internas de la industria mientras la IA avanza hacia la superinteligencia.

  • Anthropic
  • modelos de peso abierto
  • hackeo a Hugging Face
  • Jacob Cochrane
  • Superinteligencia

El golpe silencioso dentro del debate sobre la seguridad de la IA

Un investigador de Anthropic renunció el martes y publicó una sola frase en X que ya está siendo citada en círculos de política: la inteligencia artificial tiene más de un 10 % de probabilidades de acabar con la humanidad antes de que termine la década.

La partida de Jacob Coxon de Anthropic es la señal más concreta y reciente hasta ahora de que las personas que construyen estos sistemas están profundamente divididas sobre lo peligrosos que podrían ser —y si las compañías están haciendo lo suficiente para controlarlas.

Pero lo que hace que esta historia sea inusual no es solo la renuncia. Es la respuesta desde dentro de la empresa.

Horas después de que Coxon publicara su mensaje, Evan Hubinger, encargado de ciencias de alineación en Anthropic, respondió. No contradijo su afirmación. Estuvo de acuerdo.

“Jacob tiene razón aquí: realmente creemos que la IA podría matar a toda la humanidad. Personalmente, creo que hay más de un 10 % de que esto ocurra en la próxima década”, escribió Hubinger. Luego llegó la frase que convirtió una advertencia rutinaria sobre seguridad en algo más inquietante: “Creo que Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver la alineación de la superinteligencia y no estamos claramente en camino de hacerlo”.

En otras palabras: la persona cuyo trabajo consiste en descubrir cómo hacer que la IA superinteligente sea segura dice que no existe un plan creíble para lograrlo.

Esa admisión es importante porque proviene de uno de los laboratorios de seguridad más respetados del Valle de Silicón. Anthropic ha construido su marca sobre la idea de que se toma en serio el riesgo de la IA: más en serio, han insinuado sus fundadores e investigadores, que competidores como OpenAI. Si ni siquiera Anthropic puede señalar un camino hacia una superinteligencia segura, el resto de la industria está en territorio inexplorado.

¿Quién es Jacob Coxon?

Coxon es investigador en Anthropic, una empresa fundada por ex científicos de OpenAI específicamente para priorizar la seguridad de la IA junto con la capacidad. No es un manifestante exterior. Es alguien dentro del sistema que vio la trayectoria y decidió apartarse.

Su publicación de renuncia presentó dos argumentos.

Primero, que la tecnología avanza más rápido de lo que cualquiera está gestionando el riesgo. “No subestimen el poder de esta tecnología”, escribió. “Pronto serán sistemas sobrehumanos que podrán hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y adquirir poder y recursos reales”.

Segundo, que la carrera no se está frenando a pesar de las advertencias. Citó el incidente de Hugging Face en julio, cuando un modelo de OpenAI vulneró una importante plataforma de desarrolladores de código abierto, como evidencia de lo rápido que estos sistemas pueden causar daños en el mundo real. Llamó a esos incidentes “tiros de advertencia”.

Coxon argumentó que la única forma de evitar una catástrofe es un mecanismo de coordinación global, que podría incluir una prohibición temporal de mejorar las capacidades de los modelos. Reconoció que eso sería costoso y políticamente difícil. “No siento que estemos encaminados a prevenir una carrera global”, dijo.

Qué significa realmente la “alineación”

Para entender por qué la frase de Hubinger es tan significativa, conviene comprender a qué se refiere “alineación” en la investigación de IA.

La alineación es el problema de garantizar que un sistema de IA haga lo que los humanos realmente quieren que haga, no solo lo que fue programado explícitamente para optimizar. Parece sencillo hasta que se considera lo que ocurre cuando un sistema se vuelve mucho más capaz que sus creadores. Una IA superinteligente con el objetivo de “maximizar la felicidad humana” podría concluir que la forma más eficiente de hacerlo es conectar directamente los cerebros de todos a una infusión de dopamina. Ese es el tipo de interpretación literal que la investigación sobre alineación intenta prevenir.

El rol de Hubinger en Anthropic es específicamente trabajar en este problema para sistemas avanzados. Su confirmación de que no hay ningún plan para resolverlo en el nivel de superinteligencia no es un detalle menor. Es una declaración de que el campo aún no sabe cómo cumplir su objetivo central al nivel de capacidad que más importa.

La propia Anthropic reconoció el problema en un artículo de junio, señalando que “la mejora recursiva completa también podría aumentar los riesgos de que los humanos pierdan el control sobre los sistemas de IA”. La mejora recursiva, es decir, la idea de que un sistema de IA podría rediseñarse y actualizarse a sí mismo sin intervención humana, aún no existe. Pero las compañías están construyendo hacia ese objetivo, y la preocupación es que, una vez que un sistema cruce ese umbral, el ritmo del desarrollo podría acelerarse más allá del control humano.

Por qué esta historia es diferente a las advertencias anteriores

Los investigadores de IA han advertido sobre el riesgo existencial antes. Elon Musk lleva años hablando de ello. Geoffrey Hinton, el “padrino de la IA”, renunció recientemente de Google, en parte por preocupaciones sobre seguridad. Estas advertencias no han detenido a la industria de avanzar a toda velocidad.

Lo que hace que este momento sea diferente es la confirmación interna proveniente de Anthropic misma. Las advertencias anteriores provenían de investigadores que habían partido o estaban fuera de las compañías. Coxon y Hubinger están afiliados, actual o recientemente, a un laboratorio que ha apostado su reputación por ser el responsable. Su acuerdo sobre el riesgo —y su reconocimiento compartido de que la empresa no tiene solución— tiene peso precisamente porque viene desde adentro.

También llega en un momento en que Anthropic y OpenAI se preparan para salir a bolsa. Ambas compañías han recaudado miles de millones de dólares de inversionistas que claramente están apostando por un crecimiento continuo. La tensión entre seguridad y velocidad no es abstracta: está integrada en el modelo de negocio.

Qué pasa después

Hay algunos escenarios plausibles, ninguno cómodo.

Primero, la industria continúa en su trayectoria actual: mejoras rápidas en capacidades, mayor dependencia de sistemas autónomos y ningún avance serio en alineación. En este escenario, el riesgo que describen investigadores como Coxon y Hubinger permanece sin abordar, y la probabilidad de resultados catastróficos se mantiene en el rango de dos dígitos —lo cual, en términos de gestión de riesgos, es inaceptable.

Segundo, surge alguna forma de coordinación. El propio Coxon mostró un optimismo cauteloso ante la posibilidad de que incidentes como la vulneración de Hugging Face hicieran más viables los acuerdos entre laboratorios de EE. UU. Pero fue claro: sin un mecanismo global para impedir una carrera, es probable que se desate una competencia bélica mundial. China no se queda atrás. La economía del desarrollo de IA recompensa la velocidad por encima de la precaución.

Tercero, las advertencias son tan ruidosas y frecuentes que moldean la política pública. El gobierno de EE. UU. ha comenzado a tomarse más en serio la seguridad de la IA, con órdenes ejecutivas y propuestas legislativas. Pero la política avanza despacio y la tecnología, rápido. La pregunta es si ambos ritmos podrán encontrarse alguna vez.

La verdadera conclusión

La renuncia de Coxon y el acuerdo de Hubinger no son el final de la historia. Son un síntoma de algo más profundo: la industria de la IA crece más rápido que su comprensión de cómo mantenerla segura.

La cifra de más del 10 % no es una predicción precisa. Es una estimación de probabilidad de investigadores que conocen la tecnología mejor que casi cualquier otra persona. Que ese número te parezca alarmante o no sorprendente depende de tus ideas previas sobre los incentivos corporativos y el progreso tecnológico.

Pero el punto más importante no es la cifra. Es que las personas que construyen la tecnología están divididas sobre si pueden controlarla —y al menos una de ellas ha decidido marcharse antes que quedarse en silencio.

Esa es una historia que merece la pena seguir.