Por qué los desertores de Anthropic están cambiando el debate sobre la seguridad de la IA
Dos investigadores de Anthropic se han ido en semanas, sonando la misma alarma. La salida de expertos está desplazando la seguridad de la IA de una preocupación marginal a una crisis en la directiva.
La advertencia que no se calla
Evan Hubinger publicó en X que existe más del 10 % de probabilidad de que la IA pueda extinguir a la humanidad en una década. Dos días después, Jacob Colson, recién salido de Anthropic, describió una trayectoria a corto plazo hacia sistemas superhumanos capaces de hackear cualquier cosa y transformar todas las industrias de la noche a la mañana. Ambos trabajaron en alineación de IA en la empresa. Ambos ya se fueron, o al menos están cambiando sus títulos.
La coincidencia importa. No se trata de un disidente solitario que suena la alarma desde afuera. Es un patrón que se está formando dentro del propio laboratorio.
De la periferia al primer plano
El debate sobre la seguridad de la IA ha experimentado un cambio silencioso pero real durante el último año. Hace cinco años, preocuparse por el riesgo existencial te convertía en una figura cautelosa en internet, alguien a quien se marginaba con educación. Hoy, Hubinger y Colson ocupan posiciones que fueron literalmente creadas para tomarse esa preocupación en serio. No son aficionados. Son las personas que Anthropic contrató para asegurarse de que sus modelos no deshicieran el mundo por accidente.
Y sin embargo se van, hablan públicamente y dicen lo mismo: el problema de la alineación no está resuelto, el ritmo de desarrollo va más rápido que las salvaguardas, y las empresas no van a detenerse solas.
El debate ha pasado de si la IA representa un riesgo existencial a qué tan grande es ese riesgo en realidad. Eso puede sonar como un ajuste técnico. No lo es. Es un cambio generacional en la forma en que la industria se toma en serio sus propias creaciones. El 10 % no es una estimación probabilística precisa. Es una señal de humo. Alguien que conoce la arquitectura está mirando la trayectoria y decidiendo que la pendiente es lo suficientemente pronunciada como para preocuparse.
La pregunta de relaciones públicas, y por qué pierde el punto
Dame Wendy Hall, asesora de inteligencia artificial del gobierno del Reino Unido, sugirió en BBC Radio 4 que las advertencias podrían tener un elemento promocional, dado que tanto Anthropic como OpenAI están预期 a salir a bolsa pronto. Es una línea de cuestionamiento razonable. Los actores corporativos recurren rutinariamente al miedo para afilar su posicionamiento.
Pero reducir las advertencias de los insider a marketing pasa por alto algo importante: estos investigadores están gastando capital social, no construyéndolo. Cuando dejas un laboratorio bien financiado y de alto estatus y vas a X a decir que tu ex empleador va demasiado rápido y no está yendo lo suficiente en seguridad, no estás ganando fans en Silicon Valley. Estás haciendo enemigos. El hecho de que lo hagan de todos modos importa más que cualquier ciclo de prensa que pudiera generar.
La historia de AISI
Un episodio más concreto salió de Reino Unido. Financial Times informó de que Anthropic no presentó su último modelo al AI Security Institute para evaluación. Anthropic se negó a comentar. La Oficina del Gabinete del Reino Unido dijo que continúa trabajando con socios de la industria, incluido Anthropic, que es exactamente el tipo de oración que redactas cuando quieres sonar cooperativo sin decir nada en absoluto.
Esta es la nueva normalidad de la gobernanza de la seguridad de la IA: sometimiento voluntario, silencio corporativo y un gobierno que prefiere la apariencia de asociación a la fricción de la aplicación. El Reino Unido tiene un AI Safety Institute. Existe. No tiene dientes.
Lo que Anthropic dice realmente — y lo que calla
El propio informe de seguridad de agosto de Anthropic admitió algo que debería inquietar a quien esté prestando atención: la confianza en las evaluaciones de seguridad de la propia empresa está disminuyendo. El informe indicaba que los riesgos de uso indebido de los modelos y de que la IA avanzada llevara a cabo investigación automatizada que condujera a resultados catastróficos seguían considerándose bajos, pero señalaba “signos tempranos de aceleración” que podrían cambiar el cálculo. La redacción es cuidadosa. El significado no lo es.
La empresa también se abstuvo de proporcionar su modelo más capaz al AISI del Reino Unido. Esa omisión es una elección. No es ilegal. Es simplemente el tipo de elección que se ve muy diferente dependiendo de si eres un inversor o un investigador que cree que el mundo podría terminar antes de lo previsto.
Las desertiones
La trayectoria de Colson es notable. Trabajó en OpenAI antes de pasar a Anthropic. Ahora ha dejado ambas. Su publicación anunciando la partida describió a ambas compañías como incapaces de actuar con responsabilidad, prediciendo que los sistemas de IA superhumanos estarían al alcance. La publicación de Hubinger, vista más de diez millones de veces, fue más allá en especificación numérica: un 10 % de riesgo de extinción humana en diez años, ningún plan claro para resolver la alineación a escala de superinteligencia, y una descripción de la trayectoria actual como indefinida en lugar de alineada.
Estas no son preocupaciones abstractas. Provienen de personas cuyo mandato profesional entero era precisamente prevenir este resultado.
La lista que crece
Hubinger y Colson no están aislados. El científico jefe de OpenAI, Yakub Pachocki, pidió un enfoque extremadamente cauteloso este mes y advirtió que el control humano continuo podría requerir intervención más allá de lo que el campo está dispuesto a hacer actualmente. El propio director general de Anthropic, Dario Amodei, y el ejecutivo Jared Kaplan han pedido públicamente ralentizar el desarrollo. Una carta firmada por más de 1.300 trabajadores de la industria de la IA instó al gobierno de EE. UU. a ayudar a construir herramientas técnicas y de gobernanza para ritmar deliberadamente el desarrollo automatizado de la IA.
El mensaje es consistente en organizaciones, en roles, en el espectro ideológico del campo: la velocidad es el problema, y las personas más cercanas al trabajo son las que lo ven con mayor claridad.
Qué cambia a continuación
La consecuencia inmediata de estas advertencias es política. Darren Jones, un alto funcionario del Reino Unido, ha escrito al primer ministro pidiendo un nuevo tratado multilateral sobre seguridad de la IA. La lógica es sencilla: si los desarrolladores dentro de las compañías no se autocensuran, y las propias compañías compiten haciaOfertas Públicas Iniciales y dominio del mercado, entonces los gobiernos necesitan crear restricciones vinculantes antes de que la tecnología cree hechos consumados que ningún tratado pueda deshacer.
La pregunta más difícil es si algún tratado puede realmente restringir una tecnología que puede desarrollarse en paralelo en múltiples jurisdicciones por actores privados sin incentivos compartidos para frenar. Los tratados funcionan cuando la verificación es posible y cuando la deserción conlleva un costo. Ninguna de las dos condiciones es fácil de satisfacer con modelos de IA de vanguardia, que viven en código, no en silos.
El verdadero cambio
Lo que está pasando dentro de Anthropic y su órbita no es un escándalo. Es un diagnóstico institucional. Las personas contratadas para mantener la tecnología segura le dicen al público que la tecnología avanza más rápido que el trabajo de seguridad. Esta no es una crítica a una sola empresa. Es una crítica a una estructura industrial donde la presión competitiva principal es llegar primero, no llegar seguros.
El número del 10 % será debatido. Debe serlo. Las estimaciones probabilísticas de insider no son hallazgos científicos. Pero el número no es la historia. La historia es que los insider se están yendo, están hablando en público, y están diciendo lo mismo desde diferentes salidas. Ese patrón es más difícil de descartar que cualquier dato aislado.
Los inversores decidirán si prestan atención. Los gobiernos decidirán si actúan. Los investigadores ya superaron el punto de decidir por nadie más. Ya han tomado su decisión.