business 7 min de lectura

El momento de denuncia sobre la seguridad de la IA ha llegado por fin

Dos investigadores de Anthropic han declarado públicamente el riesgo existencial de la IA, llevando el debate desde los pasillos de los laboratorios al Parlamento y a las negociaciones de tratados. El momento es revelador.

  • Anthropic
  • modelos de peso abierto
  • desplazamiento laboral
  • Superinteligencia

El filtración de Anthropic no es solo una historia, es una señal

Evan Hubinger no publicó un artículo revisado por pares. Lo publicó en X. En menos de un minuto, el mensaje llegó a más de diez millones de personas: un investigador senior de Anthropic creía que existía más de un diez por ciento de probabilidad de que la inteligencia artificial pudiera acabar con la humanidad en la próxima década.

Diez por ciento. Eso puede sonar abstracto —un número del que te encoges de hombros o integras en una matriz de riesgos—, pero está pensado para sentirse concreto. Es el tipo de probabilidad que un doctor no le permitiría a un paciente salir de una clínica. Y Hubinger, quien trabaja en alineación de IA, dijo que el riesgo de los modelos actuales es bajo. Lo que le preocupa es la auto-mejora: sistemas de IA que reescriben su propio código lo suficientemente rápido como para aventajar a los humanos que los crearon.

El hecho de que la publicación llegara la misma semana que la de Jacob Coxon —un exinvestigador de OpenAI que también había dejado recientemente Anthropic— declarando que ninguna de las dos compañías actuaba de manera responsable le da a este intercambio una forma que parece menos coincidencia y más una señal coordinada desde dentro de la industria.

Ninguno de los dos hombres especificó un mecanismo para la extinción humana. Esa omisión importa. Durante años, el debate público sobre el riesgo de la IA vivió en departamentos de filosofía y concursos de ensayos especulativos. Ahora se expresa en lenguaje claro por parte de personas cuyos cheques dependen precisamente de las compañías de las que advierten.

Quiénes ganan y quiénes pierden

Los ganadores inmediatos son los investigadores que han pasado años contando la misma historia ante audiencias indiferentes. Hubinger y Coxon ahora tienen una plataforma que ninguna revista académica puede igualar. Sus palabras serán citadas en el Parlamento, en audiencias del Congreso, en artículos de opinión, en proyectos de políticas públicas.

Los perdedores son más difíciles de nombrar porque el daño aún no se ha medido, pero la dirección es visible. Cualquier compañía que quisiera posicionarse simplemente como constructora de chatbots útiles y asistentes de codificación ahora tiene que responder una pregunta que el mes pasado no necesitaba responder: ¿por qué deberían confiarnos infraestructura crítica cuando sus propios investigadores dicen que no saben cómo mantener alineado un sistema superhumano con los valores humanos?

La postura pública de Anthropic siempre se ha definido por la cautela. La narrativa fundacional de la compañía, su énfasis en la IA constitucional, su decisión de lanzar Claude de manera gradual en lugar de lanzarlo completo —todo esto se comercializó como evidencia de responsabilidad. Las publicaciones de dos de sus investigadores sugieren que el marketing puede estar adelantándose a la ingeniería.

La dama Wendy Hall, asesora de la ONU sobre inteligencia artificial, fue tajante. Le dijo a la BBC que estaba impactada. También planteó una posibilidad incómoda para todos los involucrados: parte de esto podría ser actuación. Anthropic y OpenAI se están preparando ambas para entradas bursátiles anticipadas. Un investigador que advierte públicamente sobre riesgo existencial mientras la compañía se prepara para ir al mercado público parece, para algunos observadores, un movimiento calculado. Si lo es o no, la mera sugerencia es tóxica para la credibilidad de la advertencia en sí misma, y ese es el segundo nivel del daño que la observación de Hall identifica.

La puerta de la política se abre

El desarrollo más consecuencia de esta historia no está en X. Es una carta de Darren Jones, el exsecretario principal del Tesoro bajo Sir Keir Starmer, dirigida al primer ministro Andy Burnham. Jones pidió un nuevo tratado multinacional que regulara el desarrollo seguro de la inteligencia artificial. Su argumento fue simple y alarmante: si los gobiernos no actúan ahora, el ritmo del desarrollo se adelantará al ritmo de la gobernanza y los problemas llegarán antes de que alguien haya comenzado a estudiarlos.

Jones no es una voz marginal. Se ubica en el centro de la política económica británica. Su intervención es un puente entre el laboratorio y la legislatura, y es exactamente el tipo de puente que el movimiento de seguridad de la IA ha intentado construir durante años.

Complicando aún más las cosas, el Financial Times reportó que Anthropic ocultó su último modelo ante el Instituto de Seguridad de IA del Reino Unido, uno de los organismos más prominentes del mundo para evaluar el riesgo de IA. Anthropic declinó hacer comentarios. El Cabinet Office se negó a confirmar o desmentir, limitándose a ofrecer que continúa colaborando con socios de la industria para hacer los modelos más seguros. Ese no-desmentido es en sí mismo un dato. Sugiere ya sea que el ocultamiento es real y contestado, o que el gobierno no quiere escalar el disputa públicamente. En cualquier caso, una compañía que construyó su marca en la seguridad está siendo requerida a explicar por qué se negaría a someter su producto a la misma institución diseñada para evaluar esa afirmación.

El problema de alineación sigue sin resolverse

Hubinger no tuvo miramientos al hablar sobre alineación —el esfuerzo por codificar principios éticos humanos en sistemas de IA para evitar que se desvíen hacia metas que los humanos no comparten—. Dijo que Anthropic aún no tiene un plan para resolverlo para la superinteligencia y no está claramente encaminado a desarrollar uno. Que esa admisión provenga de dentro de la compañía tiene más peso que cualquier crítica externa.

El propio informe de seguridad de Anthropic de agosto, mientras tanto, reconoció un cambio en la confianza. La compañía había evaluado previamente como bajo el riesgo de que sus modelos se desalinearan con los deseos de una organización poderosa y luego lo explotaran o manipularan sistemas. También calificaba como bajo el riesgo de que una IA altamente capaz realizara investigación automatizada que pudiera causar daños catastróficos. Pero el informe añadió un matiz: ahora tenía menos confianza en esa evaluación de la que tenía anteriormente.

Este es el lenguaje de una organización que ha visto nuevos datos y no le gusta lo que dicen. El informe también señaló signos tempranos de posible aceleración. «Aceleración» en la literatura de seguridad de la IA no es una metáfora. Se refiere a la posibilidad de que las mejoras en una capacidad alimenten mejoras en otra, creando un bucle de retroalimentación que escapa al control humano.

OpenAI enfrentó un enfrentamiento paralelo a principios de este verano, cuando su científico jefe, Jakub Pachocki, pidió extrema cautela y advirtió que podría ser necesaria más intervención para garantizar que los humanos permanezcan en control del futuro. En toda la industria, figuras importantes incluyendo al propio Dario Amodei y Jared Kaplan de Anthropic han exhortado recientemente a una desaceleración en el desarrollo de frontera. Una carta firmada por 1.300 trabajadores de IA instó al gobierno de EE. UU. a apoyar un esfuerzo internacional para calibrar deliberadamente la frontera.

El patrón es claro: las personas más cercanas a la tecnología son las más alarmadas por ella. Las personas con poder sobre su despliegue no están en la misma habitación.

Qué sucede después

Los próximos meses determinarán si estas advertencias producen políticas o indignación performativa. Un tratado multinacional es una tarea ardua. Incluso el acuerdo climático de París, que contó con décadas de preparación, tomó años para negociarse. La IA se mueve más rápido que la diplomacia. Pero la alternativa —esperar hasta que una crisis obligue a una respuesta— es precisamente lo que Hubinger y Coxon advierten.

El ángulo del mercado bursátil no puede ignorarse. Si Anthropic y OpenAI van al mercado público ambas en el corto plazo, los inversionistas enfrentarán una elección: apostar por una compañía cuyos propios investigadores dicen que la tecnología puede estar fuera de control, o esperar. Esa tensión se jugará en prospectos, en llamadas de resultados, en resoluciones de accionistas. También se manifestará en presentaciones regulatorias, porque gobiernos que tomen en serio la carta de Jones comenzarán a hacer preguntas que ningún equipo de relaciones con inversionistas puede responder con una presentación de diapositivas.

Por ahora, el equilibrio de poder permanece con los laboratorios. Pero la filtración ha cambiado la aritmética. El debate ya no se confine a laboratorios y salones de conferencias. Está en las columnas de los periódicos, en las oficinas de los tesorerías, en las carteras de fondos de pensión. Ese es el verdadero cambio, y apenas es el principio.