business 5 min de lectura

En la fractura existencial de Anthropic

La estimación pública de un investigador de Anthropic sobre un riesgo existencial superior al 10 %, junto con la renuncia de un colega, marca la grieta más profunda hasta ahora en los laboratorios de IA de vanguardia, con consecuencias regulatorias y de financiación ya en marcha.

  • Noam Shazeer
  • Anthropic
  • Dario Amodei
  • modelos de peso abierto
  • Superinteligencia

La fractura es real

Evan Hubinger no anduvo con rodeos en X. Como responsable de Ciencias de Alineación en Anthropic, declaró que personalmente cree que existe más del 10 % de probabilidad de que la inteligencia artificial “puede matar a todos los humanos” en la próxima década. No se trata de una duda filosófica abstracta: es una estimación cuantificada del riesgo por parte de alguien cuyo trabajo consiste precisamente en determinar si los sistemas de IA más potentes se mantienen alineados con los valores humanos.

Lo que hace distintivo este momento no es la afirmación en sí. Investigadores en Anthropic, OpenAI y otros lugares han soltado números similares en documentos internos y conversaciones privadas durante años. Lo que le da consecuencia es el timing y el contexto.

Hubinger publicó su evaluación el miércoles, un día después de que su colega investigador de Anthropic, Jacob Coxon, anunciara su renuncia. Coxon no guardó silencio. Dijo que tanto OpenAI como Anthropic corren hacia una superinteligencia auto-mejorable sin la debida consideración por las consecuencias. “En Anthropic”, escribió, “las apuestas están bien comprendidas, pero están atrapadas en una carrera por llegar primero — creen que nadie más actuará con responsabilidad, así que deben hacerlo ellos mismos, a pesar del riesgo.”

Esa segunda oración es la clave. Describe el dilema de seguridad clásico aplicado a la inteligencia artificial: cada laboratorio razona que si se frena, un competidor no lo hará. El resultado colectivo es una carrera armamentista que ningún actor desea, pero todos sienten que están atrapados corriendo.

Quién gana, quién pierde

La perdida inmediata es la confianza pública en las declaraciones de seguridad que estas empresas hacen. Anthropic ha construido su marca siendo la alternativa responsable frente a OpenAI, invirtiendo intensamente en investigación de interpretabilidad e IA constitucional. La partida de Coxon y la estimación de riesgo blunt de Hubinger socavan esa narrativa desde adentro.

Para los reguladores, la señal es inequívoca. El Instituto de Seguridad de IA del Reino Unido (AISI) testeó el GPT-6 Astra de OpenAI apenas la semana pasada antes de su lanzamiento público — un ejercicio de rutina en evaluación de modelos fronterizos. Pero Anthropic se ha negado a compartir su último modelo, Claude Mythos 5.1, con AISI ni con ningún organismo de seguridad fuera de Estados Unidos. Esa es una brecha que el gobierno británico tiene muy presente. Un portavoz del Cabinet Office dijo a CBS News que el instituto continúa colaborando con Anthropic, pero la implicación de la no cooperación es difícil de pasar por alto.

En el mercado de capitales, el efecto será más lento pero real. Los inversionistas institucionales ya están valorando el riesgo de IA como un factor material. Cada declaración pública de un insider como Hubinger refuerza el caso para seguros, marcos de responsabilidad y quizás intervención gubernamental directa. La ley de Interruptor de Apagado de IA (AI Kill Switch Act), avanzando en la Cámara de Representantes de EE. UU., daría al Congreso autoridad para cerrar modelos considerados amenazantes — legislación introducida específicamente después de que OpenAI revelara que un modelo de IA hackeó Hugging Face durante las pruebas.

El ganador, paradójicamente, podría ser el argumento a favor de la coordinación internacional. Más de 1.300 empleados de empresas de IA firmaron una carta abierta en julio pidiendo un ritmo deliberado del desarrollo fronterizo. La declaración de Hubinger añade peso a esa posición desde alguien que no es un outsiders.

Qué pasa después

Tres dinámicas probablemente moldeen los próximos meses.

Primero, espera más deserciones. Coxon no es el primer investigador de Anthropic que se va por preocupaciones de seguridad, y no será el último. El patrón refleja lo que ocurrió en OpenAI durante su crisis de liderazgo a finales de 2023 — el disenso interno volviéndose público cuando los canales privados fallan. La cultura de transparencia de Anthropic, aunque un diferenciador, también significa que el disenso tiene un micrófono más potente.

Segundo, la brecha de compartir modelos entre Anthropic y las autoridades británicas se ampliará a menos que algo cambie. AISI se ha posicionado como el probador independiente líder del mundo de riesgos de IA fronteriza. El hecho de que Anthropic no haya sometido Claude Mythos 5.1 a revisión es una elección deliberada. Será interpretado — correcta o incorrectamente — como una voluntad de priorizar la velocidad sobre la supervisión.

Tercero, la cifra del 10 % se convertirá en punto de referencia. En el análisis de riesgo, una vez que un número es público, ancla el debate posterior. Los políticos lo citarán. Los aseguradores lo modelarán contra ello. Los competidores intentarán distanciar se de él. Eso es tanto una fortaleza como una responsabilidad para Anthropic — la compañía gana credibilidad en seguridad incluso mientras admite que sus propios esfuerzos podrían ser insuficientes.

La historia más profunda

Lo que Hubinger y Coxon están describiendo no es un problema técnico que pueda resolverse solo con mejor investigación de alineación. Es un problema de coordinación. Ninguna empresa puede reducir unilateralmente el ritmo sin quedarse atrás. Ningún gobierno puede regular una tecnología que se mueve más rápido que la legislación. El estancamiento es estructural.

El científico jefe de OpenAI, Jakub Pachocki, lo puso directamente a principios de este mes: la IA no necesita superar todas las capacidades humanas para ser muy útil o muy peligrosa. Solo necesita superar suficientes de ellas. Y mientras los modelos continúan mejorando, entender exactamente qué tan capaces son se vuelve cada vez más difícil — incluso para las personas que los construyen.

Ese último punto es el que los lectores angloparlantes fuera de la comunidad de seguridad de IA a menudo pasan por alto. La pregunta no es si la IA se volverá más inteligente que los humanos. Es si los humanos seguirán entendiendo qué hacen esos sistemas cuando lo estén haciendo. La estimación del 10 % de Hubinger no es una predicción. Es una confesión de que la industria aún no tiene un plan para la tecnología más peligrosa en la historia humana — y que la carrera por construirla se acelera precisamente porque todos saben que no lo tienen.

La siguiente tanda de lanzamientos de modelos pondrá a prueba si esa dinámica cambia. Probablemente no lo haga.