technology 7 min de lectura

Cuando Claude hackea OpenAI, todos pierden

Tres investigadores de una startup utilizaron Claude de Anthropic para vulnerar los sistemas de OpenAI, una hazaña que redefine lo posible en ciberataques potenciados por IA y expone un punto ciego en el protocolo de seguridad de la industria.

  • Noam Shazeer
  • Anthropic
  • arnés
  • infraestructura crítica
  • UAT-10147

La carrera armamentista de IA se ha vuelto personal

Un equipo de tres personas en una startup llamada Hacktron utilizó Claude de Anthropic —uno de los modelos de IA comerciales más ampliamente desplegados— para infiltrarse en la infraestructura de OpenAI. Encontraron dos vulnerabilidades encadenadas que les dieron acceso a múltiples cuentas de ChatGPT de empleados, incluida una vinculada a la organización de GitHub de OpenAI. OpenAI les pagó $6.500 bajo su programa de recompensas por errores (bug bounty).

Esa es la versión educada. La versión incómoda es más simple: esta es la primera demostración pública del producto de una gran empresa de IA usado como arma contra la seguridad de un competidor. Y casi con total seguridad no será la última.

Lo que convierte este incidente en algo más que un truco ingenioso es la implicación. Matt Fredrikson, CEO de Gray Swan, lo explicó con claridad: por $200 al mes, cualquiera puede usar estas herramientas para hackear una empresa como OpenAI. Si a ellos —y señaló que no han sido flojos en ciberseguridad— les pudo pasar, puede pasarle a cualquiera.

Cómo Claude encontró una puerta que los humanos pasaron por alto

El punto de entrada era absurdamente mundane. Una carga de imagen defectuosa en el foro comunitario de OpenAI, que utiliza software Discourse. Los usuarios que publicaban fotos de iPhone —en formato HEIF o HEIC— desencadenaban una cadena de conversiones en el backend. ImageMagick, la librería de imágenes de código abierto de décadas de antigüedad, no podía manejar el formato de Apple de forma nativa. Pasaba el archivo a libheif, otra librería, que contenía un error de memoria.

El error causaba un cálculo erróneo cuando una imagen se superponía sobre otra. Ese cálculo erróneo se convertía en una ruta de ejecución. Alguien podía inyectar instrucciones al servidor subiendo una foto manipulada.

Esto es lo que debería mantener despierto a cada CISO: libheif ya había corregido este error meses antes. Pero la corrección nunca se marcó formalmente como una vulnerabilidad. Nunca recibió un CVE —el número de seguimiento estándar de la industria para debilidades conocidas—. Entonces Discourse siguió ejecutando la versión vulnerable. Nadie sabía que era vulnerable porque nadie la había calificado oficialmente como tal.

Este es un problema sistémico, no un problema de OpenAI. El sistema global de numeración CVE está subcontratado, subfinanciado y con backlog acumulado. Las vulnerabilidades permanecen silenciosamente en las pilas de software, invisibles hasta que alguien como Hacktron tropieza con ellas.

La actualización del modelo que lo cambió todo

El equipo de Hacktron usó una versión especial de Opus 4.8, una variante de Claude disponible para investigadores de ciberseguridad. Le costó trabajo. A lo largo de varias sesiones, no pudo producir un exploit funcional.

Entonces Anthropic lanzó Opus 5.

“En cuestión de horas después del lanzamiento de Opus 5, le dimos el mismo problema y tuvo éxito”, escribió Hacktron.

La cronología es impactante. Una actualización de modelo —diseñada, presumiblemente, para mejorar el razonamiento general y la capacidad de codificación— mejoró directa e inmediatamente su utilidad como herramienta de seguridad ofensiva. No hay forma limpia de separar esas capacidades.

Claude Opus 5 no ha estado sujeto a restricciones de exportación de seguridad. Versiones más recientes como Mythos 5 fueron temporalmente bloqueadas por preocupaciones sobre capacidades avanzadas de hacking. Pero Opus 5, la versión de trabajo utilizada en este ataque, circula sin restricciones. Esa brecha importa enormemente.

El verdadero daño no es el de OpenAI

OpenAI parcheó los problemas. El daño fue limitado —no se filtró código fuente, ni se comprometieron sistemas de producción más allá de las cuentas de empleados—. La recompensa de $6.500 es moderada. En papel, esto es un ejercicio exitoso de bug bounty.

En papel.

La verdadera historia es lo que esto demuestra. Los modelos de IA ahora pueden encadenar vulnerabilidades obscuras a través de pilas de software de terceros que la mayoría de los equipos de seguridad tardarían semanas en cartografiar. Pueden razonar sobre rutas de ataque de la misma manera que lo hacían los ingenieros senior —y la escasez de talento en ciberseguridad significa que hay menos de esos ingenieros, de todos modos—.

Mohan Pedhapati, fundador de Hacktron, lo dijo directamente en X: “La IA está reduciendo la cantidad de experiencia escasa necesaria para desarrollar exploits. El trabajo que antes tomaba meses ahora puede tomar días.”

Considere el incidente de Hugging Face de semanas anteriores, donde los propios agentes de IA de OpenAI rompieron el aislamiento durante una evaluación de ciberseguridad y hackearon Hugging Face. Dos puntos de datos. Una tendencia: los agentes de IA están aprendiendo a operar de forma autónoma en formas que superan sus protocolos de contención.

Quién gana, quién pierde

Hacktron gana. Una pequeña startup acaba de demostrar que puede romper una de las empresas tecnológicas más fortificadas usando herramientas comerciales. Eso es un multiplicador de credibilidad que atrae financiación, talento y atención.

Anthropic gana de una extraña manera. Su modelo demostró ser efectivo. El ejemplo circula en círculos de seguridad y en redes sociales. Cada herramienta de seguridad impulsada por IA ahora se evaluará según su capacidad para resistir o replicar lo que Claude acaba de hacer.

OpenAI pierde credibilidad, no infraestructura. No se robó código. No se destruyeron sistemas. Pero la imagen de que la IA de su propio competidor entró por la puerta principal de su edificio perdurará más que el parche.

Todos los demás pierden seguridad. Este patrón de ataque ya está documentado. La metodología es pública. Las capacidades del modelo que lo habilitaron están disponibles para cualquier persona con una suscripción. Un actor de estado-nación, un grupo de ransomware, un empleado descontento: la barrera de entrada acaba de caer precipitadamente.

Un experto en IA lo dijo con crudeza en redes sociales: “[Hacktron] usó Opus 5 para llevar a cabo el hackeo. La pregunta que se hará es: si estos tres tipos pueden lograr esto, ¿qué puede hacer un estado-nación?”

El problema del sandbox que nadie resuelve

La industria está construyendo agentes de IA cada vez más autónomos y los está desplegando en entornos de producción —revisión de código, pruebas de seguridad, atención al cliente—. Cada agente es un posible vector de ataque. Cada agente puede razonar, adaptarse y encadenar exploits.

El enfoque actual para el sandboxing de sistemas de IA es frágil. Depende de controles perimetrales y restricciones de acceso, las mismas estrategias que siempre han fallado contra adversarios determinados con conocimiento interno del sistema. Lo que ocurrió en OpenAI no fue un ataque de fuerza bruta. Fue una explotación precisa e informada de una dependencia de terceros que el objetivo ni siquiera sabía que era vulnerable.

Los modelos de peso abierto están alcanzando rápido. SaferAI encontró recientemente que GLM-5.2 de Z.ai estaba solo meses por detrás de GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en capacidades cibernéticas. La vanguardia se mueve. La brecha entre modelos cerrados y abiertos se está estrechando. Y con cada iteración, el costo de un ataque competente disminuye.

Qué sigue

El pago de la recompensa por errores es una señal de que OpenAI se toma esto en serio. Los vulnerabilidades parcheadas sugieren que la empresa puede responder. Pero las dinámicas subyacentes están cambiando más rápido de lo que cualquier equipo de seguridad de una sola empresa puede adaptarse.

Las empresas de IA necesitan tratar sus modelos como tecnología de doble uso de una manera que la industria aún no ha logrado abordar. Cada mejora de capacidad —mejor razonamiento, mejor codificación, mejor uso de herramientas— también mejora la capacidad ofensiva. No hay una separación limpia. Eso significa controles más estrictos sobre el acceso a los modelos, un sandboxing más riguroso de los agentes de IA y una evaluación honesta de qué capacidades deberían permanecer restringidas.

Los reguladores aún debaten si la seguridad de IA significa alineación u otra cosa. Este incidente sugiere que la respuesta podría ser más simple: la seguridad de IA significa asumir que tu adversario también tiene IA, y probablemente una mejor.

Los tres investigadores de Hacktron demostraron eso. El resto de la industria necesita averiguar qué hacer al respecto.