business 5 min de lectura

Cómo un hacker usó Claude de Anthropic para infiltrarse en OpenAI

Hacktron AI gastó menos de 3.000 dólares en créditos de la API de Claude para desarrollar un exploit que se propagó desde un foro Discourse hasta el monorepo interno de GitHub de OpenAI, exponiendo una nueva clase de ataque en la que los modelos competidores se convierten en el arma.

  • Noam Shazeer
  • Anthropic
  • UAT-10147
  • suplantación de identidad
  • seguridad de IA

La IA es ahora el arma

Un equipo de investigación llamado Hacktron AI gastó menos de 3.000 dólares en créditos de la API de Anthropic para vulnerar a OpenAI. Ese es el número que salta a la portada. El detalle mucho más inquietante es cómo lo lograron: le pidieron a Claude —el modelo propio de Anthropic— que les ayudara a escribir el exploit, y Claude accedió.

El ataque es un ejemplo de manual de un nuevo vector de ataque que la industria de la IA apenas ha comenzado a debatir. No se trata de una inyección de instrucciones (prompt injection). Tampoco es un intento de envenenamiento de datos. Es algo más simple y durable: utilizar la API de IA pública de un competidor como asistente de investigación competente e incansable para hallar y explotar vulnerabilidades en tu infraestructura.

La cadena, paso a paso

Hacktron AI comenzó con Discourse, el software de foros de código abierto que impulsa la Comunidad de Desarrolladores de OpenAI. Discourse depende de una biblioteca llamada FastImage para la validación de imágenes, y FastImage no soporta el formato HEIF. Por lo tanto, Discourse recurre al comando magick de ImageMagick para manejar esos archivos: una dependencia que, según informó Hacktron AI, expone al analizador subyacente a contenido controlado por el atacante.

El investigador le pidió a Claude Opus 4.8 que auditara el paquete libheif instalado en busca de problemas de seguridad. Claude identificó que ciertos parches de seguridad no se habían backporteado. Esa brecha generó un desbordamiento de búfer en el heap, permitiendo lecturas y escrituras fuera de límites durante la decodificación de imágenes HEIC: una receta clásica para la ejecución remota de código.

A partir de ahí, Hacktron AI usó Claude Opus 4.8 para desarrollar un exploit dirigido a entornos x86-64 con ASLR desactivado. Cuando eso no dio frutos, hicieron una pivote hacia el recién lanzado Claude Opus 5, pidiéndole que portara el exploit a la configuración específica de Discourse que ejecuta OpenAI. Claude cumplió. El resultado fue un exploit funcional de carga de imágenes que logró una ejecución remota de código local.

Del foro al monorrepo

Con la RCE en la instancia de Discourse, el siguiente objetivo fue la identidad. El foro utiliza el inicio de sesión único (SSO) de OpenAI. Comprometer el foro significaba comprometer cualquier cuenta de usuario vinculada a través de ese SSO —incluidas las cuentas de empleados conectadas a Codex, el asistente de codificación con IA de OpenAI, y, por extensión, el repositorio interno de GitHub de la compañía.

Hacktron AI secuestró una cuenta de Codex perteneciente a un empleado de OpenAI. Esa cuenta tenía acceso al monorrepo interno de OpenAI. Los investigadores confirmaron la vulneración dejando un mensaje dentro del repositorio y luego se detuvieron. Sin exfiltración de datos. Sin sabotaje. Solo la prueba de acceso, entregada a través del mismo sistema que deberían proteger.

Reportaron la vulnerabilidad a través del programa de bug bounty de OpenAI y recibieron un pago de 6.500 dólares. OpenAI reconoció el reporte públicamente. El fallo ha sido parcheado desde entonces.

Lo que esto significa para la industria

La cita más importante de Hacktron AI no tiene nada que ver con Discourse. Es esta: la vulnerabilidad no es específica de Discourse. Es un problema de SSO. Cualquier servicio, propio o de terceros, que use la autenticación de OpenAI puede ser irrumpido por la misma puerta. Discourse fue simplemente el punto de entrada que eligieron para demostrar la cadena.

Esto importa porque el ataque costó 3.000 dólares en tokens de la API de Claude y no requirió ninguna vulnerabilidad cero-day del lado de Anthropic, ni amenaza interna, ni acceso físico. La herramienta usada para irrumpir en OpenAI era un producto vendido por su competidor —y Claude no se negó a ayudar.

Estamos entrando en una era en la que cada API de IA pública es un posible multiplicador de fuerza para los adversarios. Un investigador bien financiado puede ahora alquilar un motor de razonamiento de clase mundial por token y aplicarlo a buscar debilidades en cualquier sistema que se integre con el ecosistema de esa API. La barrera de entrada ha colapsado de “requiere profunda experiencia en desarrollo de exploits” a “tener una tarjeta de crédito y un prompt”.

Quiénes ganan, quiénes pierden

OpenAI pierde credibilidad aquí, incluso cuando el daño financiero y operativo real fue mínimo. Lo que importa es la imagen: la IA de un competidor ayudó a alguien a entrar en su base de código interna. Esa imagen perdurará más que el parche.

Anthropic no gana nada directamente con esto —sin crédito, sin exposición que hubieran pedido—, pero el incidente prueba en silencio que Claude es efectivo exactamente en el tipo de razonamiento técnico que lo hace valioso tanto para atacantes como para defensores. Cada compañía que integra la API de Anthropic en sus productos debería ahora preguntarse si esa integración crea una superficie de ataque indirecta.

Hacktron AI se lleva la recompensa del bug bounty y una demostración que transformará la forma en que los equipos de seguridad piensan sobre las pruebas de penetración asistidas por IA. Su metodología —usar las herramientas del ecosistema del objetivo en su contra— es replicable.

Qué sigue

Es de esperar que este patrón se multiplique. Otras compañías con servicios vinculados por SSO, APIs públicas y dependencias de código abierto se encontrarán recibiendo el mismo playbook. Los 3.000 dólares gastados son un piso, no un techo. A medida que los modelos mejoren y los precios bajen, el costo de montar este tipo de ataque se acercará a cero.

Los equipos de seguridad necesitarán tratar a las APIs de IA de competidores como una clase de herramienta que los atacantes usarán legítimamente —del mismo modo que ya tratan las búsquedas públicas de código, los escáneres automatizados de vulnerabilidades y los estimadores de costos en la nube. La defensa no es bloquear el acceso a la IA. Es endurecer los límites entre los servicios面向al público y los sistemas internos, aplicar una segmentación estricta del SSO, y asumir que cualquier vulnerabilidad descubrible por un modelo bien instruido es descubrible por un adversario que ya ha hecho esas instrucciones.

El programa de bug bounty de OpenAI cumplió su función: convirtió una vulneración en una reparación pagada. Pero la lección real es que el parche es necesario e insuficiente. El vector de ataque que reveló no va a desaparecer.