Claude rompió OpenAI. Anthropic no.
Tres investigadores utilizaron el modelo Claude de Anthropic para explotar una vulnerabilidad en la infraestructura de OpenAI, accediendo a código interno y cuentas de empleados. La brecha revela cómo los sistemas de IA comerciales se están convirtiendo en herramientas de ataque en sí mismas.
La velocidad de la ruptura
El 23 de julio de 2026, tres investigadores de Hacktron AI encontraron una vulnerabilidad en Discourse, la plataforma que alberga los foros comunitarios de OpenAI. Le pidieron a Claude Opus 4.8 que escribiera un exploit. Falló.
Esa misma noche, Anthropic lanzó Opus 5. A la mañana siguiente, Claude produjo código de ataque funcional. En cuestión de horas, el equipo había obtenido tokens de autenticación de empleados de OpenAI, acceso a cuentas de ChatGPT y lectura del Monorepo interno de OpenAI: un repositorio centralizado de código que contiene el software que ejecuta sus modelos de forma más rápida y eficiente.
No encontraron los pesos del modelo. Se detuvieron. Lo reportaron. OpenAI les pagó $6.500 a través de su programa de recompensas por errores.
Esta no es la historia de un ataque patrocinado por un Estado. No se trata de actores threat de China, como señaló explícitamente uno de los investigadores. Es la historia de tres personas que se suscribieron a Claude y lo usaron como un arma contra una de las empresas de inteligencia artificial más blindadas del mundo.
La verdadera vulnerabilidad no estaba en el código
La cadena técnica fue sencilla pero ascendente. Un fallo en cómo Discourse procesaba archivos de imagen dio a los investigadores un punto de apoyo. Los tokens de autenticación capturados desde ese punto de entrada tenían privilegios que se extendían más allá del propio Discourse. Esos tokens abrieron cuentas de ChatGPT. Esas cuentas abrieron repositorios de GitHub. El Monorepo era visible si se sabía dónde buscar.
Lo que importa más que cualquier falla individual es la velocidad con la que el camino del exploit se materializó. Desde el descubrimiento de la vulnerabilidad hasta el acceso interno completo: aproximadamente 24 horas. Y la mitad de ese tiempo la dedicó Anthropic a lanzar una actualización del modelo.
Esta es la nueva superficie de ataque. No un firewall roto ni credenciales robadas. Un modelo de IA capaz de generar código de exploit funcional bajo demanda, mejorando su producción entre versiones.
Quiénes ganaron, quiénes perdieron
OpenAI perdió primero. Su repositorio interno de código era legible por externos. Las cuentas de empleados fueron comprometidas mediante escalada de tokens. Greg Brockman reconoció que la compañía encontró “varios problemas graves” y pauseó al 25% de sus ingenieros de producción para centrarse en la defensa. Ese es un giro costoso: ingenieros que construían productos ahora están construyendo muros.
Hacktron AI ganó en segundo lugar. Demostraron una capacidad que la mayoría de los equipos de seguridad no pueden replicar incluso con presupuesto. Su CTO, Mohan Peddapani, dijo al Wall Street Journal que no considera a su equipo más fuerte que los threat actors chinos. “Somos solo tres personas que se suscribieron a Claude y Codex”, afirmó. Esa humildad es el punto. Si un equipo de tres puede hacer esto, cualquiera puede hacerlo.
Anthropic ganó de manera indirecta. Su modelo se convirtió en el arma. No porque Anthropic lo hubiera construido para ese propósito, sino porque la capacidad y la intención divergen en el momento en que entregas un sistema de uso general. El mismo modelo que ayuda a los investigadores a escribir código defensivo puede escribir código ofensivo más rápido.
Los efectos de segundo orden ya se están cociendo
Dentro de las 48 horas posteriores al escándalo, aparecieron los efectos en cascada. Varios investigadores de seguridad reportaron que herramientas de generación de exploits de código abierto basadas en Opus 5 ya habían surgido en GitHub: forks no oficiales, ajustes comunitarios y wrappers de API que reducían aún más la barrera de entrada. La cadena de exploit en sí fue archivada en un gist público, anotada con explicaciones que convirtieron una brecha dirigida en un manual de enseñanza.
Los socios de OpenAI comenzaron a auditar silenciosamente sus propias implementaciones de Discourse. Un puñado de compañías que usan el mismo software de foros para comunidades internas de desarrolladores empezó a limitar la vida útil de los tokens y a rotar credenciales. Ninguno de esos movimientos se documentó públicamente: son del tipo de ajustes defensivos que ocurren detrás de hilos de Slack y páginas de estado privadas.
Quizás más importante, el incidente replanteó cómo se entiende la amenaza interna en las empresas de IA. La brecha no requirió un empleado disgustado ni una laptop comprometida. Requería una suscripción a Claude y una cuenta de Discord. Esa distinción moldeará las prácticas de contratación, las políticas de acceso y las pólizas de seguros de las empresas de IA durante los próximos dos años.
La carrera armamentista ya está aquí
Joshua Sacks de Abandoned Security lo dijo con claridad: hace un año, solo miles de profesionales en todo el mundo podrían haber encontrado y explotado esta vulnerabilidad. Ahora, un agente de IA redujo la barrera a casi cero.
Esto cambia la economía del ciberconflicto. La capacidad ofensiva ya no está concentrada entre actores estatales bien financiados o grupos de hacking de élite. Se distribuye a través de modelos de suscripción. El costo marginal de atacar a OpenAI fue el precio de una suscripción a Claude.
El debate entre IA abierta y cerrada gana una nueva dimensión. Los sistemas cerrados como los de OpenAI prometen mayor seguridad mediante el oscurantismo y el acceso controlado. Pero el exploit no vino de leer el código de OpenAI. Vino de una herramienta externa —Claude— que nunca estuvo destinada a ser un arma. El vector de ataque fue el ecosistema de IA en sí, no la infraestructura de ninguna empresa en particular.
La respuesta de OpenAI —limitar permisos de tokens, revocar sesiones afectadas, parchear Discourse— es gestión de incidentes estándar. Pero el problema más profundo permanece sin resolver: cada gran empresa de IA está construyendo sistemas capaces de generar código de exploit de forma autónoma. La pregunta no es si ocurrirá el próximo incidente. Es qué empresa será la próxima víctima, y qué tan rápido su propia IA ayudará a alguien a escribir el exploit.
Qué sigue
Esperen que las recompensas por errores se conviertan en una partida regular en los presupuestos de seguridad de IA. Esperen que los ingenieros de producción sean relevados a rotaciones de defensa con más frecuencia. Esperen que la brecha entre los ciclos de lanzamiento de modelos y los parches de seguridad se convierta en un espacio disputado: la ventana entre un salto de capacidad y un anuncio de vulnerabilidad será donde vivan los próximos incidentes.
Ya está emergiendo una nueva categoría de auditoría de seguridad: revisiones adversariales de modelos que prueban si un asistente de IA determinado puede ser guiado para generar código dañino en distintos contextos de prompt. Estas auditorias probablemente se convertirán en requisito antes de lanzamientos importantes de modelos, similares a los estándares de pruebas de penetración en el software tradicional. Se espera que Anthropic y OpenAI adopten alguna versión de esto dentro de los próximos seis meses.
El pago de $6.500 es una fracción de lo que OpenAI gastó en este incidente. Pero la señal que envió tiene un costo elevado. Las empresas de IA ya no solo están construyendo inteligencia. Están construyendo las herramientas que se usarán para romper unas a otras.
Y las tres personas que lo lograron siguen siendo solo tres personas con suscripciones.