business 5 min de lectura

OpenAI accedió a través de Claude: lo que revela el exploit Hackron sobre los ataques impulsados por IA

Tres investigadores utilizaron Claude de Anthropic para explotar una vulnerabilidad en Discourse y acceder al Monorepo privado de OpenAI: un estudio de caso sobre cómo los asistentes de IA se están convirtiendo en puntos de entrada de bajo costo para ataques corporativos.

  • Noam Shazeer
  • Anthropic
  • Claude Code
  • infraestructura crítica
  • ciberseguridad
  • exploit de IA

La brecha que no cambió nada — y lo cambió todo

Tres investigadores de Hacktron AI no necesitaban ser operativos de un Estado-nación para vulnerar a OpenAI.

Necesitaban una suscripción a Claude, una vulnerabilidad en Discourse y la convicción de que los asistentes de IA ahora realizan la mayor parte del trabajo pesado de explotación: una habilidad que antes requería cientos de ingenieros de seguridad capacitados.

El incidente del 23 de julio, reportado inicialmente por el Wall Street Journal y corroborado por el medio coreano de seguridad AI Times, marca una de las demostraciones más reveladoras de lo que ocurre cuando las capacidades ofensivas migran de equipos especializados a cualquiera que sepa formular bien un prompt.

Cómo funcionó, paso a paso

La cadena comenzó con algo cotidiano: el servicio de terceros Discourse, que aloja los foros comunitarios de OpenAI. El equipo de Hacktron identificó un fallo de seguridad en la tubería de procesamiento de archivos por imagen de Discourse.

Su primer intento —instruir a Claude Opus 4.8 para generar código de explotación— se estancó. El modelo no pudo producir una carga útil funcional.

Entonces Anthropic lanzó Claude Opus 5. Al día siguiente, el modelo actualizado logró donde su predecesor había fracasado. Los investigadores obtuvieron tokens de autenticación de usuarios de la comunidad de OpenAI. Algunos de esos tokens resultaron válidos para cuentas de empleados. Varios también concedieron acceso al repositorio privado de GitHub de OpenAI, conocido internamente como Monorepo.

A través de la interfaz de ChatGPT, el equipo leyó archivos que contenían secretos algorítmicos y software de optimización diseñado para mejorar la velocidad y eficiencia de los modelos. No accedieron a los pesos del modelo de trillones de parámetros en el núcleo de la arquitectura de GPT. Pero recorrieron todo lo que lo rodea —configuración, estructura del código, documentación— y dejaron su tarjeta de presentación: un pull request incrustado con el texto “Hacktron AI Team PoC” y un enlace a su cuenta de X.

¿Quién es realmente responsable de esta capacidad?

Mohan Peddapati, CTO de Hacktron AI, ofreció una evaluación deliberadamente moderada. “No somos tan poderosos como los actores de amenaza chinos”, dijo a los periodistas. “Simplemente somos tres investigadores que se susc ribieron a Claude y Codex.”

Esa subestimación es precisamente el punto. La barrera para producir este tipo de output se ha derrumbado. Joshua Saxe, de Abandonent Security, lo formuló con claridad: la razón por la que cada vulnerabilidad de software no ha sido ya weaponizada no es una escasez de bugs descubribles, sino una escasez de personas con la habilidad suficiente para convertir esos bugs en exploits utilizables. Los agentes de IA ahora están llenando ese vacío.

Durante meses, la industria ha advertido que la IA rebajaría el piso para el cibercrimen. El incidente de OpenAI demuestra que el piso ya se ha movido.

Qué cedió OpenAI — y qué no

La respuesta de OpenAI fue medida. Revocó los tokens comprometidos de Discourse y terminó las sesiones afectadas. Los investigadores recibieron un bug bounty de aproximadamente $6,500. Una revisión posterior de GitHub encontró solo acceso de lectura limitado a metadatos y código del repositorio privado, sin evidencia de modificación o exfiltración más allá de archivos de documentación.

Greg Brockman, presidente de OpenAI, reveló que la compañía detuvo todo el trabajo de proyectos y redirigió el 25 % de su personal de ingeniería de producción hacia la remediación de seguridad, descubriendo “múltiples problemas graves” en el proceso. Esa sola admisión señala un problema más amplio: si corregir una brecha expone varios fallos críticos adicionales, la superficie de ataque es significativamente mayor de lo que cualquier vulnerabilidad individual sugiere.

La compañía también publicó su primer balance público de incidentes de seguridad relacionados con agentes y revisó su política interna de reporte de seguridad, ambas señales de que la brecha ha pasado de la contención al aprendizaje institucional.

Por qué esto importa más allá de OpenAI

El daño inmediato —unos cuantos archivos de código, algo de documentación, ningún peso del modelo— está relativamente contenido. La implicación estructural es mucho más trascendental.

Los hackers han confiado durante mucho tiempo en ingeniería social, acceso interno o adquisición de zero-days para alcanzar objetivos de alto valor. Cada camino requiere recursos, paciencia o conexiones. Lo que Hacktron demostró es una vía diferente: usar la propia infraestructura orientada a IA del objetivo como vector de ataque, y aprovechar modelos de IA comercialmente disponibles para cerrar la brecha de habilidad entre reconocimiento y explotación.

Esto no es teórico. Incidentes similares ya han surgido. Agentes de IA han atacado Hugging Face y otras plataformas en los últimos meses. El patrón se está consolidando: cuando una empresa expone herramientas de IA a su comunidad, también expone una interfaz que los adversarios pueden consultar, sondear y eventualmente explotar; no porque la herramienta esté rota, sino porque es demasiado útil para ignorar.

La disyuntiva incómoda

OpenAI construyó su plataforma comunitaria para conectar con usuarios, desarrolladores e investigadores. Ese engagement es valioso. También crea superficie de ataque. Los mismos modelos que ayudan a OpenAI a entrenar GPT ahora están disponibles para cualquiera que pueda escribir un prompt, y esos mismos modelos están ayudando a los adversarios a comprender y navegar la propia infraestructura de OpenAI.

La paradoja es casi demasiado perfecta: la investigación defensiva de OpenAI en IA depende de la misma clase de herramienta que sus atacantes están usando en su contra.

Esto no significa que la brecha fuera inevitable de manera simple. Un mejor scopeo de tokens, límites de privilegio más estrictos y una detección más temprana habrían reducido la exposición. Pero la dirección del avance es clara. A medida que Claude, Codex y modelos competidores se vuelvan más capaces en generación de código, análisis de vulnerabilidades y orquestación de ataques multietapa, el costo de una operación ofensiva enfocada seguirá disminuyendo.

Qué viene después

La trayectoria más probable no es una pérdida catastrófica única de datos, sino una erosión lenta de las suposiciones fronterizas. Cada empresa que integre asistentes de IA en su flujo de desarrollo de software —no solo OpenAI, sino cada plataforma con un foro comunitario, una API pública o un chatbot embebido— enfrenta el mismo cálculo: el acceso abierto invita al escrutinio, y el escrutinio invita a la explotación.

Los bug bounties seguirán compensando a los investigadores responsables. Las auditorías de seguridad detectarán problemas. Pero el cambio fundamental ya está en marcha. Los atacantes ya no necesitan contratar ingenieros senior. Necesitan contratar prompts.

Tres personas con suscripciones a Claude acababan de demostrarlo. La pregunta es cuánto tiempo tardará el resto de la industria en ponerse al día.