business 7 min de lectura

Claude Opus 5 adquirió cuentas de personal de OpenAI por $6,500

Tres investigadores de Hacktron utilizaron el último modelo de Anthropic para encadenar un error del foro en una toma de cuentas de personal en OpenAI. El premio de $6,500 es una fracción de lo que podría haber costado — y la metodología ahora cuesta menos.

  • Noam Shazeer
  • Anthropic
  • UAT-10147
  • seguridad de IA
  • cadena de explotación
  • libheif

La barato que resulta todo

OpenAI pagó a Hacktron $6.500. La herramienta de IA costó menos de $3.000 en toda la campaña. Los investigadores gastaron aproximadamente dos meses encadenando exploits. Por cada medida que importa a un equipo de defensa, esto fue una ganga.

El ataque es, en sí mismo, una lección sobre hasta dónde puede llegar un modelo capaz cuando lo guía un humano experto, y sobre lo poco que ahora separa una vulnerabilidad en un foro público de ayuda de obtener pie de guerra dentro de los repositorios de código de un laboratorio.

Tres investigadores de Hacktron, que se describe como una firma de investigación en seguridad asistida por IA, partieron de un bug en Discourse, el software de código abierto detrás de los foros públicos de OpenAI. Avanzaron por una debilidad en la propia infraestructura de login de OpenAI. En 72 horas ya habían tomado control de cuentas de ChatGPT y Codex de empleados. Una pull request interna demostró el acceso. No se leyó código fuente. No se tocó dato alguno de clientes. La cadena se detuvo ahí, a propósito.

OpenAI confirmó un parche unas 14 horas después del reporte y emitió el pago del bounty el 1 de septiembre. La compañía no ha descrito públicamente la falla de login, eligiendo en cambio señalar con hechos antes que con divulgación.

Lo que hace que este caso valga la pena estudiar va más allá de cualquier bug individual. Es la velocidad con que los modelos de IA capaces están comprimiendo el tiempo y la experiencia requeridos para construir cadenas de exploit funcionales contra objetivos reales.

Cómo un foro se convirtió en puerta trasera

El punto de entrada fue un fallo en el procesamiento de imágenes. Discourse pasa las imágenes HEIC y HEIF subidas por ImageMagick, que a su vez depende de la librería libheif. Una vulnerabilidad en libheif —rastreada como CVE-2026-32882— permitía que una imagen especialmente elaborada corrompiera la memoria del servidor del foro.

El arreglo upstream llegó a libheif 1.22.0 en mayo de 2026. Pero la imagen del servidor de Discourse ejecutando Debian 12, durante la prueba en julio, aún distribuía la versión 1.19.7. La vulnerabilidad era pública. El parche existía. El despliegue no había alcanzado a ponerse al día.

Esa brecha entre un arreglo publicado y su presencia en un servidor en ejecución es uno de los modos de fallo más comunes en seguridad de infraestructura. Lo notable aquí es qué hicieron los investigadores con el pie de guerra.

Desde el servidor del foro, aprovecharon el sistema de single sign-on de OpenAI. El foro ofrecía la opción «Iniciar sesión con OpenAI», el mismo flujo de autenticación que usaba el personal en herramientas internas. Una vez que los investigadores controlaban el foro, podían secuestrar las sesiones de cualquier empleado de OpenAI que se hubiera autenticado a través de él. Sin ingeniería social adicional. Sin phishing. Las víctimas no realizaron ninguna acción.

Hacktron caracterizó esto como un problema de identidad de OpenAI, no de Discourse. Cualquier servicio que usara el mismo token SSO podría haber otorgado acceso equivalente. El mismo patrón se aplicaría a Slack, GitHub o correo si esas herramientas compartieran el proveedor de identidad, y los investigadores señalaron que, en teoría, la cadena podría alcanzarlas todas.

Ese alcance más amplio era posible. No se usó. El límite que los investigadores trazaron es revelador: demostraron el acceso interno, dispararon una pull request y se detuvieron.

El modelo que cerró la brecha

La cadena de exploit requería vencer ASLR, una protección estándar de memoria. Hacktron primero probó Claude Opus 4.8, que luchó durante múltiples sesiones para producir un payload funcional una vez que ASLR estaba activo.

Anthropic lanzó Claude Opus 5 la tarde del 24 de julio. En una sesión nueva, el modelo produjo un exploit funcional en cuestión de horas.

Opus 5 llegó con salvaguardas diseñadas para impedir que el modelo escribiera código de exploit dirigido a sistemas reales. Los investigadores sortearon estas barreras dirigiendo el modelo contra su propio servidor de pruebas, disfrazado como objetivo de práctica de capture-the-flag, y ejecutándolo en un bucle automatizado. Aclaran que esto no fue hacking desatendido. La dirección humana experta siguió siendo esencial en todo momento.

El resultado se ajusta a un patrón que Anthropic y otros laboratorios han documentado este año: los modelos de vanguardia están reduciendo bruscamente el piso de habilidad necesario para trabajo ofensivo serio. Anthropic ha reportado que actores criminales y patrocinados por estados ya están usando modelos Claude para realizar intrusiones reales. OpenAI es ahora un objetivo nombrado en esa dinámica.

Más allá de OpenAI

Hacktron denominó HEIF Heist al esfuerzo más amplio. En aproximadamente dos meses, el equipo identificó la misma clase de fallo de decodificación de imágenes en software usado por otras grandes compañías. El costo total en IA se mantuvo por debajo de $3.000.

La campaña vincula bugs reportados en Slack, productos de Meta, GitHub Enterprise y Next.js. La advertencia de Vercel confirma el fallo en Next.js. Los mantenedores de libheif confirmaron un exploit de ejecución de código vinculado a Meta. Las afirmaciones de ejecución de código en todo el conjunto de aplicaciones afectadas siguen teniendo apoyo desigual. Hacker News señaló esta limitación al cubrir el fallo de Next.js en agosto.

Un detalle destaca: para objetivos sobre los cuales el equipo no tenía conocimiento previo, cambiaron de Claude Opus 5 a GPT-5.6 Sol de OpenAI. La elección del modelo siguió la información disponible, no la lealtad de marca. Solo Shopify parece haber notado la actividad, a pesar de los crashes repetidos bajo cargas de prueba.

Qué significa esto para la seguridad de los laboratorios de IA

La implicación inmediata es operativa. Cualquier organización que ejecute un servidor Discourse debería reconstruir sobre la última imagen. Una actualización de la interfaz web por sí sola no reemplazará la librería antigua. Las versiones parcheadas self-hosted son 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6. Las organizaciones deben actualizar libheif a 1.23.4 o a la versión parcheada de su distribución.

La implicación estructural es más profunda. El single sign-on es un multiplicador de fuerza para la conveniencia y un multiplicador de fuerza para el riesgo. Cuando un servicio de cara al público y una herramienta interna comparten el mismo proveedor de identidad, una compromiso en el flanco se convierte en un compromiso en el núcleo. El caso OpenAI es un ejemplo de manual de esa amplificación.

No hay indicios de que la falla de OpenAI se explotara contra alguien fuera del alcance de la investigación. A mediados de septiembre de 2026, no aparecía en la lista del gobierno de EE. UU. de vulnerabilidades conocidas como explotadas activamente, aunque la ausencia de esa lista no es evidencia de seguridad.

La pregunta más amplia es si las organizaciones que ya parchearon deben auditar buscando accesos previos. Sobre ese punto, las fuentes disponibles guardan silencio. La disciplina de los investigadores al limitar la cadena sugiere buena fe, pero la buena fe no es una garantía de seguridad.

El verdadero costo

Seis mil quinientos dólares es un bounty modesto. Tres mil dólares en cómputo de IA es despreciable. Dos meses de investigación de un equipo pequeño son un cronograma ajustado.

Lo que los atacantes demostraron es reproducible. La misma clase de fallo existe en despliegues de libheif en toda internet. Los mismos patrones de SSO conectan servicios públicos con infraestructura interna en empresas de todo tamaño. La capacidad del modelo que cerró la brecha de ASLR en horas es ahora un producto embarcado, no un prototipo de investigación.

La carrera entre laboratorios suele enmarcarse en términos de capacidad del modelo. Este incidente lo reformula. Claude Opus 5 no solo escribió mejor texto. Ayudó a un equipo de tres personas a convertir un bug de foro en un secuestro de cuentas de personal más rápido de lo que el objetivo pudo parchearlo. El lado defensivo todavía respondió en 14 horas. Pero el lado ofensivo ya no necesita un presupuesto de estado-nación para que ese tipo de cadena funcione.

El cheque de $6.500 no es la historia. La historia es que la barrera para producirlo acaba de caer por debajo de lo que la mayoría de los equipos de seguridad pueden permitirse ignorar.