technology 6 min de lectura

Cuando ChatGPT y Claude se quedan sin luz a la vez, la alarma debería ser real

ChatGPT y Claude cayeron en la misma hora del 3 de septiembre, exponiendo una vulnerabilidad que nadie quiere admitir: el ecosistema global de IA está mucho más concentrado de lo que parece. Un fallo de infraestructura único dejó fuera a múltiples plataformas a la vez.

  • Anthropic
  • infraestructura en la nube
  • arnés
  • Opus 5
  • ChatGPT
  • Azure
  • infraestructura en la nube

Un miércoles que nadie olvidará

A las 10:20 a. m. (hora del este) del 3 de septiembre, ChatGPT comenzó a tener fallos. Los usuarios escribían sus prompts y esperaban. Algunos recibían errores; otros, fragmentos de respuestas que morían a mitad de frase. Para las 11 a. m., Downdetector registraba aproximadamente 37 000 reportes de caída solo en Estados Unidos. La herramienta de programación con IA Codex también estaba fuera de servicio.

Por la misma época, Claude se fue a oscuras. Luego Grok. Cursor, el asistente de programación recientemente reformulado de xAI y ahora absorbido por su matriz, también titubeó y se apagó. Se informó que Gemini de Google se desconectó para algunos usuarios, aunque Google nunca emitió un comunicado formal. Los servicios comenzaron a recuperarse hacia el mediodía, con OpenAI confirmando la resolución a principios de la tarde y Anthropic declarando todo en orden a las 12:16 p. m. (hora del este) tras aplicar un parche de emergencia.

OpenAI, irónicamente, anunció ese mismo día su nuevo modelo de última generación, llamado Astra.

La coincidencia es pura casualidad. Pero el hecho de que cuatro servicios de IA principales —que abarcan OpenAI, Anthropic, xAI y potencialmente Google— tropezaran dentro de la misma ventana de dos horas no lo es.

La capa compartida oculta

Ninguna de las empresas ha confirmado la causa raíz. OpenAI, Anthropic y xAI no han publicado ningún informe técnico posterior al incidente. La explicación más plausible, sugerida por la superposición de las interrupciones, es Microsoft Azure. Los informes indican que Azure experimentó sus propios problemas durante la misma ventana. Azure aloja una parte significativa de la infraestructura de Anthropic y es el socio cloud principal de OpenAI. La superposición no es accidental: es estructural.

Esta es la incómoda verdad que pasa por alto la mayor parte de la cobertura sobre IA. La industria se presenta como un mercado pluralista: OpenAI, Anthropic, Google, xAI, Meta; todos modelos competidores, todos independientes. En realidad, funcionan sobre una fina capa de infraestructura compartida. Los mismos centros de datos. Las mismas rutas de red. Las mismas redes eléctricas. Cuando un solo componente de esa capa falla, no se cae una sola aplicación. Se cae toda una pila de generación de IA.

Este es el mismo riesgo de concentración que ha acosado a la nube durante una década. AWS y Azure ya han provocado interrupciones muy sentidos: la alteración de AWS en 2021 dejó fuera de servicio simultáneamente a Slack, Disney+ y una infinidad de servicios más. Lo nuevo es que la IA ha pasado de ser una capa de conveniencia a ser una capa operativa.

De novedad a infraestructura crítica

Hace tres años, una caída de ChatGPT significaba que no podías generar un poema o depurar un script. Hoy significa que un equipo de atención al cliente pierde su herramienta principal de triaje. Un equipo de desarrollo no puede ejecutar revisiones de código automatizadas. La tubería documental de un analista se detiene. Los agentes de IA —sistemas que encadenan múltiples llamadas a herramientas sin intervención humana— son la última escalada. No solo responden a prompts; ejecutan flujos de trabajo de varios pasos a través de correo electrónico, bases de datos y sistemas internos. Cuando un agente choca contra un muro, no pausa educadamente. Deja transacciones a medias, colas suspendidas y procesos colgados.

El cambio es real y se está acelerando. La adopción empresarial de la IA ha pasado de la experimentación a la integración. Las empresas están conectando modelos directamente a sistemas de producción. La curva de dependencia se está empinando más rápido que la ingeniería de resiliencia.

La ilusión del plan B

La respuesta de la industria ante la caída ya está tomando forma. Las estrategias multi-modelo se están promocionando como la solución. La idea es sencilla: enrutar las solicitudes a OpenAI por defecto, pero cambiar a Anthropic o Google si un proveedor falla. Algunas compañías están construyendo gateways de IA que monitorean los tiempos de respuesta y la disponibilidad entre modelos en tiempo real y reenvían el tráfico automáticamente.

En papel, esto tiene sentido. En la práctica, tiene límites.

El plan de contingencia asume que el problema a nivel inferior está aislado a un solo proveedor. Si la falla reside en la capa cloud compartida —si Azure, por ejemplo, es el denominador común—, entonces enrutar a un modelo diferente alojado en la misma infraestructura no logra nada. Una estrategia multi-modelo solo te aísla de fallos específicos del proveedor, no de fallos generalizados de infraestructura. Esa distinción importa enormemente y rara vez se explicita.

Incluso cuando el plan de contingencia funciona, introduce latencia. Los agentes que dependen de respuestas subsegundo pierden eficiencia. Los equipos que han construido flujos de trabajo en torno al comportamiento de la API de un modelo específico enfrentan fricción de integración al cambiar. Y el costo de mantener acceso redundante a modelos entre proveedores no es trivial.

Qué sigue

Varias cosas son probables. Primero, este incidente acelerará el debate sobre la resiliencia de la infraestructura de IA, pero la conversación probablemente se mantendrá en la capa de aplicación: enrutamiento multi-modelo, balanceo de carga, reintentos —más que enfrentar el problema subyacente de concentración. Esa es la ruta política más fácil para todas las empresas involucradas.

Segundo, las empresas que han construido flujos de trabajo dependientes de la IA sin planes de redundancia enfrentarán un momento de verdad. La caída fue breve: quizás dos horas para la mayoría de los usuarios. Pero en un escenario peor que dure de seis a doce horas, el impacto sería medible: SLA incumplidos, despliegues estancados, empleados frustrados. Las organizaciones que traten a la IA como una herramienta opcional aprenderán esto rápido.

Tercero, los reguladores podrían tomar nota. El Reglamento de Resiliencia Operativa Digital de la UE y marcos similares ya exigen a las firmas financieras y de sectores críticos demostrar resiliencia ante fallos tecnológicos. Las caídas de IA que perturban funciones comerciales centrales podrían eventualmente caer bajo esos requisitos, especialmente a medida que los agentes de IA pasen de la asistencia a la automatización.

La caída del 3 de septiembre fue breve. Precisamente eso la convierte en útil como advertencia más que como desastre. La infraestructura que ahora transporta gran parte del tráfico de IA del mundo sigue siendo pequeña comparada con lo que necesita ser. La concentración es una característica de la velocidad: permite que los modelos se entrenen más rápido, lancen actualizaciones más rápido y escalen más barato. Pero también es un punto único de falla esperando ser ejercitado.

Cuando ChatGPT y Claude se apagaron juntos, la verdadera historia no fue el tiempo de inactividad. Fue el recordatorio de que el piso bajo la revolución de la IA es más delgado de lo que parece.