GPT-6 Astra vs Gemini 3.8 vs Claude: ¿quién gana en la IA empresarial?
Una nueva comparación japonesa de IA empresarial revela una realidad compleja: ningún modelo domina, y la brecha de precios entre modelos premium y económicos es mayor que nunca. La pregunta real no es qué modelo obtiene la puntuación más alta, sino cuál resuelve el trabajo al menor costo.
El espejismo de los benchmarks
Una reciente comparativa japonesa de IA empresarial que enfrentaba a GPT-6 Astra de OpenAI contra Gemini 3.8 Flash y Fable 5.1 de Anthropic arrojó una conclusión evidente pero fácil de pasar por alto: la tabla de posiciones miente.
Sobre el papel, Astra domina. Alcanzó un 57,9 % en Terminal-Bench 4.0, superando el 55,8 % de Fable 5.1. En DeepSWE v1.1, un benchmark que mide la capacidad de desarrollo de software a largo plazo, Astra obtuvo un 74,1 % frente al 73,8 % de Gemini 3.8 Flash. Una diferencia de 0,3 puntos que pondría a cualquier periodista en portada.
Pero al mirar más de cerca, la imagen se quiebra. Gemini 3.8 Flash no iba muy atrás en esa misma prueba DeepSWE. Y en otras tareas, el ranking se invirtió por completo. El propio gráfico comparativo de OpenAI, publicado junto al anuncio de Astra, muestra que el orden cambia según la evaluación que se consulte. En MMLU-Pro, Fable 5.1 se adelantó. En LiveBench, la brecha entre Astra y Gemini se redujo a ruido estadístico. No se trata de un error de medición; es una característica estructural de los perfiles de capacidad de los modelos modernos, donde diferentes arquitecturas optimizan distribuciones de tareas fundamentalmente distintas.
Esta es la nueva normalidad. «El líder de los benchmarks no equivale al modelo más fuerte para tu caso de uso» ya no es una nota al pie precautoria. Es el punto de partida.
Tres modelos, tres nichos
Lo que realmente ilumina el análisis japonés es la especialización, y la lógica económica que se deriva de ella.
Astra destaca en trabajo operativo complejo que involucra interacción con computadoras: navegación por terminal, configuración de sistemas y análisis de datos. Está construido para operadores, no para soñadores. En la práctica, esto significa que Astra rinde bien en escenarios que requieren uso de herramientas, encadenamiento de APIs y manipulación del entorno en tiempo real. Las empresas que ejecutan automatización DevOps, flujos de troubleshooting de SRE u orquestación de pipelines de datos probablemente vean un valor desproporcionado aquí.
Fable 5.1, la última oferta de Anthropic posicionada contra Claude, maneja mejor el trabajo de conocimiento de larga duración y las sesiones de codificación extendidas. Piensa en flujos de trabajo de desarrollo de varias horas, no en prompts rápidos. Donde Fable 5.1 se distingue es en el razonamiento sostenido: mantener un contexto coherente a lo largo de docenas de turnos, depurar bases de código intrincadas sin perder el hilo y producir salidas que requieren menos ciclos de revisión. Para los equipos que realizan revisión de código asistida por IA, diseño arquitectónico o generación de documentación, esta consistencia importa más que las puntuaciones pico en benchmarks.
Gemini 3.8 Flash se traza un carril totalmente distinto: desarrollo de software de bajo costo y ejecución prolongada, además de tareas de agentes autónomos. Intercambia rendimiento pico bruto por utilidad sostenida a precios drásticamente menores. La idea clave es que los agentes no necesitan la mejor respuesta posible, sino una buena respuesta a escala. Un bot de conciliación financiera que procesa diez mil registros de transacciones no se beneficia significativamente de un aumento del 2 % en precisión por llamada individual si el lote completo se completa en la mitad del tiempo y un cuarto del costo.
La implicación para los decisores empresariales es sencilla pero poco apreciada: no se elige un modelo y se usa para todo. Se elige el modelo correcto para cada carga de trabajo. Esto es arquitectónicamente simple y organizativamente difícil: requiere una clasificación clara de los casos de uso, gobernanza sobre la selección de modelos y una infraestructura de seguimiento de costos que la mayoría de las empresas aún no poseen.
El abismo de precios
Aquí es donde la comparativa se vuelve incómoda para OpenAI y Anthropic.
Astra y Fable 5.1 comparten la misma tarifa base: 10 dólares por millón de tokens de entrada, 50 dólares por millón de tokens de salida. Eso representa aproximadamente ¥1.560 de entrada y ¥7.800 de salida a los tipos de cambio actuales.
¿Gemini 3.8 Flash? 0,75 dólares por millón de tokens de entrada, 3,75 dólares por millón de tokens de salida. Eso es aproximadamente ¥117 y ¥585, respectivamente.
Las cifras son brutales. Astra y Fable son aproximadamente 13,3 veces más costosos que Gemini por token. Incluso después de que Google suba los precios de Gemini a 1,50 dólares de entrada y 7,50 dólares de salida el 1 de enero de 2027, un doblez que Google justifica reflejando una mejora en la capacidad, la brecha permanece masiva en aproximadamente 6,7 veces.
OpenAI y Anthropic han intentado suavizar el golpe con incentivos de caché. Fable 5.1 recientemente redujo sus precios de lectura en caché un 75 %, lo que Anthropic afirma se traduce en un ahorro de costos de aproximadamente 25 % para cargas de trabajo estándar y hasta 45 % para aplicaciones intensivas en agentes. La estructura de caché de Astra es más punitiva: las solicitudes que excedan 272.000 tokens de entrada enfrentan el doble de tarifas de caché y cargos de salida multiplicados por 1,5. Estos umbrales están diseñados para desalentar exactamente los patrones —bucles de agentes de contexto prolongado, inyección repetida de prompts del sistema— que dominan el uso empresarial.
Estos ajustes importan. Pero no cierran la brecha de 13x. La estrategia de caché es, en última instancia, defensiva: reconoce que el precio por token es un pasivo mientras intenta frenar la hemorragia en lugar de abordar la brecha estructural subyacente.
La verdadera unidad de costo
La oración más importante del análisis original es también la más fácil de pasar por alto:
«La pregunta no es el precio de un token, sino cuánto cuesta completar una tarea con éxito.»
Este replanteamiento es donde debería centrarse todo el debate sobre economía de la IA empresarial. Un modelo que obtiene un 3 % más en benchmarks pero requiere tres rondas de corrección, verificación y reprompting humano puede costar más en total que un modelo más económico que lo resuelve a la primera. El costo oculto no es solo el gasto en tokens; es el tiempo de ingeniería, la latencia de revisión y el costo compuesto de las cascadas de fallo en flujos de producción.
La afirmación de Anthropic de una reducción del 45 % en costos de agentes ilustra esto con precisión. En flujos de trabajo donde los agentes autónomos dan vueltas, iteran y se autocorrigen, el costo acumulativo en tokens de un modelo «premium» puede eclipsar a una alternativa más barata que produce resultados aceptables más rápido. La relación es no lineal: un modelo que reduce las iteraciones de cuatro a dos no ahorra un 50 %, sino que ahorra todo lo que viene después de esos dos ciclos eliminados, incluyendo inferencia posterior, latencia y supervisión humana.
Por eso la estrategia de precios de Google resulta tan peligrosamente estratégica para sus competidores. Al ser 13 veces más barato, Gemini 3.8 Flash no necesita ganar en benchmarks. Solo necesita ser lo suficientemente bueno —y lo es dentro de su especialización—. La amenaza competitiva no es que Gemini supere a Astra en DeepSWE. Es que una empresa logística japonesa que procese consultas de gestión de almacén a una decimotercera parte del costo logre el mismo resultado empresarial con un perfil de economía unitaria materialmente mejor.
Qué significa esto para las empresas
El contexto del mercado japonés importa aquí. Las empresas japonesas tienden a ser adoptadoras cautelosas pero leales una vez comprometidas. Una comparativa publicada en Yahoo News Japan con el enfoque «¿Está llegando al final el dominio de Claude?» señala que incluso los compradores más conservadores están observando de cerca el panorama competitivo. El tono es analítico más que promocional, una marca de mercados donde el cambio de proveedor acarrea fricción organizacional real.
Para los lectores occidentales, la señal es doble: primero, la brecha entre benchmarks y valor de negocio se amplía a medida que los modelos se vuelven más especializados en lugar de universalmente competentes. Segundo, los mercados sensibles al precio ya están optimizando el costo total de la tarea en lugar de las puntuaciones de capacidad bruta. Las compañías que extraerán el mayor valor de la IA empresarial en 2027 no serán necesariamente aquellas con el mayor presupuesto de modelos, sino las que hayan desarrollado la disciplina interna para enrutar cargas de trabajo hacia el modelo correcto al precio correcto.
OpenAI enfrenta la posición más difícil. Astra lidera algunos benchmarks pero se sitúa en el extremo premium de precios con penalizaciones agresivas por excedentes. Anthropic se posiciona con un precio similar pero con condiciones de caché marginalmente mejores. Google se sitúa 13 veces más barato con una brecha de rendimiento que se cierra en sus dominios favorecidos.
El ganador no está claro a partir de ninguna métrica individual. La verdadera imperativa estratégica es organizacional: las empresas que traten la selección de modelos de IA como un ejercicio de adquisiciones —elegir un modelo y empujarlo a todas partes— pagarán un precio que no anticiparon. El ganador es la organización que construye una estrategia de enrutamiento de modelos con la misma deliberateza que su estrategia de bases de datos o infraestructura. El perdedor es la suposición de que un modelo puede hacerlo todo suficientemente bien, y la empresa que apueste por ella.