technology 6 min de lectura

El Gemini 4 de Google supera la prueba, pero falla en la práctica

Los informes internos de Google revelan que el rendimiento de codificación de Gemini 4 Argon se queda rezagado respecto a sus puntuaciones en benchmarks — un problema que la industria de la IA denomina 'benchmaxxing' y que podría reflejar un fallo más amplio de las herramientas de IA occidentales para adaptarse a los flujos de trabajo reales de desarrollo en Asia Oriental.

  • KakaoAI
  • Noam Shazeer
  • Anthropic
  • cámara Samsung
  • política tecnológica

Los benchmarks te están mintiendo

Google mostró Gemini 4 Argon la semana pasada a un círculo reducido de socios de ciberseguridad. Sobre el papel, parece imbatible: puntuaciones de primer nivel en múltiples benchmarks, supuestamente superando a Astra de OpenAI en al menos una evaluación de seguridad. Dentro de la empresa, la narrativa es de confianza. Un líder de ingeniería le dijo a Bloomberg que existe un “consenso amplio” según el cual Gemini 4 está a la vanguardia.

Pero otro grupo de empleados de Google, incluidos algunos con acceso directo a la línea de desarrollo del modelo, cuentan una historia distinta. Los benchmarks no coinciden con la experiencia. El rendimiento en programación, en particular, es irregular. El trabajo de diseño front-end —crear interfaces de aplicación, maquetas web, flujos de experiencia de usuario— es donde las brechas se hacen más evidentes. Un modelo que puntúa bien en pruebas estandarizadas produce código que los desarrolladores encuentran frustrante trabajar en la práctica.

El titular coreano del artículo lo captura perfectamente: “¿Por qué da la sensación de que resulta frustrante usarlo?”

Este no es un problema específico de Gemini. Es la tensión central de la industria de la IA actual, y los comentarios de desarrolladores coreanos sobre Gemini 4 ponen un lente regional preciso sobre algo que importa a nivel global.

La trampa del benchmaxxing

La industria de la IA tiene ahora una palabra para esto: benchmaxxing. Describe la creciente incentiva de optimizar modelos para las puntuaciones de los benchmarks en lugar de para las tareas desordenadas y no estandarizadas a las que se enfrentan realmente los usuarios. Los benchmarks son visibles. Se pueden rankear. Impulsan los discursos de venta. El resultado es que los constructores de modelos invierten esfuerzo en exprimir puntos de las pruebas, no en crear herramientas que se sientan bien en las manos de un desarrollador.

Edwin Chen, fundador de la startup de IA Surge AI, lo comparó con el SAT. Un estudiante puede obtener la puntuación perfecta en un examen de práctica y aún así tener dificultades en un aula universitaria. Un modelo que domina MMLU o HumanEval no necesariamente produce código limpio y listo para producción a la primera.

Gemini 4 no es universalmente débil. Fuentes familiarizadas con evaluaciones internas dicen que maneja bien la extracción de metadatos de video, rinde de forma sólida en tareas de seguridad y ciberseguridad, y se comunica de manera que se siente natural y clara. Estas son fortalezas reales. Pero en un mercado donde el diferenciador se está convirtiendo en la productividad real de codificación —no la capacidad teórica—, las brechas importan.

Lo que los desarrolladores coreanos ven que otros pasan por alto

La preocupación que emerge en los círculos tecnológicos coreanos sobre Gemini 4 es un recordatorio de que las herramientas de IA occidentales a menudo se optimizan para flujos de trabajo y patrones lingüísticos que no se traducen bien a los mercados de Asia Oriental. Los desarrolladores coreanos escriben código en inglés pero navegan por documentación, marcos de trabajo y convenciones de diseño moldeadas por un ecosistema de usuarios muy diferente. Un modelo entrenado principalmente en repositorios en inglés y prácticas de desarrollo estadounidenses puede producir salida sintácticamente correcta que pasa por alto el matiz práctico de cómo realmente se usan esas herramientas en Seúl, Tokio o Singapur.

Esto no es exclusivo de Corea. Es un punto ciego sistémico. Cuando el ecosistema dominante de benchmarking es estadounidense, cuando la mayor reserva de datos de entrenamiento proviene de repositorios de GitHub en inglés, y cuando la base de clientes principal para IA de codificación está en Silicon Valley, los modelos resultantes reflejarán esos sesgos —incluso si las puntuaciones de los benchmarks parecen neutrales.

Las dificultades de Gemini 4 con el trabajo front-end, donde las convenciones de diseño y las expectativas de experiencia de usuario varían significativamente entre regiones, pueden ser la canaria. Si un modelo optimizado para patrones de desarrollo occidentales tropieza en el diseño de interfaces, es probable que tenga puntos ciegos similares en ecosistemas front-end en chino, flujos de trabajo de SaaS japoneses y otros mercados no anglosajones que aún no han hecho tanto ruido.

Los competidores no se quedan quietos

Dentro de Google, algunos empleados están observando de cerca a Fable de Anthropic y Astra de OpenAI, y concluyen que ambos avanzan más rápido que Gemini. Esa percepción importa sin importar si es completamente precisa. En un mercado donde la lealtad de los desarrolladores es frágil y los costos de cambio son bajos, ser percibido como rezagado es casi tan dañino como estarlo realmente.

OpenAI y Anthropic están empujando fuerte hacia agentes de codificación y productos de desarrollo integrado. Google tiene la ventaja de distribución: Gemini ya está integrado en Gmail, Búsqueda, Chrome, Maps y otros servicios con más de mil millones de usuarios cada uno. Pero la distribución por sí sola no gana la carrera de modelos. Si los desarrolladores descubren que su asistente de codificación con IA favorito produce consistentemente código front-end mediocre mientras que las alternativas ofrecen mejores resultados, migrarán. La base instalada de Google es un activo, pero no es un foso contra una peor experiencia de producto.

El costo de un lanzamiento fallido

Las apuestas son más altas de lo que la mayoría de los reporteros están presentando. Google anunció previamente Gemini 3.5 Pro en mayo y luego lo dejó caer en silencio antes del lanzamiento. Manavik Sandhu, analista de Bloomberg Intelligence, estimó que entrenar un solo modelo grande de este tamaño puede costar hasta 400 millones de dólares, sin contar los salarios del personal de investigación involucrado. Ese es dinero perdido sin nada que mostrar a cambio.

Gemini 4 en sí se describe como un modelo muy grande con una ventana de contexto de hasta 1 millón de tokens —aproximadamente 750 000 palabras. Los modelos grandes son costosos de ejecutar. Cada token adicional de contexto incrementa los costos de inferencia, y los propios servicios de Google —Búsqueda, Gmail, Cloud— eventualmente tendrán que absorber esos costos si Gemini 4 ha de impulsarlos a escala.

La pregunta es si el modelo entrega ganancias de productividad reales suficientes para justificar la economía. Los benchmarks dicen que sí. Los desarrolladores que lo usan día a día están menos convencidos.

Por qué esto importa más allá de Google

El episodio de Gemini 4 es un estudio de caso en un problema que modelará a toda la industria de la IA durante años. La brecha entre las puntuaciones de los benchmarks y el rendimiento en el mundo real no es un fallo —es una característica estructural de cómo la industria mide el éxito actualmente. Hasta que eso cambie, los modelos que más fuertes se ven en el papel seguirán decepcionando en la práctica, y las compañías que ignoren la discrepancia perderán la confianza de los desarrolladores más rápido de lo que esperan.

Los desarrolladores coreanos están entre los primeros en señalar esto porque están entre las comunidades de codificación con IA no hablantes de inglés más activas. Sus comentarios son una señal de que el sesgo hacia los benchmarks anglocéntricos es real, medible y costoso. Si Gemini 4 no puede ganarse a los desarrolladores front-end coreanos, le resultará más difícil ganarse a cualquier desarrollador que no encaje en el perfil del típico trabajador tecnológico estadounidense.

El debate interno de Google aún no está resuelto. Pero el hecho de que esté ocurriendo dentro de uno de los laboratorios de IA más grandes del mundo debería ser una advertencia para todos los que apuestan por las puntuaciones de los benchmarks como prueba de la preparación del producto.