Claude Code ahora es peor porque su IA intenta demasiado
Claude Opus 5 genera respuestas más largas e agresivas que frustran a los usuarios que solo buscan código conciso. Esta regresión revela una tensión más profunda en el desarrollo de IA: cuando los modelos priorizan la capacidad sobre el cumplimiento, se vuelven más difíciles de usar.
El nuevo modelo es peor. He aquí por qué ocurrió.
Claude Opus 5 llegó en julio de 2026 con promesas de mayor capacidad. En cambio, los desarrolladores notaron de inmediato algo extraño: el código que producía era más largo, más lento y más intrusivo que el que entregaba Opus 4. Los usuarios que actualizaron se encontraron recortando manualmente las salidas, cancelando pasos innecesarios de verificación y reiniciando sesiones que el nuevo modelo había ampliado más allá de su intención original.
Esto no es una queja normal de ciclo de vida de software. Es una inversión documentada: un modelo más nuevo que actúa por debajo de su predecesor en ejes prácticos de usabilidad.
Lo que admite la guía de prompts
Anthropic publicó una guía oficial de prompting para Opus 5. Dentro de ella, la compañía reconoce abiertamente los cambios de comportamiento que los usuarios están señalando. La guía indica que Opus 5 genera respuestas más largas por defecto, verifica de forma independiente su propio trabajo y añade pasos o amplía el alcance de la tarea sin que se le pida.
También delega de manera más agresiva a sub-agentes, tratando las tareas grandes de forma diferente a las pequeñas. La guía advierte explícitamente que usar Opus 5 para trabajos menores aumentará el costo y la latencia, recomendando un ámbito de aplicación más reducido.
En otras palabras, las quejas ya circulantes en Japón y más allá —respuestas más largas, bucles de verificación no solicitados, expansión de alcance no deseada— no son errores. Son decisiones de diseño incrustadas en la arquitectura del modelo. La regresión que los usuarios experimentan es el resultado directo de un compromiso deliberado: Anthropic priorizó la autonomía tipo agente sobre el cumplimiento mínimo.
Los números cuentan la historia
Arena, la plataforma públicamente votada de comparación de modelos, publicó sus rankings del 11 de septiembre. En la categoría de Seguimiento de Instrucciones, Claude Opus 4.6 High tomó el primer lugar. Claude Opus 5 High ocupó el quinto. En los rankings generales, Opus 4.6 High se situó en la segunda posición mientras Opus 5 High cayó al noveno.
Estos son votos impulsados por los usuarios, no benchmarks controlados. Deben tratarse como señal, no como prueba. Pero la dirección es innegable: en múltiples ejes de evaluación, el modelo más nuevo no supera al más antiguo. Para una actualización de producto, esto no debería ocurrir.
Quiénes ganan y quiénes pierden
Los desarrolladores pierden de inmediato. Cada hora dedicada a redirigir un modelo sobreentusiasta de vuelta al alcance es tiempo tomado del trabajo real. Las ganancias de productividad prometidas por una IA más rápida e inteligente se evaporan cuando la IA está ocupada haciendo cosas que no se le pidieron.
Anthropic pierde confianza. Los usuarios esperan que las actualizaciones mejoren los resultados, no que los degraden. Cuando Opus 5 requiere una nueva estrategia de prompting, un nuevo umbral de tolerancia y un nuevo modelo mental sobre cómo opera la herramienta, se rompe la promesa implícita de evolución sin fisuras.
El ecosistema de competidores gana una apertura. Cada informe de regresión crea espacio para rivales —OpenAI, Google, Cursor, las herramientas de IA de JetBrains— para reclamar que sus modelos respetan mejor la intención del desarrollador. En el mercado de herramientas de codificación, esa narrativa viaja rápido.
El problema más profundo
Lo que revela Opus 5 es una tensión estructural en el desarrollo de IA que ha ido construyéndose durante años: la capacidad del modelo y la utilidad del modelo no son lo mismo.
La capacidad escala con mayor entrenamiento, más parámetros y razonamiento interno más rico. La utilidad a menudo depende de la contención: la capacidad de detenerse en el límite de lo que se preguntó, devolver una salida concisa y evitar alucinar trabajo extra. Estos dos objetivos tiran en direcciones opuestas.
Cuando un modelo se vuelve más capaz, también se vuelve más autónomo. Comienza a verificar, contrastar, elaborar y expandir. Eso es técnicamente una mejora en el razonamiento. Es prácticamente una degradación en la fricción del flujo de trabajo. El modelo está haciendo más, no menos. Pero lo que está haciendo no siempre es lo que el usuario pidió.
Por qué esto importa más allá de Claude
La regresión de Opus 5 no es única de Anthropic. Es un patrón emergente en herramientas de IA para codificación. Los desarrolladores reportan comportamiento similar en versiones más nuevas de modelos competidores —salidas que crecen más largas, sesiones que toman más tokens, respuestas que asumen responsabilidades para las cuales la herramienta nunca fue diseñada.
La cobertura temprana de Japón es notable. El mercado local tiene una fuerte tradición de herramientas de precisión y diseño centrado en el desarrollador. Cuando los usuarios japoneses señalan una regresión, tiende a reflejar una lectura más amplia y escéptica de las afirmaciones de IA que el ciclo de hype en Silicon Valley. El hecho de que esta historia esté ganando tracción en Japón antes de llegar a cobertura más amplia en inglés sugiere que la tendencia de inversión puede ser real y propagarse más rápido de lo que la narrativa de la industria admite.
Qué ocurre después
Anthropic probablemente responderá con orientación, ajuste fino o un nuevo modo que reduzca la verbosidad y limite la expansión de alcance. La compañía puede introducir un preset “conciso” o “minimalista” para Opus 5. Los usuarios pueden ver ajustes incrementales que restauran parcialmente la experiencia que tenían con Opus 4.
Pero la tensión subyacente permanece sin resolver. Hasta que los modelos de IA puedan escalar en capacidad sin escalar en afirmación, la experiencia del desarrollador continuará fluctuando con cada actualización. La regresión no es una anomalía. Es un síntoma.
La lección para la industria es clara: los mejores modelos no son automáticamente modelos más útiles. Y hasta que el campo trate el seguimiento de instrucciones como una métrica de capacidad de primera clase —no un efecto secundario— el patrón se repetirá. La próxima versión del modelo líder llegará con la misma promesa y el mismo problema.