DeepSeek acaba con el asesino de memoria… y los chips coreanos lo sienten primero
La compresión KV-cache de 75 % y la reducción del 87,5 % en el uso de SSD de DeepSeek V4.1 Flash sacuden la cadena de suministro global de IA. Los fabricantes coreanos de HBM son las primeras bajas.
El número que redefinió la inferencia de IA
DeepSeek acaba de lanzar un modelo que consume una fracción de la memoria que sus competidores requieren, y el mundo de los semiconductores está recalculando sus apuestas en tiempo real. El modelo V4.1 Flash, anunciado el 10 de septiembre, cobra 0,15 dólares por cada millón de tokens durante horas fuera del pico de demanda. Para comparar, GPT-4o de OpenAI y Claude 3.5 Sonnet de Anthropic cuestan entre 50 y 100 veces más por token en niveles similares. DeepSeek no solo está reduciendo los precios. Está socavando la economía fundamental de la inferencia de IA.
El mecanismo detrás de los ahorros es lo más importante. La nueva arquitectura de DeepSeek utiliza un diseño de Mezcla de Expertos con 528 mil millones de parámetros totales, pero activa solo 8 a 16 mil millones por token. Eso no es nuevo: Mistral y Google ya habían hecho enrutamiento similar. Lo que cambia es cómo DeepSeek comprimió la memoria caché KV, el espacio de trabajo temporal donde el modelo almacena información sobre los tokens previamente procesados durante la generación. Cada token ahora requiere solo 890 bytes de almacenamiento en caché KV, una caída a aproximadamente una cuarta parte de lo que exigía el modelo V4 Flash. El almacenamiento de puntos de control a largo plazo en SSD se redujo a una octava parte de los niveles anteriores.
La prensa tecnológica china lo llamó el “asesino de memoria” por algo. Una llamada API ahora cuesta menos de un yuan para las empresas. Las implicaciones para la demanda de chips son inmediatas y medibles.
Por qué los fabricantes coreanos de memoria son el primer daño colateral
El mercado respondió el mismo día. El 11 de septiembre, las acciones de SK Hynix y Samsung Electronics en Seúl cayeron entre 2 y 3 por ciento. La noche anterior, los certificados de depósito americanos de Micron Technology y SK Hynix en Nueva York cayeron más de 5 por ciento cada uno. Las compañías chinas de IA recibieron golpes peores: MiniMax Group y Z.AI perdieron más de 8 por ciento cada una en los intercambios de Hong Kong, mientras que Alibaba cayó más de 2 por ciento.
Corea está desproporcionadamente expuesta porque su fortuna semiconductor está concentrada en dos áreas que la arquitectura de DeepSeek ataca directamente: la memoria de alto ancho de banda para cargas de trabajo de entrenamiento e inferencia, y la infraestructura de almacenamiento que soporta enormes tablas de caché KV. La HBM es el eslabón más estrecho y sensible. Cada punto porcentual de reducción en la huella de memoria por token comprime el mercado alcanzable para los chips HBM3e y HBM4 de próxima generación.
Esta no es una narrativa sobre DeepSeek reemplazando las GPU de NVIDIA. El modelo aún ejecuta cómputo, simplemente con mucha menos memoria por operación. Pero la memoria es donde viven los márgenes de ganancia para las fábricas coreanas, y donde el crecimiento de la demanda ha sido más agresivo. Si cada solicitud de inferencia requiere una cuarta parte de la caché KV, entonces el ciclo de adquisición de HBM se ralentiza. Los operadores de centros de datos que expanden clústeres de inferencia ordenarán menos módulos de memoria por GPU. Las matemáticas son lo suficientemente simples como para que Wall Street las precificara en horas.
La exposición va más allá de un solo lanzamiento de modelo. SK Hynix obtiene más del 40 por ciento de sus ingresos de productos de memoria específicamente diseñados para entrenamiento e inferencia de IA, una concentración que la hace acutamente vulnerable a cualquier cambio arquitectónico que reduzca la intensidad de memoria. Samsung, aunque más diversificado, ha apostado una porción significativa de su expansión de gastos de capital a capturar la demanda de HBM del segmento de más rápido crecimiento del ciclo semiconductor. Micron, cuyos certificados de depósito americanos cayeron bruscamente junto con SK Hynix, vinculó similarmente sus narrativas de crecimiento 2025-2026 a supuestos sobre huellas de memoria cada vez mayores por solicitud de inferencia. La técnica de compresión de DeepSeek socava directamente esos supuestos.
La zona mortal de la que Bloomberg advirtió
Artificial Analysis describió el paisaje competitivo emergente como una “zona mortal”: un espacio donde los modelos que carecen tanto de liderazgo en precios como de dominio en rendimiento serán desplazados. DeepSeek está ocupando deliberadamente la esquina de precios. Concede que aún no supera a Anthropic ni a OpenAI en benchmarks de codificación o agentes. Pero está apostando a que la mayoría de las cargas de trabajo empresariales no necesitan el nivel más alto.
Bloomberg Intelligence señaló la preocupación estructural: las barreras técnicas bajas para entrar están acelerando el desarrollo de modelos de IA a nivel de commodity, dejando a ninguna empresa con poder de precios duradero. Las guerras de precios por token no muestran señales de terminar. Cuando el costo marginal de una llamada a API de razonamiento cae por debajo de un yuan, la pregunta cambia de cuál modelo es el mejor a cuál modelo es suficientemente bueno al menor precio. Esa pregunta favorece a los innovadores en eficiencia sobre los líderes en capacidad, y favorece a los innovadores en eficiencia sobre los proveedores de memoria que apostaron a que la carrera armamentista de capacidades continuaría sin interrupciones.
El efecto de segunda orden ya es visible en el comportamiento de compras empresariales. Los CTO y los equipos de compras que se preparaban para compromisos plurianuales con proveedores de nube basándose en costos proyectados de inferencia a precios de OpenAI y Anthropic ahora están revisando sus presupuestos a la baja. Algunos están renegociando contratos. Otros están probando modelos de clase DeepSeek para cargas de trabajo previamente reservadas para sistemas de gama alta. Esto no es pánico; es una reapropiación a cámara lenta de toda la pila de inferencia. Y en la base de esa pila se encuentra la HBM, el commodity cuya curva de demanda acaba de volverse más plana de lo que cualquiera quería admitir.
Qué cambia de ahora en adelante
DeepSeek anunció que eliminará su modelo V4-Pro a partir del 14 de septiembre, enrutando automáticamente toda la inferencia al V4.1 Flash. La migración es interna, pero la señal es externa: la compañía trata la eficiencia de memoria como una característica del producto, no solo como una optimización de ingeniería. Otros laboratorios chinos enfrentarán la misma presión de comprimir sus cachés KV o perder competitividad en precios.
Para los fabricantes coreanos de memoria, el riesgo no es que la demanda de IA desaparezca. Es que la demanda crezca más lentamente de lo esperado y se desplace hacia arquitecturas que usan menos memoria por unidad de producción. La HBM sigue siendo esencial para entrenar modelos grandes y para las pocas cargas de trabajo de inferencia que requieren razonamiento de primera categoría. Pero la inferencia es el negocio de volumen, y DeepSeek acaba de demostrar que puedes atender ese volumen con drásticamente menos bytes.
Los movimientos bursátiles del 11 de septiembre fueron un borrador inicial de la reevaluación del mercado. El segundo borrador llegará cuando los operadores de centros de datos ajusten sus pronósticos de adquisición de HBM para 2026 y 2027. Si las técnicas de compresión de DeepSeek se convierten en estándar de la industria en lugar de una anomalía de un solo modelo, la revisión a la baja en las estimaciones de demanda de memoria podría profundizarse. Si permanecen como una optimización específica de DeepSeek, el impacto podría limitarse.
El mercado aún no sabe cuál escenario es más probable. Pero se movió por la primera posibilidad, y ese movimiento te dice más que cualquier conferencia de resultados. Las fábricas coreanas construyeron sus planes de expansión sobre el supuesto de que la inferencia de IA crecería como un negocio intensivo en memoria. DeepSeek acaba de demostrar que la trayectoria opuesta es técnicamente factible y comercialmente convincente. La pregunta para Samsung, SK Hynix y Micron ya no es si la demanda de memoria para IA se mantendrá. Es si pueden adaptarse lo suficientemente rápido a un mercado donde los modelos ganadores usan menos de lo que ellos venden. La primera ronda de reapreciación ha terminado. El reajuste estructural apenas comienza.