La memoria zHBM de Samsung podría redefinir la economía de los agentes de IA
El apilamiento de memoria cero-gap de Samsung promete una velocidad de inferencia 10 veces mayor para agentes de IA y abre una salida al duopolio HBM. Las implicaciones van más allá de las especificaciones de los chips: afectan la economía de la infraestructura de IA, la computación en dispositivo y la política de exportación de EE. UU.
La metáfora del ascensor que explica por qué la apuesta de Samsung importa
Kim In-dong, ejecutivo de planificación de productos de memoria de Samsung en su filial estadounidense DSA, comparó la arquitectura HBM de brecha cero de la compañía con colocar un ascensor privado en una habitación de hotel que baja directo al vestíbulo. Nada más de esperar el banco principal de ascensores. Nada más de caminar entre pisos.
Las cifras detrás de esa metáfora son lo que hace que esto valga la pena. Samsung afirma que el zHBM —apilar memoria de alta anchura de banda directamente sobre el acelerador de IA en lugar de junto a él en el mismo sustrato— ofrece hasta ocho veces el rendimiento y más del triple de eficiencia energética en comparación con el HBM5 en la configuración actual de 2.5D. No se trata de una actualización marginal. Es una geometría diferente del movimiento de datos.
La meta que estableció la compañía en la Cumbre de Infraestructura de IA en Santa Clara el 16 de septiembre es igualmente clara: impulsar la velocidad de respuesta de los agentes de IA desde los 100 tokens por segundo por usuario actuales hasta 1 000 tokens por segundo. Un salto diez veces mayor. Kim lo llamó un salto cuántico. En la práctica, significa la diferencia entre un agente de IA que responde en tiempo real y uno que parece lento, una brecha que determina si los clientes empresariales adoptan flujos de trabajo basados en agentes a gran escala o los abandonan.
Quién gana y quién pierde
El perdedor inmediato es obvio: SK Hynix, que actualmente domina el mercado de HBM y suministra la mayor parte de la memoria que alimenta las pilas de GPU de NVIDIA. El zHBM de Samsung está diseñado específicamente para desacoplar el rendimiento del diseño en 2.5D que ha sido el estándar de la industria, y que SK Hynix ha dominado. Si las plataformas de computación acelerada adoptan el enfoque vertical de Samsung, el foso defensivo de SK Hynix se reduce aún cuando el mercado total de memoria alcanzable crece.
Pero la historia más grande es lo que esto significa para la estructura misma de la infraestructura de IA. Los agentes de IA actuales funcionan en racimos masivos de servidores porque la proporción memoria-computo que requieren los modelos de trillones de parámetros es absurdamente costosa solo en DRAM. El anuncio paralelo de Samsung sobre el z NAND-O, una solución de almacenamiento 3D basada en NAND dirigida a estaciones de trabajo con IA local, sugiere un segundo frente. Kim dijo que ejecutar un modelo de un billón de parámetros en z NAND-O costaría una sexta parte de lo que requeriría solo DRAM. Las muestras comenzarán a distribuirse en 2028.
Esa es una propuesta dirigida directamente al borde de la red. Si puedes ejecutar un agente útil localmente en una estación de trabajo en lugar de transmitir cada solicitud a un centro de datos, la economía de la implementación de IA cambia drásticamente. Los costos de energía bajan. La latencia disminuye aún más. Las preocupaciones de soberanía de datos se reducen. La pregunta es si el compromiso de rendimiento es aceptable, y los datos de Samsung sugieren que la brecha se cierra rápidamente.
El problema térmico del que nadie habla lo suficiente
Apilar memoria directamente sobre un acelerador caliente no es gratuito. El calor del chip se transfiere a la pila de memoria, y eso degrada el rendimiento y la longevidad. Samsung lo reconoció directamente, diciendo que está construyendo un sistema de co-diseño con los clientes aceleradores desde las etapas más tempranas para gestionar la salida térmica. Esa es una señal: Samsung no está vendiendo un componente. Está vendiendo una arquitectura integrada, y necesita relaciones profundas con las compañías que construyen los aceleradores para que funcione.
Esto importa porque eleva la barrera de entrada para cualquiera que intente replicar el enfoque. El requisito de co-diseño significa que Samsung está cerrando alianzas antes de que la tecnología alcance su volumen completo. Las compañías que ya se han comprometido —probablemente incluyendo al menos a un gran diseñador estadounidense de aceleradores— obtendrán acceso temprano a un rendimiento que el resto del mercado no verá durante meses o años.
La dimensión de política estadounidense
Washington ha estado endureciendo las restricciones sobre la exportación de memorias avanzadas a China, y el HBM está claramente en la mira. El zHBM de Samsung, desarrollado y lanzado desde sus operaciones en EE. UU., existe en una zona gris legal: es una tecnología de una compañía coreana, construida en parte en América, vendida globalmente. El gobierno estadounidense observará de cerca si esta arquitectura se convierte en otro vector para el acceso chino a infraestructura de IA de última generación.
También hay una pregunta estratégica debajo de la superficie política. EE. UU. ha presionado fuertemente para que los aliados alineen los controles de exportación de semiconductores, pero el movimiento de Samsung hacia el apilamiento vertical de memoria podría ayudar inadvertidamente a los diseñadores chinos nacionales de aceleradores si la arquitectura demuestra ser superior y las firmas chinas encuentran formas de licenciar o reverse ingenierizar aspectos de ella. El modelo de co-diseño que Samsung está construyendo es inherentemente colaborativo: comparte conocimiento arquitectónico con socios, y algunos de esos socios pueden operar en jurisdicciones que EE. UU. no puede controlar completamente.
Qué sucede después
Los próximos 18 meses serán decisivos. Samsung planea muestras de z NAND-O en 2028, y el zHBM ya está en desarrollo activo. Las compañías que construyen aceleradores de IA —NVIDIA, AMD, Intel y el creciente número de startups estadounidenses y europeas— tomarán sus decisiones de integración ahora. Quien se alinee con el enfoque vertical de Samsung gana una ventaja de rendimiento que se componda a medida que las cargas de trabajo de agentes crecen. Quien se mantenga en 2.5D corre el riesgo de quedarse atrás en la métrica que más importa: la velocidad de respuesta.
La meta de 1 000 tokens por segundo no es solo un número de marketing. Es el umbral en el que los agentes de IA se vuelven genuinamente útiles para flujos de trabajo empresariales en tiempo real: servicio al cliente, generación de código, planificación dinámica. Cruzar ese umbral y la curva de demanda de memoria se desplaza nuevamente. Fallarlo y toda la economía de agentes se estanca.
Samsung está apostando a que el apilamiento vertical resuelve ambos problemas. La apuesta es plausible. La ejecución está por demostrar. Y la ventana antes de que los competidores se pongan al día se mide en meses, no en años.