d-Matrix brengt DRAM naar 3D om het geheugenmuur van AI aan te pakken

La carrera por acelerar la inteligencia artificial ya no depende únicamente de fabricar GPU más potentes. d-Matrix ha detallado Raptor, su próxima arquitectura para inferencia, que utilizará memoria DRAM apilada directamente con la lógica para alcanzar hasta 100 TB/s de ancho de banda con 32 GB de capacidad, según las especificaciones presentadas por la compañía. La propuesta busca reducir uno de los principales costes de los modelos actuales: mover continuamente enormes cantidades de datos entre memoria y unidades de cálculo.

Las claves de Raptor y la memoria 3D DRAM en 20 segundos

  • d-Matrix propone 32 GB de 3D DRAM y alrededor de 100 TB/s de ancho de banda.
  • La compañía estima un consumo de transferencia cercano a 0,37 pJ/bit en su tecnología.
  • La lógica se integra directamente sobre la DRAM mediante tecnología 3D.
  • El objetivo es acercarse al ancho de banda de SRAM con mucha más capacidad.
  • Raptor está diseñado específicamente para inferencia de modelos de IA.

Esta tecnología no surge de la nada. d-Matrix presentó en 2025 su concepto 3DIMC y posteriormente fabricó Pavehawk, un chip experimental que valida la integración de memoria DRAM apilada dentro de sus metas de consumo y rendimiento. Raptor será su primer producto comercial para llevar esa arquitectura al centro de datos.

Lo interesante de esta propuesta es que aborda un problema que crece al mismo ritmo que los modelos: los aceleradores necesitan almacenar pesos cada vez mayores y mantener cachés KV (Key-Value) que aumentan con la longitud del contexto y el número de usuarios simultáneos.

Una diapositiva mostrada por d-Matrix ilustra el problema con Kimi K3. Asumiendo pesos de 8 bits, el tamaño del modelo sería de unos 2.800 GB. Para el caché KV, un contexto de un millón de tokens requiere 14,6 GB por usuario; con 64 usuarios concurrentes, la cifra se acerca a los 935 GB.

El mensaje es claro: la memoria se está convirtiendo en una de las principales limitaciones físicas para la inferencia de IA.

Entre la SRAM y la HBM, aparece una tercera opción

Las arquitecturas actuales enfrentan un compromiso difícil.

La SRAM es extremadamente rápida y puede integrarse muy cerca de las unidades de cálculo. El acelerador Corsair de d-Matrix, por ejemplo, usa una arquitectura basada en SRAM para lograr baja latencia en inferencia.

Este sistema logra un ancho de banda de aproximadamente 300 TB/s, con una latencia cercana a 1 nanosegundo.

El principal problema es la capacidad.

Una celda SRAM convencional 6T ocupa mucho más espacio que una celda DRAM, por lo que su densidad resulta insuficiente para almacenar los enormes modelos actuales. d-Matrix estima el límite práctico de su solución SRAM en alrededor de 4 GB por par de tarjetas.

La memoria HBM (High Bandwidth Memory) resuelve parcialmente este problema.

Al apilar múltiples chips DRAM y conectarlos mediante interposers, los fabricantes pueden ofrecer cientos de gigabytes junto a GPU y aceleradores. NVIDIA, AMD y gran parte de la industria de aceleración de IA usan actualmente esta arquitectura.

Pero la HBM también tiene límites físicos.

El número de pilas que se pueden colocar alrededor del procesador está condicionado por el espacio en el encapsulado, y aumentar el ancho de banda requiere más conexiones en número y velocidad.

d-Matrix estima que las configuraciones con HBM4 alcanzarán unos 20 TB/s en sistemas de próxima generación, muy por debajo del ancho de banda que puede ofrecer la SRAM.

Su estrategia consiste en cambiar la forma del problema.

En lugar de poner la memoria alrededor del procesador, Raptor sitúa la lógica directamente encima de la DRAM.

100 TB/s sin necesidad de una interfaz HBM tradicional

La arquitectura 3DIMC (3D In-Memory Compute) emplea conexiones verticales ultracortas entre memoria y cálculo.

d-Matrix explica que esto permite eliminar gran parte de las interfaces físicas necesarias para mover datos entre chips separados.

Sus datos anteriores ya indicaban aproximadamente 20 TB/s por stack, casi diez veces la capacidad del ancho de banda por pila que la compañía considera para HBM4, con un consumo de entre 0,3 y 0,4 pJ/bit.

Raptor amplía ese concepto.

La configuración combina un chip lógico fabricado con el proceso N4 de TSMC y memoria DRAM personalizada, unidos mediante un enlace face-to-face con paso aproximado de 36 micras.

La compañía propone una configuración de 32 GB capaz de ofrecer cerca de 100 TB/s de ancho de banda.

La cifra en consumo energético también es relevante: 0,37 picojulios por bit.

En comparación, d-Matrix referencia una configuración HBM4 de unos 192 GB y 18-20 TB/s, con un consumo en varios picojulios por bit.

Como siempre, estas comparaciones deben tomarse con cautela. Son arquitecturas distintas, con capacidades diferentes y métricas proporcionadas por el fabricante. Además, Raptor aún está en desarrollo y no hay una plataforma comercial disponible para verificar todas estas cifras en aplicaciones independientes.

d-Matrix ya cuenta con silicio experimental. La firma asegura que Pavehawk ha validado su tecnología 3D DRAM y que las pruebas en diferentes voltajes y temperaturas muestran aproximadamente 0,4 pJ/bit en los escenarios más adversos.

El gran ahorro proviene de mover menos datos

El consumo energético de la memoria se ha convertido en uno de los principales obstáculos en centros de datos de IA.

No basta con medir la energía en multiplicaciones matrixiales; también hay que considerar la que requiere buscar los datos en memoria, transportarlos al procesador y devolver los resultados.

Cuanto más lejos estén memoria y cálculo físicamente, mayor suele ser ese coste.

d-Matrix calcula que una hipotética arquitectura HBM capaz de alcanzar 100 TB/s con un consumo de 2,4 pJ/bit necesitaría cerca de 1.92 kW solo para mover los datos desde la memoria.

La arquitectura 3D reduce drásticamente esa distancia.

Los bancos de DRAM pueden conectarse directamente con los motores tensoriales ubicados encima. Raptor incorpora 256 motores tensoriales por chiplet, según datos técnicos.

Además, la compañía busca que los bancos de memoria coincidan físicamente con los motores para reducir aún más los desplazamientos internos.

Este enfoque explica por qué d-Matrix habla de computación centrada en memoria: no solo se trata de hacer una DRAM más rápida, sino de rediseñar conjuntamente memoria, cálculo y conexiones.

El apilamiento 3D también genera nuevos retos

Colocar lógica y memoria en vertical elimina algunas limitaciones, pero introduce otras.

Una de las principales es la temperatura.

Los circuitos de cálculo generan mucho más calor que una memoria DRAM convencional. Si el procesador estuviera debajo, ese calor tendría que atravesar las capas de memoria antes de disiparse.

d-Matrix ha optado por colocar la lógica en la parte superior, facilitando su contacto con una placa fría.

No obstante, la DRAM debe funcionar a temperaturas superiores a las habituales. La arquitectura está diseñada para soportar temperaturas de unión de hasta aproximadamente 105 °C.

Esto requiere modificar los ciclos de refresco de la memoria.

La DRAM de Raptor realiza ciclos aproximadamente cada 4 milisegundos, unas ocho veces más frecuentes, según datos técnicos. La compañía estima que este mecanismo consume alrededor del 1,37 % del ancho de banda disponible.

También existe un reto en fabricación.

Una arquitectura 3D solo es viable económicamente si los defectos en memoria no obligan a descartar conjuntos completos. d-Matrix implementa bancos de reserva y mecanismos de corrección de errores para mejorar la tolerancia.

Entre estos, figura un esquema Reed-Solomon T=2 con CRC, diseñado para corregir errores en los bloques transferidos.

Raptor está orientado a la inferencia

d-Matrix no aspira a competir directamente con las GPU en todas las cargas de trabajo.

Su arquitectura está pensada especialmente para inferencia generativa de baja latencia, donde la relación entre capacidad de cálculo y ancho de banda de memoria difiere del entrenamiento.

La generación de tokens puede verse muy limitada por la memoria, ya que los pesos se leen repetidamente a medida que crece la caché KV del contexto de cada usuario.

Cuanto mayor sea el modelo, más largo el contexto y más usuarios simultáneos, mayor será la presión sobre el sistema de memoria.

Por ello, d-Matrix también desarrolla arquitecturas heterogéneas, donde GPU y aceleradores especializados ejecutan diferentes partes del proceso. La empresa considera que combinar Corsair con GPU en pipelines desagregados puede mejorar notablemente el rendimiento en ciertas cargas de inferencia, aunque los resultados dependen del modelo y la configuración.

Raptor será su próxima etapa.

La empresa desarrolla el acelerador junto a socios como Alchip, mientras que Andes Technology suministrará núcleos RISC-V AX46MPV para tareas de orquestación y cálculo vectorial. Ya confirmaron que Raptor será su primer producto comercial basado en 3DIMC.

Ahora la clave es comprobar cuánto del silicio experimental puede trasladarse a producción.

Alcanzar 100 TB/s con 32 GB y eficiencia de 0,37 pJ/bit sería una combinación excepcional de ancho de banda y eficiencia. Pero Raptor también deberá demostrar rendimiento sostenido, fiabilidad, costes de fabricación, rendimiento por oblea y capacidad para producción a gran escala.

La industria busca soluciones para ese reto. La próxima generación de infraestructura IA no solo requerirá más FLOPS, sino alimentarlos con mayores volúmenes de datos sin que la memoria se convierta en cuello de botella energético o de rendimiento del sistema.

Preguntas frecuentes

¿Qué es la memoria 3D DRAM de d-Matrix?

Es una arquitectura que apila física y lógicamente memoria DRAM con conexiones verticales muy cortas. d-Matrix denomina 3DIMC a su tecnología, que busca usar comercialmente en su acelerador Raptor.

¿Qué ancho de banda promete Raptor?

La configuración presentada señala aproximadamente 100 TB/s con 32 GB de memoria 3D DRAM. Son especificaciones en desarrollo y sujetas a cambios.

¿La 3D DRAM reemplazará a HBM?

No necesariamente. La HBM ofrece capacidades elevadas y cuenta con un ecosistema consolidado. d-Matrix ve su 3D DRAM como una alternativa especialmente orientada a cargas de inferencia donde el ancho de banda y el consumo de mover datos son críticos.

¿Cuánta energía consume Raptor?

d-Matrix estima unos 0,37 pJ/bit, con pruebas previas en Pavehawk en torno a 0,4 pJ/bit. Las cifras en un sistema completo se verificarán cuando Raptor esté en producción.

vía: wccftech

Scroll naar boven