d-Matrix integrará su próxima generación de aceleradores de inteligencia artificial Raptor XPU en la arquitectura de racks NVIDIA MGX a través de NVLink Fusion, en el marco de una colaboración plurianual que busca facilitar la implementación de estos chips especializados en inferencia en grandes centros de datos, sin necesidad de desarrollar infraestructura propia desde cero. Se espera que los primeros sistemas integrados estén listos para el cuarto trimestre de 2027, aunque Raptor aún debe completar una etapa clave: la compañía tiene como objetivo cerrar su diseño y enviarlo a fabricación antes de finalizar 2026.
Resumen en 30 segundos de la alianza entre d-Matrix y NVIDIA
- d-Matrix diseñará Raptor para integrarlo directamente con NVIDIA NVLink Fusion y los racks MGX.
- Los sistemas combinarán tecnologías como Vera CPU, BlueField-4, ConnectX-9 y Spectrum-X.
- Raptor está especializado en inferencia y utiliza una arquitectura que apila DRAM sobre un chip de cálculo SRAM.
- d-Matrix planea integrar sus XPU con sistemas NVIDIA Vera Rubin para distribuir distintas fases de la inferencia.
- La disponibilidad inicial está prevista para el cuarto trimestre de 2027.
Este anuncio refleja un movimiento más amplio en el mercado de hardware para inteligencia artificial. NVIDIA está utilizando NVLink Fusion para ampliar su infraestructura a procesadores desarrollados por otras empresas, incluidos aceleradores especializados o XPU y CPU personalizados.
Para empresas como d-Matrix, esto resuelve un problema que va mucho más allá de simplemente fabricar un buen chip.
Un acelerador destinado a centros de datos requiere conectividad de alta velocidad, servidores, racks, energía, refrigeración, redes entre nodos y una cadena de suministro capaz de producir el sistema en volumen. Diseñar cada componente por separado puede añadir años de desarrollo y elevar significativamente los costos de entrada en grandes instalaciones.
d-Matrix busca evitar gran parte de ese proceso adoptando una arquitectura ya desarrollada en colaboración con NVIDIA.
Raptor se conectará mediante NVLink y utilizará el ecosistema MGX
El primer resultado de esta colaboración será un sistema en rack basado en NVIDIA MGX, en el cual se instalarán los Raptor XPU de d-Matrix.
La compañía planea incorporar componentes de NVIDIA como procesadores Vera, conmutadores NVLink, unidades de procesamiento de datos (DPU) BlueField-4, conectores ConnectX-9 SuperNIC y la red Ethernet Spectrum-X.
También colabora con Astera Labs, miembro del ecosistema NVLink Fusion, para desarrollar soluciones de conectividad que aseguren un alto flujo de datos dentro del sistema.
Este enfoque distingue dos niveles de comunicación:
NVLink se usará para el scale-up, es decir, para conectar aceleradores dentro de un mismo dominio de cálculo con alta velocidad y baja latencia, mientras que Spectrum-X cubrirá el scale-out, encargándose de comunicar diferentes sistemas y racks en una infraestructura mayor.
| Componente | Función prevista en el sistema |
|---|---|
| d-Matrix Raptor XPU | Inferencia especializada |
| NVIDIA Vera CPU | Procesamiento general y coordinación |
| NVIDIA NVLink Fusion | Interconexión de alta velocidad entre aceleradores |
| NVIDIA BlueField-4 | Infraestructura y procesamiento de red |
| NVIDIA ConnectX-9 | Conectividad de alto rendimiento |
| NVIDIA Spectrum-X | Red Ethernet para escalabilidad entre sistemas |
| NVIDIA MGX | Arquitectura modular para servidores y racks |
| Astera Labs | Soluciones de conectividad para integración |
El objetivo de d-Matrix es concentrar más recursos en el procesador, aprovechando una infraestructura de racks, refrigeración y conectividad ya existentes, junto con una cadena de suministro desarrollada.
Esto no significa que Raptor sea una GPU de NVIDIA ni que NVIDIA vaya a fabricar el acelerador. NVLink Fusion actúa como un punto de integración entre silicios de terceros y parte de la infraestructura de NVIDIA.
Una arquitectura de memoria diseñada específicamente para inferencia
Raptor será el sucesor de Corsair, la plataforma de inferencia que d-Matrix ya tiene operativa.
La innovación tecnológica más relevante reside en la memoria.
Los modelos generativos necesitan mover continuamente grandes volúmenes de parámetros y datos entre memoria y unidades de cálculo. Este movimiento puede convertirse en uno de los principales cuellos de botella en términos de velocidad, consumo de energía y coste de la inferencia.
d-Matrix lleva años desarrollando una arquitectura centrada en reducir esa distancia.
Raptor empleará una solución de apilamiento 3D que combina un chip de memoria DRAM y uno de cálculo basado en SRAM en un mismo paquete vertical, una estructura que su compañía representa como un edificio de dos pisos.
Los detalles técnicos de esta tecnología fueron presentados en Hot Chips 2026 por Sudeep Bhoja, cofundador y CTO de d-Matrix, y posteriormente publicados por IEEE.
La compañía afirma que Raptor cuenta con más de 100 patentes relacionadas y que su procesador ya está siendo evaluado por grandes proveedores de nube y laboratorios de IA. Sin embargo, no ha divulgado públicamente qué empresas participan en dichas evaluaciones.
Este producto todavía no está en fase comercial.
d-Matrix espera realizar el tape-out de Raptor antes de que finalice 2026. El tape-out marca la finalización del diseño para envío a fabricación, aunque aún quedan pasos posteriores como la fabricación de muestras, pruebas, correcciones, validación y producción en volumen.
Por ello, la compañía estima que la disponibilidad de los sistemas Raptor integrados en MGX será en el cuarto trimestre de 2027.
GPU y XPU compartiendo la inferencia
La colaboración no implica necesariamente que Raptor sustituya a las GPU.
d-Matrix propone arquitecturas heterogéneas en las que diferentes procesadores ejecutan las distintas fases de una carga de trabajo, según su idoneidad.
Un ejemplo es la inferencia segmentada de modelos de lenguaje.
Cuando un usuario realiza una petición a un modelo, hay dos fases con características distintas: prefill, que procesa el contexto inicial completo, y decode, que genera tokens de forma progresiva.
El prefill requiere mucha capacidad de cálculo paralelo, mientras que el decode, especialmente en aplicaciones interactivas, es muy sensible a la latencia y al acceso rápido a memoria.
d-Matrix plantea que sistemas NVIDIA Vera Rubin puedan encargarse del prefill, mientras que los Raptor XPU gestionan cargas específicas en decode.
Ejemplos son asistentes de programación, chatbots en tiempo real y asistentes de voz, donde reducir el tiempo entre tokens impacta directamente en la experiencia del usuario.
Por ahora, todo esto corresponde a la arquitectura y casos de uso que propone d-Matrix. El anuncio no proporciona benchmarks independientes ni cifras comparativas de rendimiento, consumo o coste por token respecto a Vera Rubin u otros aceleradores de inferencia.
Por tanto, las afirmaciones sobre reducción de latencia o mejora en eficiencia energética son aún objetivos y declaraciones del fabricante, hasta contar con hardware final y mediciones confiables.
NVLink Fusion: convirtiendo la infraestructura de NVIDIA en una plataforma para otros chips
El aspecto estratégico del acuerdo va más allá de d-Matrix.
Durante años, NVLink ha sido una de las ventajas principales de NVIDIA para construir sistemas con múltiples GPU funcionando como un gran dominio de cálculo. Con NVLink Fusion, la empresa está abriendo esa infraestructura de interconexión a ciertos procesadores de terceros.
El resultado es una relación aparentemente contradictoria: otros fabricantes pueden competir con las GPU de NVIDIA en determinadas cargas, usando tecnologías propias de NVIDIA para construir sus sistemas.
Para NVIDIA, esto amplía el mercado de NVLink, Spectrum-X, BlueField, ConnectX, MGX y otros componentes, incluso cuando el acelerador principal no sea de su propia fabricación.
Para los diseñadores de chips, esto reduce una barrera importante.
Crear un acelerador personalizado ya resulta sumamente costoso, y convertirlo en una plataforma capaz de soportar miles de procesadores en un centro de datos requiere resolver alimentación, refrigeración líquida, conectividad, servidores, racks, software y producción.
NVLink Fusion permite a empresas especializadas entrar en ese mercado sin tener que reproducir toda la infraestructura que NVIDIA ha desarrollado alrededor de sus GPUs.
d-Matrix ejemplifica esta estrategia, centrando su innovación en inferencia y buscando integrar Raptor en arquitecturas compatibles con la infraestructura de NVIDIA, en lugar de construir una plataforma completa desde cero.
Si el cronograma se cumple, el primer hardware con esta integración aparecerá a finales de 2027. Hasta entonces, quedan dos incógnitas principales: cómo funcionará finalmente Raptor tras su fabricación y cuánto se mantendrá la ventaja de su arquitectura de memoria cuando se implemente a escala de rack.
Lo que ya muestra este acuerdo es una evolución de NVIDIA, que va más allá de vender sus propias GPU. Con NVLink Fusion, intenta transformar su interconexión, redes y diseño de racks en una infraestructura común que también soporte chips especializados en IA, ampliando sus oportunidades en el mercado.
