NVIDIA wil meer tokens uit elke megawatt halen in haar AI-fabrieken

NVIDIA está trasladando la optimización de los centros de datos de IA desde componentes aislados hacia una gestión conjunta de energía, refrigeración, red y cargas de trabajo. Su plataforma NVIDIA DSX busca incrementar la capacidad de procesamiento de IA en infraestructuras con un presupuesto eléctrico fijo, basándose en pruebas con Lambda que registran un 24 % más de tokens por segundo bajo el mismo límite de potencia.

Resumen de NVIDIA DSX en 30 segundos

  • Lambda ejecutó 19 nodos dentro del presupuesto eléctrico que normalmente soportarían solo 16 nodos a plena carga.
  • El rendimiento del clúster pasó de unos 4 a 5 millones de tokens por segundo, un aumento del 24 %.
  • La eficiencia por vatio mejoró en un 23 % en dichas pruebas.
  • Emerald AI redujo automáticamente una carga de 4 a 3 megavatios ante señales de Silicon Valley Power.
  • NVIDIA estima que ciertos despliegues con Vera Rubin pueden ofrecer hasta un 40 % más de capacidad GPU manteniendo el mismo presupuesto eléctrico.

El crecimiento en inteligencia artificial hace que la disponibilidad eléctrica sea una de las restricciones principales para ampliar las infraestructuras de computación acelerada. NVIDIA plantea que aumentar la potencia total no siempre es la única opción; también se puede optimizar el uso de la electricidad existente.

Este es el enfoque de NVIDIA DSX, una plataforma que combina herramientas de diseño y simulación con software de operación, gestión dinámica de energía y arquitecturas de referencia. La compañía presentó DSX en GTC Taipei y ya realiza validaciones iniciales para demostrar cómo puede maximizar el trabajo por cada unidad de energía consumida.

El principal indicador de esta estrategia es la cantidad de trabajo útil que una fábrica de IA puede realizar por megavatio. En sistemas dedicados a inferencia, esto se mide en tokens generados por segundo, aunque el resultado final depende de las cargas, configuraciones y condiciones específicas de cada instalación.

Lambda logra un 24 % más de tokens con el mismo presupuesto

Una de las pruebas más concretas proviene de Lambda, proveedor de infraestructura GPU. La empresa validó NVIDIA DSX MaxLPS en un clúster de cinco racks y 19 nodos basados en servidores NVIDIA HGX B200.

Este sistema utiliza software de gestión dinámica de energía para monitorear el consumo de las GPU y racks, redistribuyendo el margen de energía según las necesidades de las cargas. La idea es evitar reservar potencia de forma estática para cargas que en determinados momentos no la necesitan.

En la prueba, Lambda logró operar los 19 nodos dentro del mismo límite de potencia que antes se destinaba a 16 nodos a plena carga. Esto resultó en un aumento aproximado del 24 % en el rendimiento total de tokens, pasando de unos 4,04 millones a cerca de 5 millones por segundo.

La eficiencia por vatio también mejoró un 23 %. NVIDIA y Lambda destacan que este comportamiento es especialmente importante cuando entrenamiento e inferencia comparten infraestructura, ya que sus perfiles de consumo difieren y un sistema de asignación estática no puede aprovechar ese margen.

NVIDIA describe MaxLPS como un modelo de asignación dinámica que recupera esa capacidad disponible dentro de un límite eléctrico establecido. En escenarios de referencia para futuras fábricas, como las basadas en Vera Rubin NVL72, NVIDIA indica que este enfoque puede permitir hasta un 40 % más de GPU dentro del mismo presupuesto de energía en ciertos entornos. Es importante señalar que estas cifras son estimaciones, no resultados universales aplicables de forma general.

La documentación técnica ejemplifica un escenario de inferencia con un límite de 1 megavatio, en el que MaxLPS logra una capacidad de 400 GPUs y un rendimiento en tokens 1,35 veces superior al modo MaxP. NVIDIA advierte que para realizar ese potencial en la práctica, es necesario diseñar la infraestructura considerando también refrigeración, red y otros sistemas complementarios.

Una fábrica de IA puede responder a la red eléctrica

Otra parte clave de la propuesta implica la relación entre los centros de datos y la red eléctrica. NVIDIA describe una demostración realizada con Emerald AI y Silicon Valley Power, la compañía eléctrica que suministra energía a Santa Clara.

En uno de los ejemplos, Silicon Valley Power envió una señal para reducir el consumo de una fábrica de IA. Emerald AI Conductor recibió la instrucción y ajustó automáticamente cargas flexibles: trabajos de menor prioridad se ralentizaron o reprogramaron, mientras que las tareas prioritarias continuaron sin interrupciones.

La potencia se redujo de 4 a 3 megavatios sin intervención manual. NVIDIA también señala que Silicon Valley Power ha enviado más de 200 señales de demanda a esa instalación y que el mecanismo respondió en todos los casos reportados.

Esta demostración utilizó Emerald AI Conductor y aún no forma parte de DSX Flex. NVIDIA la presenta como una experiencia preliminar que sienta las bases para la estrategia de DSX Flex, diseñada para recibir señales de la red —como solicitudes de reducción de carga o respuestas a eventos de demanda— y ajustar las prioridades de las cargas de IA en consecuencia.

La primera implementación comercial de DSX Flex está prevista para una instalación de 96 megavatios en Manassas, Virginia, dentro del AI Factory Research Center de NVIDIA. La plataforma integrará el control de Emerald AI Conductor a medida que avance el desarrollo de DSX Flex.

Este concepto implica un cambio en cómo entendemos una fábrica de IA. La infraestructura no solo consume electricidad, sino que también puede modificar temporalmente su demanda cuando las cargas lo permiten. Las tareas priorizadas continúan, mientras que otras esperas a un momento con menor presión sobre la red.

Distribución eléctrica de 800 VDC y visión integral de la infraestructura

NVIDIA también desarrolla una arquitectura de distribución eléctrica de 800 VDC, corriente continua a 800 voltios. Este diseño busca reducir las conversiones, mejorar la eficiencia en la entrega eléctrica y facilitar la alimentación de racks de computación cada vez más densos.

La arquitectura de 800 VDC forma parte de las referencias de DSX. NVIDIA estima que, en ciertos escenarios asociados a Vera Rubin NVL72, esta solución podría mejorar entre un 3 % y un 5 % la eficiencia total en comparación con una distribución de 54 V, proyectando su disponibilidad para 2027. Estas cifras son estimaciones de NVIDIA y dependen de la configuración específica.

El ecosistema de DSX incluye varios componentes: DSX MaxLPS para maximizar el rendimiento en un presupuesto de potencia fijo; DSX Flex para adaptar cargas según la red; DSX OS para gestionar el ciclo de vida de las fábricas; DSX Sim para modelar instalaciones antes de su construcción; y referencias de diseño validadas en términos de configuración de computación, red, almacenamiento y sistemas de soporte.

NVIDIA también incorpora la refrigeración líquida directa en algunos racks GB200 NVL72, los cuales generan alrededor de 120 kW de calor. Por eso, ampliar la potencia de cálculo sin considerar adecuadamente la refrigeración, red o distribución eléctrica puede dejar capacidad infrautilizada.

La filosofía de NVIDIA sostiene que la eficiencia de una fábrica de IA debe medirse por la cantidad de trabajo que logra realizar con los recursos disponibles, no solo por el rendimiento máximo de una GPU. Los resultados de Lambda validan parcialmente esta idea, y la experiencia con Emerald AI muestra que algunas instalaciones pueden ajustar su consumo en respuesta a las necesidades de la red.

El siguiente paso será evaluar cómo funcionan estas técnicas en despliegues mayores y con cargas de trabajo diferentes. Las cifras de Lambda corresponden a una configuración específica, mientras que las mejoras proyectadas para Vera Rubin dependen de las condiciones particulares de cada instalación.

Preguntas frecuentes

¿Qué es NVIDIA DSX?

NVIDIA DSX es una plataforma diseñada para planificar y gestionar fábricas de IA que combina computación, energía, refrigeración, red y software, con el objetivo de optimizar el rendimiento dentro de un presupuesto energético definido.

¿Cuánto mejoró Lambda su rendimiento con DSX?

Lambda alcanzó un 24 % más de rendimiento total en tokens en una prueba con DSX MaxLPS, aumentando de aproximadamente 4,04 millones a cerca de 5 millones de tokens por segundo manteniendo el mismo límite de potencia.

¿Cuál es la función de DSX Flex?

DSX Flex está diseñado para adaptar las cargas de trabajo de una fábrica de IA a las señales de la red eléctrica, reduciendo temporalmente el consumo de tareas no prioritarias y garantizando la continuidad de las cargas clave.

¿Qué papel juega la arquitectura de 800 VDC?

NVIDIA incorpora una distribución eléctrica de 800 VDC en sus diseños de referencia para reducir la complejidad de las conversiones y mejorar la eficiencia en instalaciones con racks de alta densidad.

vía: blogs.nvidia

Scroll naar boven