OpenNebula valideert zijn virtualisatie voor NVIDIA GB200 NVL72

OpenNebula ha completado la validación de su plataforma dentro del programa de hipervisores de NVIDIA para sistemas GB200 NVL72, un paso clave para demostrar que las cargas de inteligencia artificial pueden ejecutarse en máquinas virtuales conservando el acceso directo a las GPU. La iniciativa busca abordar una problemática cada vez más relevante en las infraestructuras de IA: cómo mantener las ventajas operativas de la nube sin depender exclusivamente del bare metal para el uso de aceleradores.

Resumen en 20 segundos de OpenNebula y NVIDIA GB200 NVL72

  • OpenNebula ha validado su plataforma de virtualización para sistemas NVIDIA GB200 NVL72.
  • Utiliza PCI passthrough para asignar directamente GPU y otros dispositivos a las máquinas virtuales.
  • Su objetivo es combinar aislamiento, automatización y multiinquilinidad con acceso directo al hardware acelerador.
  • OpenNebula afirma ser la única plataforma cloud europea validada actualmente en este programa de NVIDIA.
  • Esta integración forma parte de su oferta para AI Factories, HPC y proveedores de infraestructura GPU.

La validación resulta especialmente relevante en un momento donde las GPU están modificando decisiones tradicionales en arquitectura. Durante años, las cargas HPC y posteriormente las de IA favorecían el utilización de bare metal para evitar capas de emulación o abstracción que redujeran rendimiento o introdujeran latencia.

El problema es que renunciar a la virtualización implica también perder herramientas que facilitan la gestión de infraestructuras cloud: separación entre clientes, aprovisionamiento automatizado, políticas de recursos, gestión centralizada y ciclos de vida independientes para cada carga.

Gracias a la evolución hardware y tecnologías como PCI passthrough, esa disyuntiva puede reducirse.

Una máquina virtual con acceso directo a la GPU

La pieza técnica clave en este planteamiento es PCI passthrough.

En virtualizaciones tradicionales, algunos dispositivos pueden quedar detrás de capas de emulación o abstracción. Con passthrough, un dispositivo PCIe físico puede asignarse directamente a una máquina virtual, permitiendo que el sistema operativo invitado interactúe con él como si fuera directo.

Para una GPU, esto significa que la VM mantiene su frontera de aislamiento y administración, mientras el acelerador se entrega de forma directa a esa carga de trabajo.

Este enfoque resulta especialmente importante en IA y HPC, donde aplicaciones necesitan altas transferencias de datos y comunicación eficiente entre CPU, GPU, almacenamiento y red.

OpenNebula pretende mantener un acceso cercano al que tendría un despliegue en bare metal, pero sin abandonar el modelo operativo de infraestructura virtualizada.

Para un proveedor cloud o una empresa con cientos de GPU, esa diferencia puede ser decisiva.

Ya no solo se trata de obtener el máximo rendimiento por acelerador, sino también de asignar recursos entre diferentes equipos, separar clientes, automatizar despliegues, gestionar cuotas y retirar entornos cuando dejan de ser necesarios.

Aquí es donde la virtualización vuelve a ser relevante incluso en entornos construidos alrededor de GPU.

NVIDIA GB200 NVL72: una escala mayor

La validación se efectuó sobre NVIDIA GB200 NVL72, una arquitectura diseñada para cargas de IA a gran escala.

Estos sistemas combinan múltiples aceleradores Blackwell y procesadores Grace conectados mediante NVLink. La idea es que diversos aceleradores actúen como un gran dominio de computación, apto para entrenamiento e inferencia de modelos muy grandes.

Gestionar infraestructura de este tipo como una colección de servidores tradicionales resulta cada vez menos práctico cuando debe compartirse entre múltiples proyectos o clientes.

Por eso, alrededor de conceptos como AI Factories ha surgido una capa de software para gestionar recursos compartidos: computación, GPU, redes y almacenamiento.

OpenNebula sitúa su plataforma precisamente en esa capa de gestión.

De acuerdo con la compañía, su propuesta es una plataforma abierta y neutral respecto al proveedor para construir AI Factories multiinquilino, servicios GPU para nubes privadas, centros HPC y operadores de telecomunicaciones.

Su integración con NVIDIA va más allá de GB200 NVL72, documentando compatibilidad o integración con tecnologías como NVLink, NVSwitch, unidades DPU BlueField, Ethernet Spectrum-X e InfiniBand. Además, cuenta con integración con NVIDIA Run:ai para planificación y distribución de recursos GPU sobre Kubernetes.

Virtualización y bare metal: coexistencia en las AI Factories

La validación refleja también cómo están cambiando las infraestructuras dedicadas a IA.

En los primeros clústeres GPU, obtener rendimiento máximo justificaba configuraciones bastante rígidas, con servidores dedicados a cargas específicas y software instalado directamente sobre el sistema operativo.

Este escenario todavía tiene sentido en ciertos casos, especialmente cuando una organización necesita dedicar toda la máquina a un entrenamiento intensivo durante largos periodos.

Pero las infraestructuras comerciales demandan otras soluciones.

Un proveedor de GPU en la nube puede atender a varias empresas simultáneamente. Un centro de investigación puede distribuir sus aceleradores entre diversos proyectos. Las organizaciones necesitan entornos independientes para entrenamiento, inferencia, desarrollo y pruebas.

El uso de máquinas virtuales permite crear esas barreras sin la necesidad de dedicar infraestructura diferente a cada usuario.

OpenNebula también ofrece opciones para distribuir aceleradores mediante tecnologías como NVIDIA MIG (Multi-Instance GPU) y otras soluciones de partición vGPU, que dividen recursos GPU cuando no es necesario ofrecer un acelerador completo a cada carga.

Así, se pueden distinguir distintos modelos:

Las cargas más exigentes pueden recibir GPU completas mediante passthrough. Otros servicios pueden compartir aceleradores mediante particiones. Los nodos, además, pueden integrarse en una infraestructura gestionada desde una capa cloud común.

Esta flexibilidad es especialmente útil para optimizar la utilización de GPU, uno de los activos más costosos en nuevas plataformas de IA.

Una tecnología europea en el programa de NVIDIA

OpenNebula aporta también una dimensión europea a la noticia.

La compañía asegura ser actualmente la única plataforma cloud europea validada en el NVIDIA AI Cloud-Ready ISV Program. Su documentación confirma que toda su pila de infraestructura cloud está validada sobre NVIDIA GB200 NVL72.

Es importante aclarar que esta afirmación refiere específicamente a ese programa y categoría, y no indica que OpenNebula sea la única tecnología europea compatible con GPU de NVIDIA ni la única utilizada en infraestructuras de IA.

Para Europa, contar con capas de gestión propias adquiere especial interés en proyectos como IA soberana y AI Factories.

El hardware puede provenir de NVIDIA u otros fabricantes internacionales, pero la capa que administra usuarios, VMs, Kubernetes, redes, almacenamiento y políticas determina quién controla operativamente la infraestructura.

OpenNebula busca ocupar ese espacio con una plataforma abierta, adaptable a entornos privados, centros HPC, operadores y proveedores cloud.

Su enfoque en evitar dependencias tecnológicas y mantener control sobre la infraestructura y el software encaja con las agendas europeas de soberanía tecnológica y capacidad propia para operar infraestructuras de IA.

La validación con GB200 NVL72 suma una prueba técnica adicional en uno de los escenarios más exigentes que pretende cubrir.

También ilustra una tendencia más amplia: el bare metal y la virtualización dejan de ser necesariamente excluyentes en IA.

Cuando la GPU se puede entregar directamente a una VM, la discusión pasa a centrarse en el nivel de aislamiento y automatización necesario, los recursos compartidos y el impacto real de cada arquitectura.

En AI Factories con miles de aceleradores y numerosos usuarios, gestionar eficazmente esas GPU puede ser tan importante como disponer de ellas.

Preguntas frecuentes

¿Qué ha validado NVIDIA en OpenNebula?

OpenNebula ha validado su plataforma para infraestructura acelerada NVIDIA, incluyendo su despliegue sobre sistemas NVIDIA GB200 NVL72, dentro del programa de NVIDIA correspondiente.

¿Cómo puede una VM acceder directamente a una GPU?

Mediante PCI passthrough, el dispositivo PCIe se asigna directamente a la VM, permitiendo que el sistema invitado tenga acceso directo al hardware sin perder su capacidad de aislamiento y gestión.

¿Obliga OpenNebula a virtualizar todas las cargas de IA?

No. La plataforma está diseñada para gestionar diferentes modelos de infraestructura, incluyendo virtualización, bare metal y Kubernetes, además de tecnologías de particionado y compartición de GPU.

¿Es OpenNebula la única plataforma europea certificada por NVIDIA?

OpenNebula afirma ser actualmente la única plataforma cloud europea validada mediante el NVIDIA AI Cloud-Ready ISV Program. Esta afirmación se refiere a ese programa específico y no implica exclusividad respecto a otras tecnologías o regiones en Europa.

Scroll naar boven