Broadcom heeft VMware AI Factory geïntroduceerd, een nieuwe laag van infrastructuur en diensten bovenop VMware Cloud Foundation (VCF), gericht op het inzetten van kunstmatige intelligentie in private clouds. De oplossing automatiseert alles van de voorbereiding van fysieke servers tot het implementeren van inferentiemodellen en voegt tools toe voor GPU-sharing, modelbeheer en het meten van resource- en tokenverbruik. Volgens Broadcom kan het initiële proces worden teruggebracht van weken naar slechts enkele uren, hoewel dit afhankelijk is van de specifieke infrastructuur en de inschatting van de fabrikant.
De kernpunten van VMware AI Factory in 30 seconden
- VMware AI Factory automatiseert de uitrol van fysieke servers tot inferentiediensten.
- VCF maakt het mogelijk GPU’s en modellen te delen tussen verschillende afdelingen via geïsoleerde omgevingen.
- Een nieuwe AI Gateway regelt toegang, tokenverbruik, autorisatie en de keuze tussen lokale en cloudmodellen.
- Broadcom ontwikkelt geïsoleerde omgevingen voor gecontroleerde uitvoering van AI-agentcode.
- Het platform ondersteunt meer dan 150 modellen en breidt hardware-opties uit met AMD Instinct en ROCm.
Tijdens VMware Explore 2026 schetst Broadcom duidelijk de richting waarin hun private cloud-activiteiten zich ontwikkelen. VMware beheert niet langer alleen virtualisatie en Kubernetes; VCF krijgt de taak om ook fysieke infrastructuur, accelerators en AI-modellen te beheren binnen een uitgebreide bedrijfsplatform.
Economisch gezien is dit een belangrijk aandachtspunt. Broadcom gebruikt de term AI tokenomics om het kostenaspect van het produceren van tokens en inferentie-uitvoeren te beschrijven. In tegenstelling tot het betalen per gebruik aan een externe provider, kan een bedrijf infrastructuur aanschaffen en deze capaciteit verdelen over verschillende modellen en afdelingen.
Dit betekent niet automatisch dat private infrastructuur goedkoper is. De kosten worden grotendeels bepaald door GPU-gebruik, aanschafprijs, elektriciteit, koeling, onderhoud en technologische vernieuwing. VMware AI Factory richt zich op het optimaliseren van één van deze variabelen: ervoor zorgen dat beschikbare infrastructuur gedeeld en efficiënter gebruikt kan worden.
Van serverinstallatie tot eerste model in productie
Broadcom benoemt het huidige probleem in bedrijfs-AI als een metal-to-model-proces: van de fysieke server tot het draaien van een werkend inferentiemodel in productie.
Hierbij komen diverse componenten kijken.
Het configurationeren van servers en firmware, installeren van virtualisatielaag, netwerken, opslag, Kubernetes-omgevingen, GPU-drivers, inferentieruntimes en uiteindelijk het deployen en monitoren van modellen vormen complexe stappen.
VMware AI Factory streeft ernaar om een groot deel van dit proces te automatiseren.
Broadcom beweert dat de automatiseringsmogelijkheden van VCF de tijd kunnen terugbrengen van weken naar enkele uren tussen het uitrollen van een bare-metal server en het draaien van het eerste model. Hoewel de exacte tijd varieert per infrastructuur en situatie, wordt hiermee de ambitieuze doelstelling geschetst van hun architectuur.
Een nieuwe component hiervoor is MetalSoft.
Broadcom kondigde een samenwerking aan met MetalSoft om hun technologie voor fysieke server provisioning te integreren in VCF. Hiermee kunnen beheerders servers van verschillende fabrikanten voorbereiden of opnieuw installeren via één enkele VMware-console, waardoor de noodzaak voor aparte tools verdwijnt.
MetalSoft belooft de tijd voor bare-metal provisioning van hardware te reduceren van weken naar slechts enkele minuten.
Dit is bijzonder relevant omdat veel cloud-automatisering juist begint nádat de hardware is ingericht. VMware AI Factory wil deze workflow uitbreiden tot aan de fysieke servers zelf.
GPU- en modeldeling voor betere inferentie-economie
Een andere pijler van VMware AI Factory betreft het efficiënter inzetten van GPU’s.
Het dedicateren van een volledige set accelerators aan een team of model kan kostbaar zijn, zeker als de capaciteit niet altijd volledig benut wordt.
VCF richt zich op het groeperen en delen van GPU-resources tussen verschillende workloads.
Broadcom introduceert daarnaast Multi-tenant Model Sharing. Met Model Runtime kunnen modellen gedeeld worden tussen verschillende afdelingen of tenants, binnen geïsoleerde werkruimtes.
De gedachte hierachter is simpel: als vijf teams hetzelfde model gebruiken, hoeven ze niet elk aparte, volledig onafhankelijke deployments te draaien met eigen geheugen en GPU-capaciteit.
Een centrale service zou het model kunnen hosten en deze aanbieden aan verschillende gebruikers, terwijl de logische scheiding behouden blijft.
Deze architectuur sluit aan bij Broadcom’s visie rond Model as a Service.
Het IT-departement kan modellen intern aanbieden als een service. Ontwikkelaars kunnen gebruik maken van inference endpoints, terwijl de organisatie controle houdt over welke modellen en hardware worden ingezet.
Een centrale catalogus voor het uitrollen en beheren van modellen en RAG (Retrieval-Augmented Generation)-workflows over VM’s, containers en GPU-resources wordt eveneens voorzien.
VCF biedt daarnaast uitgebreide observatiemogelijkheden voor token-prestaties, latency en gebruik van compute en geheugen.
Deze metrics zijn essentieel om inzicht te krijgen in de werkelijke kosten van AI-toepassingen op grote schaal, een aspect dat vaak onderbelicht blijft in de eerste adoptiefase.
Een AI Gateway voor lokaal en extern modellenbeheer
Broadcom ontwikkelt ook een AI Gateway.
Deze zal een uniforme interface bieden voor het gebruik en beheer van modellen, zowel binnen de infrastructuur als in externe services.
De gateway regelt onder andere slimme modelkeuze, gebruiksbeperkingen, tokenbeheer en application autorisatie.
In scenario’s met veel modellen kan deze laag van groot belang zijn, doordat het beleid centraal wordt toegepast.
Eenvoudige toepassingen kunnen kiezen voor kleine, goedkope modellen, terwijl complexere queries worden doorgestuurd naar krachtiger modellen.
Gegevens kunnen lokaal worden verwerkt, terwijl andere requests via externe modellen afgehandeld worden.
De gateway wordt daarmee het centrale punt waar deze beleidsregels en het beheer van resources worden geregeld.
Daarnaast levert het een abstractielaag voor ontwikkelaars, zodat applicaties kunnen blijven werken met een stabiele interface, zelfs als underlying modellen wisselen.
Deze aanpak wordt steeds relevanter omdat modellen snel evolueren. Een lange-termijn koppeling aan één specifieke LLM wordt minder aantrekkelijk wanneer er regelmatig nieuwe alternatieven verschijnen.
Agents die code genereren: een geïsoleerde zone vereist
VMware AI Factory anticipeert op een ander risico: agents die code schrijven en uitvoeren.
Een chatbot die foute antwoorden geeft, is al problematisch; maar een agent die code produceert en uitvoert, kan directe gevolgen hebben voor de infrastructuur.
Broadcom ontwikkelt Secure AI Sandboxes, virtuele geïsoleerde ruimtes waarin dynamisch gegenereerde code veilig kan worden uitgevoerd.
Daarnaast is er een governance-laag die bepaalt hoe agenten worden aangeroepen, welke tools ze kunnen gebruiken en hoe hun resultaten worden gevalideerd vóór uitvoering.
Deze functies worden aangekondigd als toekomstige mogelijkheden en zijn niet direct beschikbaar bij lancering.
Virtualisatie krijgt hier een nieuwe toepassing.
Traditioneel werd virtualisatie vooral ingezet om meerdere besturingssystemen en toepassingen te isoleren. Bij AI-agenten ontstaan nieuwe eisen: het creëren van tijdelijke omgevingen voor het uitvoeren van potentieel onvoorspelbare code, zonder directe toegang tot de rest van de infrastructuur.
AMD Instinct en ROCm versterken diverse AI-hardwareopties
Een van de meest interessante technische aankondigingen is de samenwerking met AMD.
Broadcom werkt aan een configuratie van VMware AI Factory die VCF combineert met AMD Instinct GPU’s en de open-source ROCm-omgeving.
Het automatisch provisioningproces omvat vSphere, vSAN, Kubernetes en de AMD GPU-operator.
Broadcom noemt ook AMD DVX, dat GPU’s aan grote virtuele machines kan koppelen die later door vSphere Kubernetes Workloads worden gebruikt.
Deze samenwerking biedt alternatieven voor bedrijven die niet willen bouwen rond één enkele leverancier van accelerators.
VMware AI Factory maakt gebruik van gecertificeerde Dell PowerEdge-servers en AI ReadyNodes van fabrikanten zoals Cisco, Lenovo en Supermicro.
De kern van Broadcom’s voorstel is het leveren van een uniforme operationele laag over verschillende hardwareconfiguraties.
De mate waarin deze abstractie een consistente ervaring biedt, hangt af van factoren zoals compatibiliteit van bibliotheken, kernels en runtimes, die mede bepalen welke GPU het meest geschikt is.
Meer dan 150 modellen in de private cloud
VMware AI Factory sluit direct aan bij een ander Broadcom-initiatief dat werd gepresenteerd op VMware Explore 2026.
Het bedrijf stelt dat VCF meer dan 150 open en commerciële modellen kan draaien en dat er specifieke validaties zijn gedaan voor onder andere NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Qwen van Alibaba en GLM 5.2 van Z.ai.
Hiermee wordt de AI-fabriek niet gelimiteerd tot een Kubernetes-omgeving voor GPU, maar kan deze ook functionele modellen leveren aan interne gebruikers.
Broadcom wil dat organisaties servers kunnen voorbereiden, het platform kunnen uitrollen, GPU’s kunnen inzetten, modellen kunnen selecteren en inferentie kunnen uitvoeren vanuit één enkele operationele omgeving.
Daarnaast blijft de mogelijkheid bestaan om later van model te wisselen zonder de gehele infrastructuur opnieuw op te bouwen.
Deze scheiding tussen infrastructuur, runtime en model kan vooral belangrijk worden voor bedrijven die hun platform langer willen gebruiken dan de levensduur van een specifieke LLM-versie.
De token-economie centraal in het datacenter
Broadcom benadrukt vooral de rol van token-economie, omdat de vergelijking tussen publieke en private AI meer vereist dan alleen GPU-prijzen.
Een commerciële API maakt infrastructuurkosten inzichtelijk als een vast bedrag per miljoen verwerkte tokens.
In een eigen datacenter wordt het kostenplaatje verdeeld over meerdere posten.
Ze moeten servers en accelerators afschrijven, energie en koeling betalen, opslag en netwerken onderhouden en personeel inzetten. In ruil daarvoor kan een GPU die goed wordt benut tokens blijven produceren zonder dat een aparte vergoeding per model wordt geheven.
VMware AI Factory streeft ernaar om metrics te bieden die de verhouding tussen tokens gegenereerd en resources verbruikt inzichtelijk maken.
Het gedeelde belang van GPU- en modeldeling ligt hierin dat extra hardware niet altijd leidt tot economische voordelen wanneer deze vooral wacht op werk.
Een infrastructuur met minder accelerators maar hogere benutting kan kostenefficiënter zijn dan een grote, versnipperde setup.
De keuze hoeft niet zwart-wit te zijn: een hybride model met bepaalde modellen intern en anderen extern kan veel flexibiliteit bieden.
De AI Gateway speelt hier ook een rol door clusters van modellen en workloads te beheren op basis van kosten, gevoeligheid voor data, benodigde capaciteit en beschikbaarheid.
Broadcom’s VMware AI Factory illustreert een belangrijke evolutie in wat zij onder private cloud verstaan. Het verschuift van enkel virtuele machines en containers naar een platform waarin GPU’s, modellen, tokens en agenten beheersbare resources worden.
Wanneer bedrijfs-AI zich ontwikkelt via een combinatie van lokale en externe modellen, kan het voordeel meer liggen in de flexibiliteit en gemak van switchen dan in het aanbieden van één specifiek model.
Veelgestelde vragen
Wat is VMware AI Factory?
Een platform geïntroduceerd door Broadcom op basis van VMware Cloud Foundation dat het automatiseren van de uitrol en het beheer van private infrastructuur voor artificial intelligence mogelijk maakt, van fysieke servers tot inferentiediensten.
Kan VMware AI Factory gebruik maken van AMD GPU’s?
Ja. Broadcom werkt samen met AMD om VCF te integreren met AMD Instinct accelerators en de open-source ROCm-omgeving, inclusief de automatisering van de benodigde componenten.
Wat betekent AI tokenomics voor Broadcom?
Het verwijst naar het analyseren en beheersen van de kosten van inferentie, gebaseerd op tokens, GPU-gebruik, geheugen en andere resources. Het sluit niet uit dat een private cloud niet altijd goedkoper is dan het gebruik van een externe API.
Welke modellen ondersteunt VMware AI Factory?
Broadcom beweert dat VCF meer dan 150 modellen kan draaien. Onder andere worden NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Qwen van Alibaba en GLM 5.2 van Z.ai genoemd als gevalideerde families.
