Broadcom heeft de AI-capaciteiten van VMware Cloud Foundation (VCF) uitgebreid met validatie van diverse modellen van NVIDIA, Google DeepMind, NEC, Alibaba Cloud en Z.ai, voor uitvoering op privé-infrastructuur. Het aangekondigd tijdens VMware Explore 2026, stelt dit bedrijven in staat om inferentie en modellen als service aan te bieden vanuit hun eigen datacenters of private clouds, met meer controle over data, infrastructuur en kosten.
De kernpunten van VMware’s private AI in 20 seconden
- VCF valideert modellen van NVIDIA, Google DeepMind, NEC, Alibaba Cloud en Z.ai.
- Hieronder vallen Nemotron 3, Gemma 4, cotomi, Qwen3.8-27B en GLM 5.2.
- vLLM stelt bedrijven in staat meer dan 150 open modellen te draaien, aldus Broadcom.
- VCF ondersteunt infrastructuur gebaseerd op AMD, Intel en NVIDIA.
- Het doel is om inferentie en AI-agenten in privéomgevingen te brengen.
Dit nieuws onderstreept een trend die de volgende fase van bedrijfsmatige AI vormt. Na vooral geëxperimenteerd te hebben via API’s en publieke diensten, onderzoeken organisaties nu welke workloads het de moeite waard zijn om binnen eigen infrastructuur uit te voeren.
Broadcom benadrukt in haar Private Cloud Outlook 2026 dat 56% van de ondervraagde bedrijven al inferentie van AI in productie op private clouds draait of plant te doen. Dit cijfer, afkomstig uit een onderzoek van het bedrijf zelf, geeft inzicht in de richting die VMware Cloud Foundation opgaat.
Het doel van VCF is dat traditionele virtuele machines, Kubernetes, applicaties met agents en model-inference gedeeld gebruik kunnen maken van één en hetzelfde infrastructuurobject.
Vijf families van goedgekeurde modellen voor VCF
De meest concrete vernieuwing is de validatie van diverse modellen voor gebruik op VMware Cloud Foundation.
Broadcom heeft validatie bekendgemaakt voor NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Alibaba Qwen3.8-27B en Z.ai GLM 5.2.
Niet alle modellen dienen dezelfde behoefte.
Nemotron 3 is vooral gericht op agentgebaseerde toepassingen en combineert, volgens Broadcom, een hybride Mamba-Transformer-architectuur met Mixture of Experts (MoE), multimodale capaciteiten en een contextvenster tot wel een miljoen tokens.
Gemma 4 vertegenwoordigt de open source familie van Google DeepMind. Broadcom benadrukt de multimodale aard en gebruik voor het ontwikkelen van applicaties en agents die lokaal kunnen draaien.
De aanwezigheid van cotomi, ontwikkeld door NEC, biedt een andere invalshoek. Dit model is specifiek ontworpen voor Japans en zakelijke toepassingen in dat marktsegment. NEC beweert dat cotomi een efficiëntieverbetering van 40% in tokens biedt.
Alibaba levert Qwen3.8-27B, een dicht getailleerd multimodaal model met 27 miljard parameters, gericht op programmeren, onderzoek, professionele taken en langdurige agentschappen.
Tot slot heeft GLM 5.2 van Z.ai, voorheen Zhipu AI, als focus redeneren, programmeren en autonome, meerstaps processen.
| Model | Leverancier | Belangrijkste kenmerken volgens Broadcom |
|---|---|---|
| Nemotron 3 | NVIDIA | Agents, multimodaliteit en lange contexten |
| Gemma 4 | Google DeepMind | Lokale AI, multimodaliteit en agents |
| cotomi | NEC | Japans en zakelijke toepassingen |
| Qwen3.8-27B | Alibaba Cloud / Qwen | Coden, visie, onderzoek en agents |
| GLM 5.2 | Z.ai | Redeneren, code en autonome workflows |
Het valideren betekent niet dat deze modellen per se VMware nodig hebben om te functioneren. Ze kunnen ook op andere infrastructuren en met andere tools worden ingezet. Broadcom biedt een gevalideerde omgeving om ze binnen VCF te integreren en te beheren naast andere bedrijfsbelastingen.
vLLM breidt catalogus uit naar meer dan vijf modellen
De aangekondigde lijst vormt ook geen limiet voor het aantal modellen dat ingezet kan worden.
VMware Cloud Foundation gebruikt vLLM als standaard runtime voor modelhosting, waardoor Broadcom beweert dat klanten meer dan 150 open modellen kunnen draaien.
vLLM is populair geworden omdat het technieken bevat voor efficiënt beheer van geheugen, gelijktijdigheid en token-generatie bij het draaien van grote taalmodellen.
Het voorkomen van afhankelijkheid van een beperkt aantal modellen is belangrijk in een omgeving waar de infrastructuur niet beperkt hoeft te worden tot een enkele catalogus.
Bedrijven kunnen bijvoorbeeld een specifiek gevalideerd model inzetten voor bepaalde toepassingen, terwijl ze andere modellen die compatibel zijn met vLLM voor andere projecten gebruiken.
De keuze hangt ook af van het beschikbare hardware-aanbod.
Broadcom benadrukt dat VCF ondersteunt voor gevarieerde configuraties met AMD, Intel en NVIDIA, waardoor de strategie niet beperkt is tot één soort processor voor alle workloads.
Dit is relevant in datacenters met bestaande investeringen, waar organisaties AI geleidelijk willen toevoegen zonder compleet nieuwe platformen te bouwen.
Privé-inferentie wint aan terrein boven trainen
De aankondiging richt zich vooral op inferentie, niet op het trainen van nieuwe foundation-modellen van nul af aan.
Deze scheiding is belangrijk.
Het trainen van grote modellen kan duizenden of tienduizenden accelerators vereisen gedurende lange periodes. Dit is buiten het bereik van de meeste organisaties.
Het uitvoeren van een reeds getraind model voor interne verzoeken brengt een andere economische aanpak met zich mee.
Organisaties kunnen het bijvoorbeeld gebruiken voor bedrijfsassistenten, documentzoeking, codegeneratie, data-analyse of gekoppelde agents.
Wanneer het volume van de vragen stabiel genoeg is, kan het inzetten van inferentie op eigen infrastructuur een alternatief worden voor doorlopende cloudkosten voor tokens.
Dit betekent niet automatisch dat een private cloud goedkoper is.
Kosten voor GPU’s, servers, energie, koeling, opslag, licenties, personeel en hardware-innovatie spelen allemaal een rol. Een onderbenutte GPU betekent dat het gebruik van een externe API vaak goedkoper kan zijn.
Daarom introduceert Broadcom de term AI tokenomics: het analyseren van de werkelijke kosten van het genereren en verbruiken van tokens, afhankelijk van waar het model draait.
De keuze wordt steeds meer een afweging tussen de kosten voor infrastructuur, variërend van cloud tot on-premise, en de controle over data en privacy.
Data als argument voor AI binnen bedrijven
Kosten zijn slechts één factor in de besluitvorming.
Data privacy en governance vormen ook belangrijke redenen om te kiezen voor private AI.
Een bedrijfsmatig agent is nuttiger als hij kan beschikken over interne documentatie, kennisbases, applicaties, code of klantgegevens. Dies zijn juist de data die moeilijk te exporteren of te delen kunnen zijn.
Door het model binnen eigen infrastructuur te draaien, kunnen organisaties het overzicht houden overwaar de gegevens circuleren en blijven.
Dat betekent niet automatisch dat een lokale inzet veilig of compliant is. Beveiliging hangt af van identiteit, toegang, segmentatie, systeemconfiguraties en maatregelen rondom prompts, logs en vector databases.
Toch geeft het draaien van het model binnen dezelfde omgeving meer opties om dataverkeer te beheren en waar mogelijk te beperken.
Broadcom koppelt deze mogelijkheid aan data-soevereiniteit en reguleringsverplichtingen, vooral in sectoren met strenge regelgeving.
VMware wil modellen als interne service aanbieden
Een ander aspect van de aankondiging is het concept van Model as a Service.
Het idee is dat afdelingen niet zelf servers hoeven te bouwen en te onderhouden voor inferentie, maar dat de infrastructuur dat centraal regelt.
Het infrastructuurbestand kan meerdere modellen op VMware Cloud Foundation hosten en deze beschikbaar maken als interne diensten voor ontwikkelaars en teams.
Zo kan een team Gemma gebruiken voor een toepassing, een ander Nemotron voor agents, en weer een ander een speciaal model, terwijl de centrale infrastructuur wordt beheerd.
Dit is vergelijkbaar met de ontwikkeling van Kubernetes voor bedrijfsapplicaties: een platform dat hardwarecomplexiteit verlicht en resources op aanvraag biedt.
In AI is er een bijkomend probleem: GPU’s zijn kostbaar en schaars. Een betere benutting kan direct kosten besparen.
Broadcom citeert resultaten met MLPerf Inference v5.1 om te bewijzen dat VCF vergelijkbare prestaties kan leveren als bare-metal systemen in bepaalde scenario’s. Het is belangrijk te realiseren dat dit afhankelijk is van de configuraties en niet garandeert dat virtualisatie in alle gevallen hetzelfde rendement oplevert.
Privé-cloud als platform voor AI
Broadcom’s strategie met VCF beweegt zich verder dan de bestaande virtuele toepassingen.
Het doel is om VMware Cloud Foundation te transformeren tot een platform waar traditionele infrastructuur en AI-workloads samen bestaan.
Voor veel organisaties is deze combinatie aantrekkelijker dan het bouwen van helemaal nieuwe, geïsoleerde AI-omgevingen.
Virtuele machines verdwijnen niet door de introductie van AI-agenten, en ook databases, Java-applicaties, Windows systemen of Kubernetes-platformen blijven bestaan.
De vraag is of de bestaande infrastructuur in staat is om modellen, GPU’s en nieuwe inferentiediensten te integreren zonder een nieuwe silo te creëren.
De validatie van Nemotron, Gemma, cotomi, Qwen en GLM heeft als doel om aan die behoefte te voldoen.
Bovendien is de diversiteit van aanbieders belangrijk: Broadcom richt zich niet op een één-model cloud. Het biedt een flexibele laag zodat bedrijven van model kunnen wisselen naarmate de markt evolueert.
In een wereld waarin modellen snel veranderen en nieuwe versies verschijnen, kan het vermijden van afhankelijkheid van één model net zo belangrijk zijn als het kiezen van het beste model op dat moment.
VMware Cloud Foundation probeert die tussenlaag te vormen: onderaan servers, CPU’s en GPU’s; erboven modellen en applicaties; en daartussen een private platform dat resources, Kubernetes en virtualisatie beheert.
Het VMware Explore 2026 voorstel laat zien dat AI zich meer en meer manifesteert in het traditionele bedrijfsmatige datacenter, waarbij de discussie niet alleen gaat over welk model te gebruiken, maar ook over waar te draaien, wat de kosten per token zijn en welke data het cannot de organisatie verlaten.
Veelgestelde vragen
Welke AI-modellen heeft Broadcom gevalideerd voor VMware Cloud Foundation?
Broadcom heeft NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Qwen3.8-27B van Alibaba en GLM 5.2 van Z.ai gevalideerd.
Beperkt VCF zich tot deze vijf modellen?
Nee. Broadcom gebruikt vLLM als standaard runtime en beweert dat VMware Cloud Foundation meer dan 150 open modellen kan draaien.
Wat is het nut van AI-modellen draaien op een privécloud?
Het biedt meer controle over infrastructuur en datastromen en is interessant voor stabiele inferentielasten. De economische haalbaarheid hangt af van kosten hardware, gebruik, energie, beheer en alternatieven via externe diensten.
Heeft VCF alleen NVIDIA GPU’s nodig?
Nee. Broadcom geeft aan dat VCF ook ondersteuning biedt voor systemen met AMD, Intel en NVIDIA, afhankelijk van de configuratie en het model.
