Wat te kopen om in september 2026 lokaal LLM uit te voeren

De hardwarekeuze voor het lokaal uitvoeren van large language models (LLM) is sinds de lente sterk geëvolueerd. De RTX 5090 blijft een voorbeeld van enorme bandbreedte binnen één GPU, maar in Spanje kost deze kaart inmiddels meer dan 5.000 euro. Tegelijkertijd zijn systemen met 128 GB gedeeld geheugen steeds gangbaarder: de DGX Spark kost €4.800, de Mac Studio M5 Max bereikt 128 GB en de M5 Ultra zelfs 512 GB, terwijl AMD en Lenovo hun aanbod van mini-PC’s voor grote modellen uitbreiden.

De sleutels tot hardware voor lokale LLMs in 30 seconden

  • De RTX 5090 behoudt 32 GB GDDR7 en 1.792 GB/s, maar de modellen die in Spanje verkrijgbaar zijn, beginnen bij circa 5.299 euro.
  • DGX Spark biedt 128 GB gedeeld geheugen en CUDA voor ongeveer €4.800.
  • De Mac Studio M5 Max komt op 128 GB en 614 GB/s; de M5 Ultra bereikt 512 GB en 1,2 TB/s.
  • AMD beschikt al over Ryzen AI Max+ 395 systemen met 128 GB en werkt aan platforms van 192 GB.
  • In november lanceert Lenovo de ThinkCentre X Ultra met maximaal 128 GB, met een geschatte prijs vanaf circa €3.100.
  • Voor grootschalige training kan de B200 in de cloud gevonden worden vanaf zo’n €4,7 per uur bij bepaalde Europese aanbieders.

De grootste verandering sinds de gids van april is niet alleen te vinden in processors. Geheugen is uitgegroeid tot de factor die de prijs van lokale AI het meest bepaalt. Schaarste aan hoogwaardig geheugen heeft de kosten van grote GPU’s en systemen met gedeeld geheugen opgedreven, waardoor de rekensommen die enkele maanden geleden bepaalde configuraties voordeliger maakten, zijn veranderd.

Daarnaast is de software verder gevorderd. Unsloth ondersteunt nu het uitvoeren en trainen van modellen op macOS, Windows en Linux, met NVIDIA, AMD en andere backends. AMD heeft de ROCm-ondersteuning voor Ryzen AI Max+ verbeterd, terwijl Apple MLX uitbreidt voor training en distributie over meerdere systemen.

Koopgids voor september 2026

De prijzen hieronder zijn gebaseerd op observaties in Europa en Spanje in september 2026. Vooral bij NVIDIA kunnen de adviesprijzen en daadwerkelijke prijzen sterk verschillen.

ApparaatGeheugenBandbreedte (bij benadering)Indicatieprijs in euroFocus
RTX 509032 GB GDDR71.792 GB/svanaf ca. €5.299Maximale snelheid, klein model
Framework Desktop Max+ 395128 GBLPDDR5X-8000ca. €3.889x86-capaciteit
GMKtec EVO-X3 Max+ 395128 GBLPDDR5X-8000€3.499,99High-capacity mini-PC
DGX Spark128 GB273 GB/s€4.800CUDA + gedeeld geheugen
Mac Studio M5 Max128 GBtot 614 GB/s€5.859Inferentie + MLX
Mac Studio M5 Ultra256 GB1,2 TB/s€10.999Zeer grote modellen
Lenovo ThinkCentre X Ultratot 128 GBLPDDR5X-8533prijs vanaf circa €3.100 (verwacht)Nieuwe AMD-platform
RTX PRO 6000 Blackwell96 GB GDDR7 ECC1.792 GB/sca. €13.000 of meerProfessionele CUDA
B200 in de cloud180-192 GB HBMtot 8 TB/svanaf ca. €4,7/uTraining en grote modellen

De RTX 5090 is het ultieme voorbeeld. NVIDIA houdt 32 GB GDDR7 en 1.792 GB/s vast, maar de prijzen in Spanje, verzameld door Idealo, starten bij €5.299, met vele varianten boven de €5.400 en sommige ruim boven de €7.000.

Het grote prijsverschil tussen het officiële advies en de daadwerkelijke marktprijs maakt dat je niet meer zomaar op de adviesprijs van de kaart moet vertrouwen bij het berekenen van de kosten van een werkstation. Daarbovenop komen nog de kosten voor processor, moederbord, systeemgeheugen, opslag, voeding en koeling.

De DGX Spark wordt echter als compleet systeem verkocht. NVIDIA bepaalt momenteel de Europese prijs op €4.800, met 128 GB gedeeld geheugen, 4 TB NVMe opslag en de krachtige GB10 Grace Blackwell-chip.

Tot 30 miljard parameters: waarom de RTX 5090 nog steeds interessant is

De eerste regel uit de april gids blijft geldig: als het model in het geheugen van de GPU past, is bandbreedte extreem belangrijk.

De RTX 5090 beschikt over 32 GB en 1.792 GB/s bandbreedte. Zo kunnen genormaliseerde, middelgrote modellen draaien op een snelheid die langzamere gedeelde geheugen-systemen niet kunnen evenaren. NVIDIA bevestigt 21.760 CUDA-kernen en een totaal grafisch vermogen van 575 W.

Voor compacte modellen met ongeveer 20.000-30.000 miljard parameters, zeker in 4-bits quantisatie, blijft de 5090 zeer snel. Problemen ontstaan wanneer het model, de KV-cache en de context dicht bij de 32 GB komen te zitten.

MoE (Mixture of Experts) modellen maken de vergelijking lastiger. Een model kan tientallen tot honderden miljarden parameters hebben, maar slechts een deel wordt activëerd per token. Een groot MoE-model is daardoor soms beter te draaien op een machine met 32 GB dan een kleiner, volledig dens model.

Het draait niet alleen om of de gewichten passen. Men moet ook geheugen reserveren voor de context, KV-cache, runtime en tijdelijke operaties.

Met de huidige prijzen wordt de RTX 5090 economisch onpraktisch. Een kaart van meer dan €5.000 kopen en een pc eromheen bouwen, brengt de totale kosten vaak veel hoger uit dan een volledige machine met 128 GB geheugen.

128 GB: het snelst groeiende segment

AMD’s Ryzen AI Max+ 395 systemen maken 128 GB gedeeld geheugen toegankelijk en betaalbaar.

Framework biedt een desktop met Ryzen AI Max+ 395 en 128 GB LPDDR5X-8000. De platformreservatie kan tot 96 GB voor GPU gebruiken, afhankelijk van de configuratie, en draait op Windows of Linux.

De Europese richtprijs voor de 128 GB-configuratie ligt rond de €3.889, met afhankelijkheid van opslag en configuratie.

Ook systemen zoals de GMKtec EVO-X3, met Ryzen AI Max+ 395, 128 GB LPDDR5X en 4 TB opslag, worden aangeboden voor €3.499,99 in Spanje.

AMD breidt de platformen verder uit. De nieuwe Ryzen AI Max+ PRO 495, gebaseerd op Gorgon Halo, ondersteunt tot 192 GB LPDDR5X-8533 en gebruikt een Radeon 8065S met 40 compute units. AMD noemt een NPU tot 55 TOPS, wat vele malen hoger is dan de huidige Ryzen AI Max+ 395.

Hiermee ontstaat een nieuwe categorie mini-PC’s die models kunnen draaien met ruim 100 miljard parameters, zonder meerdere GPU’s te gebruiken. Een jaar geleden was dit nog zeldzaam.

AMD heeft zelfs een gids gepubliceerd voor het draaien van modellen tot een biljoen parameters, verspreid over meerdere systemen met Ryzen AI Max+, gebruikmakend van llama.cpp en gekoppelde machines. Het is meer een demonstratie van capaciteit dan een praktische oplossing voor interactief gebruik op grote schaal.

DGX Spark: 128 GB en CUDA op je bureau

DGX Spark neemt een aparte positie in.

Het biedt 128 GB gedeeld geheugen samen met het CUDA-ecosysteem. NVIDIA noemt 273 GB/s bandbreedte, 128 GB coherent geheugen, 1 PFLOP FP4-prestaties en 4 TB NVMe opslag in het huidige model.

Het kan niet tippen aan de 1.792 GB/s bandbreedte van de RTX 5090. Het moet dus niet worden gezien als een “RTX 5090 met 128 GB”.

De meerwaarde ligt in modellen die niet passen op een gewone GPU en die binnen het NVIDIA-ecosysteem moeten blijven.

Ook het training-gedeelte heeft verbeteringen ondergaan. NVIDIA biedt documentatie voor het gebruik van Unsloth op DGX Spark, inclusief CUDA, PyTorch en optimalisatietools.

Met een prijs van €4.800 wordt de DGX Spark vooral interessant ten opzichte van een Mac Studio M5 Max.

Apple M5 Max: gedeeld geheugen, maar niet minder snel

Apple heeft met de nieuwe Mac Studio de situatie flink veranderd.

De M5 Max kan tot 128 GB gedeeld geheugen configureren. Bij de GPU-versie met 40 kernen bedraagt de bandbreedte 614 GB/s, terwijl het basismodel rond de 460 GB/s zit.

De 128 GB+512 GB SSD-configuratie kost volgens de Europese publicatie €5.859.

Dit plaatst de M5 Max in een opvallende positie: prijsverschil met een smallere Ryzen AI Max+ setup is aanzienlijk, maar de bandbreedte is meer dan het dubbele van die van de DGX Spark en gelijksoortige systemen.

Voor MLX-gebruikers, die werken met llama.cpp en optimalisaties voor Apple Silicon, kan dat verschil belangrijk zijn. Apple ontwikkelt ook methoden om training te verspreiden via MLX over meerdere systemen. Tijdens WWDC26 toonde Apple een training van Qwen 3.5 met 9 miljard parameters, dat van circa 180 tokens/sec op één machine ging naar ongeveer 600 tokens/sec in een cluster.

Dit betekent niet dat een Mac-cluster een volwaardige vervanger is voor een NVIDIA-systeem, maar het illustreert dat gedeeld geheugen over meerdere Mac’s schaalbaar is.

M5 Ultra: 256 GB voor €10.999 en 512 GB in oktober

De M5 Ultra doorbreekt de geheugenlimiet significant.

Apple biedt tot 512 GB gedeeld geheugen en 1,2 TB/s bandbreedte. De 256 GB-configuratie kost momenteel €10.999, en de 512 GB-versie verschijnt eind oktober.

Met 256 GB kan men modellen aan die anders volledig buiten bereik liggen van een RTX 5090 met 32 GB of een 128GB-systeem.

De 1,2 TB/s bandbreedte is eveneens cruciaal. Hoewel de M5 Ultra niet de geheugenbandbreedte van een RTX 5090 bereikt, komt deze er veel dichterbij dan Strix Halo of DGX Spark, terwijl de capaciteit acht keer groter is dan een NVIDIA GPU.

Voor ged Quantized grote modellen verandert deze combinatie de vraag niet langer in “past het?” maar in “welke snelheid haal ik zodra het past?”.

Lenovo betreedt de markt voor 128 GB geheugen

Een nieuwe speler die niet in de april gids stond, is Lenovo.

De fabrikant introduceert de ThinkCentre X Ultra, een mini-PC van 1,6 liter gebaseerd op Ryzen AI Max+ PRO 495. Hij kan tot 128 GB LPDDR5X-8533 ondersteunen en tot 96 GB toewijzen aan de geïntegreerde Radeon 8065S. Lenovo bereidt ook configuraties voor waarbij meerdere systemen worden gekoppeld voor meer geheugen en rekenkracht.

De lanceringsdatum is gepland voor november 2026, met een startprijs van circa €3.100. De genoemde prijs is slechts een indicatie; de feitelijke configuratie met 128 GB kan hoger uitvallen.

De platformondersteuning omvat zowel Windows als Linux, met twee M.2-sleuven voor opslag. Het bewijst dat 128 GB gedeeld geheugen niet meer exclusief is voor Apple of zeer gespecialiseerde systemen.

RTX PRO 6000: 96 GB VRAM, prijs stijgt de pan uit

Voor wie CUDA en veel geheugen zoekt zonder een server te hoeven aanschaffen, blijft de RTX PRO 6000 Blackwell Workstation Edition relevant.

Ze heeft 96 GB GDDR7 ECC en 1.792 GB/s bandwidth, hetzelfde bandbreedtebereik als de RTX 5090, maar met drie keer zoveel geheugen. NVIDIA richt zich op professionele werkstations en AI-belastingen.

Het probleem is de prijs. In augustus zijn Amerikaanse prijzen voor deze kaart gestegen tot $16.000, en in Europa worden prijzen rond €13.000 of meer waargenomen bij bepaalde distributeurs.

Op dit prijsniveau is het geen consumentenkaart meer. Het is een investering voor werkstations waar 96 GB geheugen en CUDA permanente vereisten zijn.

Voor bedrijven die modellen continu willen delen en meerdere gebruikers bedienen, kunnen de extra kosten gerechtvaardigd zijn. Voor individuele ontwikkelaars die af en toe trainen, wordt het kostenplaatje anders: de investering wordt heel anders.

Training: hier ligt het anders

De grootste verandering sinds april is dat de software voor lokaal gebruik aanzienlijk is uitgebreid.

Unsloth ondersteunt nu macOS, Windows en Linux, en beweert compatibel met NVIDIA, AMD, Intel, CPU en Vulkan. Ook wordt ondersteuning geboden voor LoRA, QLoRA, SFT, RL, GRPO en DPO.

Dat betekent niet dat alle platformen gelijk presteren of dat alle methoden overal even goed werken. CUDA blijft echter de leidende ecosystem voor training en onderzoekstools.

Apple Silicon mag niet meer enkel worden gezien als inferentieplatform. MLX maakt LoRA en QLoRA mogelijk, en Apple toont voorbeelden van gedistribueerde training, bijvoorbeeld met Qwen 3.5 van 9 miljard parameters, dat in een cluster flink sneller trainde dan op een enkele Mac.

AMD verbetert ook zijn positie. ROCm biedt documentatie voor llama.cpp en AMD ontwikkelt tools voor het gebruiken van Ryzen AI Max+ met ROCm.

Voor SFT van kleine en middelgrote modellen behoudt een RTX 5090 een zeer goede prestatie- en compatibiliteitsratio. Bij modellen die ruim boven de geheugenlimiet liggen, draait het niet meer om rekenkracht, maar om beschikbare geheugenruimte.

Voor grote training blijft de cloud voor veel toepassingen economisch het gunstigst.

B200: wanneer stoppen met hardware kopen

De B200 beschikt over 180-192 GB HBM3e geheugen, afhankelijk van het platform, en een bandbreedte van circa 8 TB/s. Dit is compleet ander segment dan desktopsystemen.

In september 2026 kost een enkele B200 in de cloud ongeveer €4,7 per GPU per uur bij sommige Europese providers, met andere aanbiedingen tussen de €5,4 en €6 per uur. Prijzen variëren per aanbieder, regio en beschikbaarheid.

Er bestaan ook veel duurdere B200-instanties, zoals de HGX van CoreWeave in Spanje, die ongeveer €59,93 per uur kosten voor acht GPU’s, en onder spotgebruikt zelfs rond de €30 per uur.

De eenvoudige conclusie is: de cloud laat je alleen betalen voor de reële training of inferentie, zonder hoge aanschafkosten.

Een werkproces van vier uur met een B200 à €5 per uur kost circa €20. Maar een maand 24/7 draaien kost meer dan €3.600 in hardwarekosten. Daarom is het voor veel projecten het beste om data, code en parameters lokaal klaar te maken en de GPU in de cloud alleen te gebruiken wanneer dat echt nodig is.

Praktische tabel voor 2026

WensGeschikte hardwarePrijs indicatie
Tot ~30B modellen, maximale snelheidRTX 5090vanaf €5.299
70B met budget, betaalbaarRyzen AI Max+ 395, 128 GB€3.500-€3.900
70B+ met CUDADGX Spark, 128 GB€4.800
70B, meer bandwidthMac Studio M5 Max, 128 GB€5.859
Over 100B modellenM5 Max 128 GB / M5 Ultra 256 GBvanaf €5.859
200B+ modellenM5 Ultra 256/512 GBvanaf €10.999
70B+ professioneel met CUDARTX PRO 6000, 96 GBca. €13.000 of meer
Groot training of gigantische modellenB200 in de cloudvanaf ca. €4,7/u

De kernconclusie van deze update is dat er niet één universele oplossing is voor alle lokale LLM’s.

De RTX 5090 blijft een topkeuze voor maximale bandbreedte wanneer het model in 32 GB past. Maar door de hoge prijzen in Spanje wordt de aankoop een veel complexere keuze. Ryzen AI Max+ systemen bieden veel geheugen voor minder geld, zij het met minder bandbreedte. DGX Spark voegt CUDA toe, terwijl M5 Max en Ultra grote geheugen- en bandbreedtevolwassen oplossingen bieden.

Tegelijkertijd brengen AMD en Lenovo systemen van 128 tot 192 GB binnen bereik van meer betaalbare formaten, terwijl de software de verschillen tussen platformen verkleint.

De keuze hangt af van het model dat je wilt draaien, de quantisatie, de contextgrootte en of je training nodig hebt of enkel inferentie. Bereken eerst de benodigde geheugenruimte; daarna de bandbreedte; en vergelijk daarna de prijzen.

Voor een model dat in 32 GB past, kost het kopen van 128 GB onnodig geld. Bij modellen met 120 miljard parameters is een RTX 5090 compleet uitgesloten door geheugenlimiet, zelfs als die sneller is.

Wanneer de taak meer dan 180 GB geheugen vereist, meerdere GPU’s of gedistribueerde training, wordt de vraag niet meer: “Welke machine?” maar “Hoeveel uur is deze machine nodig voor mijn werk?”

Veelgestelde vragen

Wat is de snelste GPU voor het draaien van LLM’s lokaal?

De RTX 5090 biedt 1.792 GB/s bandbreedte en 32 GB GDDR7, waardoor hij bijzonder geschikt is voor modellen die volledig in het geheugen passen.

Welke computer biedt het meeste geheugen voor lokale AI?

De Mac Studio M5 Ultra kan tot 512 GB gedeeld geheugen configureren, met een bandbreedte van 1,2 TB/s. De prijs voor 256 GB bedraagt €10.999, de 512 GB-variant komt eind oktober.

Hoeveel kost een DGX Spark in Europa?

NVIDIA verkoopt momenteel DGX Spark voor €4.800, met 128 GB gedeeld geheugen en 4 TB NVMe opslag.

Is NVIDIA noodzakelijk voor training?

Niet per se. In september 2026 zijn er tools voor training op Apple Silicon via MLX en ondersteuning voor AMD-systemen, naast multiplatform software zoals Unsloth. CUDA blijft echter dominant voor training en onderzoekstoepassingen.

Scroll naar boven