De NPU (Neural Processing Unit) zijn niet langer een curiositeit exclusief voor mobiele apparaten. Ze beginnen nu hun plaats te vinden in het standaard hardware van laptops en desktops. Qualcomm behaalt inmiddels 80 TOPS met Snapdragon X2, AMD ligt rond de 50-55 TOPS in Ryzen AI, Intel bereikt 50 TOPS met Core Ultra Series 3, en Apple integreert al jaren haar Neural Engine. Echter, het bezit van een NPU betekent niet dat een GPU overbodig is: beide accelerators lossen verschillende problemen op, en voor een ontwikkelaar hangt de juiste keuze meer af van het model en de software dan van een enkele TOPS-cijfers.
De kern van NPU versus GPU in 20 seconden
- Een NPU is vooral ontworpen voor lokaal AI-uitvoering met laag energieverbruik.
- De GPU blijft veel flexibeler en is meestal voorkeursapparatuur voor zwaar trainen en inferentie.
- De Copilot+ PC’s vereisen een NPU die meer dan 40 TOPS kan leveren.
- Qualcomm haalt 80 TOPS, AMD ongeveer 50-55 TOPS, en Intel tot 50 TOPS op hun huidige platforms.
- Voor lokale AI-programmering is zowel compatibele software als chipkracht belangrijk.
De komst van NPUs is een oplossing voor een concreet probleem. Continu spraakherkenning, beeldanalyse, ruisonderdrukking of kleine AI-modellen uitvoeren via CPU kan veel resources verbruiken. Een dedicated GPU gebruiken werkt, maar is niet de meest efficiënte optie voor taken die urenlang actief moeten blijven op een laptop.
De industrie koos daarom voor een derde, gespecialiseerde component.
CPU, GPU en NPU richten zich op verschillende taken
Een CPU is ontworpen om een breed scala aan operaties uit te voeren. Het heeft relatief weinig zeer geavanceerde kernen die complexe logica kunnen uitvoeren, het besturingssysteem beheren en snel reageren op verschillende belastingtypes.
Een GPU beschikt over een heel andere filosofie. Met een enorme capaciteit voor parallelle verwerking, oorspronkelijk bedoeld voor grafische taken, maar later ook geschikt voor matrices en tensors in machine learning.
De NPU brengt deze specialisatie nog een stap verder.
Ze zijn specifiek gebouwd rond de standaardbewerkingen in neurale netwerken en werken vaak uitstekend met lage-precisie getallen tijdens inferentie.
Een eenvoudige vergelijking:
| Kenmerk | CPU | GPU | NPU |
|---|---|---|---|
| Flexibiliteit | Zeer hoog | Hoog | Beperkter |
| Sequentiële belasting | Uitstekend | minder efficiënt | Niet hun doel |
| Massaal parallelisme | Beperkt | Uitstekend | Uitstekend voor compatibele AI |
| AI-inferentie | mogelijk | Zeér goed | Zeer efficiënt |
| AI-training | Mogelijk, maar traag | Voornaamste optie | Meestal niet hun doel |
| Consistent gebruik | Gemiddeld | Hoog bij dedicated GPU | Laag |
| Grafische prestaties | Beperkt/integrated | Uitstekend | Nee | Altijd actieve AI | Onbeperkt inefficiënt | Mogelijk | Speciaal geschikt |
De praktische consequentie is dat de vraag niet simpelweg “GPU of NPU?” moet zijn.
Veel moderne computers beschikken gelijktijdig over CPU, geïntegreerde GPU en NPU. Het systeem kan automatisch kiezen welke te gebruiken afhankelijk van de belasting.
Microsoft beschrijft Windows ML bijvoorbeeld als: een enkele inferentiesysteem dat modellen kan richten op CPU, GPU of NPU via verschillende uitvoerleveranciers. Het ziet de NPU vooral geschikt voor langdurige inferenties met energie-efficiëntie, terwijl GPU’s vooral worden ingezet voor zware taken zoals beeld, video en generatieve AI.
TOPS zijn handig, maar tellen niet voor elke NPU
De marketing van AI-PC’s wordt gedomineerd door de TOPS, Trillions of Operations Per Second, oftewel biljoen operaties per seconde (10¹²).
Microsoft stelde een duidelijke eis: meer dan 40 TOPS NPU voor de Copilot+ PC’s.
In augustus 2026 bieden enkele van de bekendste platforms ongeveer deze waarden:
| Platform | NPU | Gerapporteerde prestaties |
|---|---|---|
| Qualcomm Snapdragon X2 Elite / Extreme | Hexagon | 80 TOPS |
| Qualcomm Snapdragon X2 Plus | Hexagon | 80 TOPS |
| AMD Ryzen AI 9 HX 375 | XDNA 2 | tot 55 TOPS |
| AMD Ryzen AI 300 | XDNA 2 | ongeveer 50 TOPS |
| AMD Ryzen AI Max | XDNA 2 | tot 50 TOPS |
| Intel Core Ultra Series 3 | NPU | tot 50 TOPS |
| Apple M4 | Neural Engine | 38 biljoen operaties/sec |
Qualcomm heeft de eerste generatie ARM-PC’s bijna verdubbeld: Snapdragon X2 Elite en X2 Extreme omvatten een Hexagon NPU van 80 TOPS, hetzelfde geldt voor Snapdragon X2 Plus.
Intel introduceerde in 2026 de Core Ultra Series 3, eerst bekend als Panther Lake, gebouwd op Intel’s 18A. De hogere modellen halen slechts 50 TOPS uitsluitend op de NPU, niet de 60-65 TOPS die in vroege berichten werden genoemd.
AMD levert tot 50 TOPS in de Ryzen AI 300 en Ryzen AI Max, met bepaalde versies zoals de Ryzen AI 9 HX 375 die tot 55 TOPS gaan.
Apple gebruikt een andere benaming: Neural Engine. De M4 heeft 16 kernen en Apple kondigde een capaciteit tot 38 biljoen operaties per seconde aan.
Het vergelijken van deze cijfers heeft echter beperkingen.
TOPS afhankelijk van de numerieke precisie, getelde operaties en architectuur. Een accelerator met een hogere nominale TOPS-score hoeft niet per se een bepaald model sneller uit te voeren dan eentje met een lagere score.
Daarnaast spelen mee:
- geheugenbandbreedte;
- beschikbare geheugenhoeveelheid;
- ondersteunde operatoren;
- precisie-instellingen;
- compiler;
- runtime;
- modelgrootte;
- neurale architectuur;
- capaciteit om data binnen de accelerator te bewaren.
Daarom betekent 80 TOPS niet automatisch het dubbele prestatievermogen van 40 TOPS.
Software wordt nu net zo belangrijk als de NPU
Dit is waarschijnlijk de meest relevante vraag voor programmeurs.
Een NVIDIA GPU kan een breed scala aan software uitvoeren dankzij een ecosysteem dat al jaren rondom CUDA, cuDNN, TensorRT, PyTorch en andere tools is opgebouwd.
De NPU’s hebben nog een meer gefragmenteerd ecosysteem.
Microsoft probeert deze fragmentatie te verminderen met Windows ML, dat sinds 2026 zijn aanbevolen platform voor lokale inferentie is geworden.
Windows ML gebruikt ONNX Runtime en kan specifieke providers downloaden voor verschillende fabrikanten. Zo kan een applicatie met een ONNX-model werken terwijl Windows automatisch de juiste accelerator kiest.
Dit is een belangrijke verandering ten opzichte van DirectML.
DirectML wordt nog ondersteund, maar wordt momenteel vooral in onderhoud genomen. De nieuwe ontwikkeling voor ONNX-deployments is overgebracht naar Windows ML.
In macOS biedt Apple een meer geïntegreerde aanpak.
Core ML kan automatisch werk verdelen tussen CPU, GPU en Neural Engine, en kiest de beschikbare bronnen om energie en geheugen te besparen. Bovendien kan het hele model op het apparaat blijven draaien zonder internetverbinding.
Voor ontwikkelaars is deze verschil veel belangrijker dan alleen TOPS-cijfers.
Is een NPU geschikt voor het uitvoeren van een LLM?
Ja, maar met veel nuances.
NPUs kunnen compatibele generatieve modellen en grote taalmodellen (LLM’s) uitvoeren, vooral wanneer ze gekwantiseerd en geoptimaliseerd zijn voor de accelerator.
Dat betekent echter niet automatisch dat een NPU in een laptop een RTX GPU zal vervangen voor lokale AI-taken.
Een LLM vereist vooral twee resources: rekenkracht en voldoende geheugen voor het opslaan van gewichten en de KV-cache.
Bijvoorbeeld, een model van 7 miljard parameters gekwantiseerd naar 4 bits heeft meerdere gigabytes nodig voor de gewichten, en naarmate het contextvenster groter wordt, stijgt de benodigde geheugenruimte voor de KV-cache.
Een dedicated GPU beschikt over hoogwaardige VRAM met hoge bandbreedte, ontworpen voor dergelijke taken. Veel NPUs vertrouwen op gedeeld systeemgeheugen en hebben beperkingen in de types operators en modellen die ze kunnen uitvoeren.
Hierdoor is een NPU vooral aantrekkelijk voor:
- Kleine modellen
- Classificatie
- Objectdetectie
- Spraakherkenning
- Ruisonderdrukking
- Segmentatie
- Vertaling
- Camerabewerking
- Embeddings
- Lokale lichte assistenten
- Voortdurende AI-functies op de achtergrond
Voor het uitvoeren van grote generatieve modellen blijft een dedicated GPU doorgaans de beste optie voor maximale snelheid.
Een NPU is niet vooral bedoeld voor trainen
Een andere belangrijke verschil is het trainen van modellen.
De huidige PC-NPU’s zijn vooral bedoeld voor inferentie, dat wil zeggen, het uitvoeren van al getrainde modellen.
GPU’s hebben een meer volwassen architectuur en software-ecosysteem voor trainen, fine-tuning en werken met grote tensors.
Dit betekent dat een ontwikkelaar die zich vooral bezighoudt met:
PyTorch
CUDA
LoRA
QLoRA
fine-tuning
Stable Diffusion
grote LLM's
distributed trainingveel meer voordeel haalt uit een krachtige GPU dan door meer TOPS aan een NPU toe te voegen.
De NPU kan het hardware-aanbod aanvullen, maar vervangt het niet overal.
Wanneer kiezen voor NPU en wanneer investeren in GPU
Voor traditionele ontwikkeling zou je niet zomaar een computer moeten kopen op basis van enkel een NPU.
Als je backend-ontwikkeling doet, met Java, .NET, Go, Rust, PHP of klassieke webapplicaties, zijn CPU, geheugen en opslag nog steeds veel belangrijker.
De situatie verandert echter als je AI ontwikkelt voor gebruik op apparaat.
Een NPU is zinvol wanneer de bedoeling is om toepassingen te maken die continu kleine modellen uitvoeren zonder data naar de cloud te sturen. Vooral relevant voor bedrijfssoftware waar privacy, lage latentie en offline werken belangrijk zijn.
Enkele voorbeelden:
Lokale transcriptie: audio wordt verwerkt zonder dat het het apparaat verlaat.
Beeldanalyse: apps die voortdurend objecten kunnen detecteren of foto’s classificeren, met minder energieverbruik dan een dedicated GPU.
Videoconferentie: achtergrondonscherpte, gezichtsvolging, oogcorrectie of ruisonderdrukking kunnen actief blijven tijdens een gesprek.
Veiligheid: bepaalde detectiemodellen kunnen lokaal activity of inhoud analyseren zonder data te verzenden.
Offline toepassingen: het model blijft functioneren zonder internet en zonder extra kosten per API-aanroep.
Voor zware generatieve AI, training en CUDA-ontwikkeling blijft een GPU de voorkeurskeuze.
De beste aanpak is waarschijnlijk een combinatie van alle drie
De evolutie van de PC wijst eigenlijk op een heterogene architectuur.
TOEPASSING
│
┌─────────┼─────────┐
│ │ │
▼ ▼ ▼
CPU GPU NPU
│ │ │
logica zware AI efficiënte
systeem graphics permanente AI
controle generaties lokaalMicrosoft bouwt Windows ML al rondom dit concept: een applicatie kan afhankelijk van de situatie gebruik maken van CPU, GPU of NPU, volgens de beschikbaarheid.
Apple volgt een vergelijkbare benadering met Core ML, dat automatisch de werkverdeling tussen CPU, GPU en Neural Engine regelt.
Dit betekent dat de NPU niet zozeer de “nieuwe GPU” is, maar meer een derde gespecialiseerde processor die geschikt is voor specifieke taakcategorieën waarbij het gebruik van een GPU energieverspillend zou zijn.
De belangrijke onderscheidende factor wordt steeds relevanter zodra besturingssystemen functies bevatten zoals agenten, semantische zoekopdrachten, vertaling, vision en spraakherkenning die langdurig actief blijven.
Een GPU kan dat ook.
De vraag is of het zinvol is om hem continu te laten werken voor een taak die een NPU voor een fractie van de energie kan uitvoeren.
Veelgestelde vragen
Wat is het verschil tussen een GPU en een NPU?
Een GPU is een parallelle processor, vrij algemeen inzetbaar voor grafisch werk, AI en computationele taken. Een NPU is veel meer gespecialiseerd in neurale netwerken en legt de nadruk op efficiëntie tijdens inferentie.
Kan een NPU een GPU vervangen voor AI?
Niet in het algemeen. Het kan beter zijn voor bepaalde inferentietaken met laag energieverbruik, maar GPU’s bieden nog steeds meer flexibiliteit en hogere prestaties voor training, grote modellen en zware generatieve AI.
Hoeveel TOPS heeft een Copilot+ PC nodig?
Microsoft stelt dat een NPU die meer dan 40 TOPS kan leveren, vereist is, naast andere hardware- en softwarevereisten.
Waar moet een ontwikkelaar prioriteit aan geven: GPU of NPU?
Voor training, beeldgeneratie en grote LLM’s is een krachtige GPU meestal belangrijker. Voor toepassingen met continue inferentie, spraak, visie of geïntegreerde AI op Windows, macOS of mobiele apparaten, is de NPU veel waardevoller.
