Ollama heeft een belangrijke wijziging doorgevoerd in zijn architectuur om AI-modellen te kunnen draaien op Macs met Apple Silicon. Vanaf versie 0.19 introduceert het in een voorlopige fase een motor gebaseerd op MLX, het machine learning-framework van Apple, dat in tests die door het bedrijf zijn gepubliceerd, de generatie van Qwen3.5-35B-A3B van 58 naar 112 tokens per seconde kan verhogen. De verbetering ligt dicht bij 93%, maar onder een belangrijke voorwaarde: de GGUF-modellen die veel gebruikers al hadden gedownload, blijven de llama.cpp gebruiken en profiteren niet automatisch van deze versnelling.
De kern van Ollama en MLX in 20 seconden
- Ollama 0.19 introduceerde in maart een MLX-motor voor Apple Silicon.
- Bij Qwen3.5-35B-A3B ging de generatie snelheid van 58 naar 112 tokens/sec in tests door Ollama.
- GGUF-modellen blijven llama.cpp gebruiken; MLX werkt met compatibele modellen in safetensors.
- In juni werden nieuwe optimalisaties doorgevoerd die de prestaties van de MLX-motor met nog eens 20% verhoogden.
- Ollama 0.31.1 voegde Multi-Token Prediction toe om Gemma 4 sneller te maken.
Deze wijziging is vooral interessant voor ontwikkelaars die een Mac gebruiken als lokale werkstation voor het draaien van LLM’s, programmeeragents, of assistenten zonder afhankelijk te zijn van een externe API. Het onderstreept ook dat de prestatie niet alleen afhankelijk is van het model en de hardware, maar ook van de inferentiemotor, het gewichtformaat, de kwantisatie en de platform-specifieke optimalisaties.
Ollama maakte de integratie officieel bekend op 30 maart 2026. De eerste versie versnelde Qwen3.5-35B-A3B en vereiste meer dan 32 GB gedeeld geheugen voor het gebruikte demonstratiemodel. Sindsdien zijn ondersteuning en de MLX-motor blijven evolueren.
Van 58 naar 112 tokens per seconde door motorwisseling
De eerste gepubliceerde cijfers van Ollama laten een aanzienlijke difference zien.
De vergelijking werd gemaakt met Qwen3.5-35B-A3B waarbij Ollama 0.18 en de vorige implementatie Q4_K_M werden gebruikt, tegenover de nieuwe MLX-versie met het gekwantiseerde model in NVFP4. Bij promptverwerking (pre-filling) steeg de snelheid van 1.154 naar 1.810 tokens/sec, ongeveer 1,57 keer sneller.
Bij generatie, de snelheid die gebruikers waarnemen terwijl de reactie verschijnt, ging het van 58 naar 112 tokens/sec, bijna 1,93 keer sneller.
Ollama gaf ook aan dat een variant met int4 kwantisatie zelfs 1.851 tokens/sec bij prefill en 134 tokens/sec bij generatie kon behalen. Dit zijn metingen van het bedrijf zelf, en omdat ze verschillende kwantisaties betreffen, mogen deze cijfers niet vrij worden gebruikt om MLX en llama.cpp te vergelijken.
Dit nuanceer ik graag.
De sprong komt niet door één enkele optimalisatie. Bij het wijzigen van de route verandert ook het formaat dat door het model wordt gebruikt en kan de kwantisatie verschillen. Daarom zou een eenvoudige stelling dat «MLX 93% sneller is dan llama.cpp» teveel generaliseren, omdat het resultaat onder specifieke omstandigheden is verkregen.
Een onafhankelijke vergelijking, uitgevoerd door Ante Kapetanovic kort voor de lancering, plaatst deze verschillen nog in perspectief. Hij vergeleek Qwen3.5-35B-A3B op een M4 Max met 128 GB gedeeld geheugen, met respectievelijk 48,1 tokens/sec met Ollama, 72,4 tokens/sec direct met llama.cpp en 131,8 tokens/sec via mlx-lm.
De kwantisatie was niet precies hetzelfde, waardoor deze cijfers niet elk aspect van de motor-prestaties uitsluiten. Wel laten ze zien dat de gekozen uitvoeringslaag een grote invloed kan hebben op de prestaties, zelfs op dezelfde Mac en hetzelfde model.
Ollama-updates versnellen niet automatisch oude modellen
Dit is waarschijnlijk de belangrijkste nuance voor bestaande Ollama-gebruikers.
Een nieuwe versie installeren betekent niet automatisch dat alle opgeslagen modellen nu via MLX draaien.
De architectuur houdt twee inferentieroutes in stand. GGUF-modellen blijven llama.cpp gebruiken, terwijl compatibele modellen in safetensors de MLX-motor kunnen gebruiken op macOS met ARM64.
Dat betekent dat je Ollama kunt updaten en vrijwel hetzelfde kunt blijven presteren, zolang je hetzelfde GGUF-model blijft gebruiken.
De verandering moet ook door de modellen worden doorgevoerd.
Deze scheiding maakt dat je de enorme bibliotheek GGUF en llama.cpp kunt behouden, terwijl Ollama geleidelijk nieuwe modellen met MLX-ondersteuning toevoegt. Maar dat betekent ook dat verbeteringen niet overal automatisch gelden.
De eerste voorlopige versie richtte zich op qwen3.5:35b-a3b-coding-nvfp4. Later werden andere modellen en optimalisaties toegevoegd. In juni bijvoorbeeld heeft Ollama de uitvoering van gemma4:12b-mlx gedocumenteerd met behulp van de nieuwe motor.
De evolutie van de versies toont dat dit nog een jonge architectuur is. Updates brengen steeds verbeteringen in modelladen, embeddings, matrixbewerkingen en nieuwe architecturen.
Waarom MLX bijzonder goed past bij Apple Silicon
MLX is niet zomaar een andere interface boven Metal.
Apple heeft het specifiek ontworpen voor haar processors en de gedeelde geheugenarchitectuur, waarin CPU en GPU samen werken in hetzelfde fysiek geheugen. Volgens Apple kunnen MLX-operaties op CPU of GPU worden uitgevoerd zonder expliciet gegevens tussen memoria-gebieden te verplaatsen.
Dit betekent niet dat llama.cpp de voordelen van Apple Silicon negeert. Ook de Metal-backend van llama.cpp is breed geoptimaliseerd voor Macs.
MLX voegt daarentegen functies toe zoals vertraagde grafiekanalyse en hardware-gestuurde optimalisaties die nauw verbonden zijn met Apple’s hardware.
Ollama legde in juni uit dat hij erin geslaagd was om MLX tot tot 20% sneller te maken dan eerdere versies door meerdere operaties in Metal-kernels te fusioneren via de JIT-compiler van MLX en GPU-beelden te herzien.
De verschil wordt nog groter met de M5-generatie.
Apple introduceerde Neural Accelerators binnen de GPU-kernen om matrixbewerkingen te versnellen. Uit eigen tests met MLX ontdekte het bedrijf prestatiewinsten van tussen 3,33 en 4,06 keer op de tijd tot de eerste token in vergelijking met een M4 MacBook Pro, afhankelijk van het model.
De volgende generatie tokens verbeterde dat slechts met een factor tussen 1,19 en 1,27.
Dat is geen tegenspraak.
Apple zegt dat het initieel verwerken van de prompt vooral een zware rekenbelasting is, waardoor de Neural Accelerators direct kunnen worden ingezet. Token-voor-token genereren is afhankelijk van de geheugenbandbreedte, die met de M5 van 120 GB/sec naar 153 GB/sec steeg, een toename van 28%.
Om de verbeterde mogelijkheden van de Neural Accelerators in de M5 te benutten via MLX, vereist Apple macOS 26.2 of hoger.
NVFP4 speelt ook een rol
De motorwijziging wordt aangevuld met een andere technische factor: NVFP4.
Ollama gebruikt dit low-precision formaat ontwikkeld door NVIDIA in sommige modellen die geschikt zijn voor MLX. In plaats van de gewichten met hogere precisie op te slaan, reduceert een kwart-kwantisatie in 4 bits de geheugeneisen en vooral tijdens het decodeerproces de hoeveelheid informatie die continu vanaf het geheugen moet worden verplaatst.
Ollama beweert dat NVFP4 de kwaliteit beter behoudt dan Q4_K_M in tests met Gemma 4 12B. Het bedrijf zegt dat het ongeveer de helft van de kwaliteitsverlies door kwantisatie ten opzichte van BF16 vermindert en dat het met de geüpdatete MLX-motor ongeveer 20% sneller is dan Q4_K_M. Dit zijn de resultaten van de fabrikant en ze maken geen automatische uitbreiding uit voor alle modellen.
Daarnaast is dit formaat ook praktisch, vooral voor inferentietaken in NVIDIA-infrastructuur. Ollama stelt dat je hiermee modellen lokaal kunt draaien die bijna dezelfde kwantisatie gebruiken als die in datacenters wordt toegepast.
Bij het vergelijken van een GGUF Q4_K_M-model via llama.cpp met een safetensors NVFP4-model via MLX, verandert niet enkel de inferentiemotor, maar ook de gebruikte kwantisatie.
Gemma 4 voegt multitoken genereren toe
De evolutie stopt niet bij MLX.
Ollama 0.31.1, uitgegeven op 30 juni, bevatte verbeteringen voor Multi-Token Prediction (MTP) in Gemma 4 op Apple Silicon.
Het idee is om meerdere tokens tegelijk te verwachten tijdens het generatieproces, in plaats van strikt één per keer. Ollama past dynamisch aan hoeveel tokens het beste kunnen worden voorgesteld.
Volgens de testresultaten in de release-notes steeg de snelheid van Gemma 4 12B NVFP4 op een M5 Max van 50,2 naar 95 tokens/sec in een benchmark met Aider Polyglot, bijna 90% meer. Het bedrijf zegt dat de functie standaard is ingeschakeld, geen configuratie vereist en de output van het model niet verandert.
Dit is een andere verbetering dan de sprong van llama.cpp naar MLX, en beide percentages mogen niet zomaar opgeteld worden voor een totale versnelling.
Wat wel duidelijk wordt uit de nieuwe versies, is dat lokale inferentie op Mac steeds meer gebruikmaakt van specifieke functies van Apple Silicon, in plaats van alleen een universeel en platformonafhankelijk laagje.
Voor ontwikkelaars betekent dat dat niet meer alléén relevant is welk model je draait, maar ook welke variant, met welke kwantisatie en welke motor de finale verwerking doet.
Een GGUF-model kan nog steeds de beste keuze zijn vanwege compatibiliteit en beschikbaarheid. Maar updaten van Ollama en dezelfde bestanden blijven gebruiken, betekent niet dat je automatisch de nieuwe MLX-versnellingen benut.
Veelgestelde vragen
Maakt Ollama automatisch gebruik van MLX op alle Macs?
Ollama heeft een MLX-motor voor Apple Silicon, maar niet alle modellen maken daar automatisch gebruik van. De GGUF-modellen blijven llama.cpp gebruiken, terwijl compatibele modellen in safetensors de MLX-inferentiestraat gebruiken.
Versnelt MLX Ollama verdubbeld?
Bij de initiële test met Qwen3.5-35B-A3B steeg de snelheid van 58 naar 112 tokens/sec, bijna 1,93 keer sneller. Dit resultaat is niet automatisch toepasbaar op alle modellen, Mac-configuraties en kwantisaties.
Wat brengt de M5-generatie ten opzichte van eerdere generaties?
De Neural Accelerators in de M5-GPU versnellen met name matrixbewerkingen tijdens het eerste promptproces. Apple ontdekte verbeteringen tot 4,06 keer sneller tot de eerste token vergeleken met M4, terwijl latere generaties groeiden met ongeveer 20-27% in de testmodellen.
Moet ik opnieuw modellen van Ollama downloaden?
Wil je gebruikmaken van een variant die speciaal is ontworpen voor MLX, dan moet je het juiste model gebruiken. Een update van Ollama alleen maakt de bestaande GGUF-modellen niet automatisch MLX-compatibel.
Bronnen:
- Ollama, “Ollama is now powered by MLX on Apple Silicon in preview”, 30/03/2026.
- Ollama, “Ollama’s highest performance on Apple Silicon yet with MLX”, 11/06/2026.
- Ollama v0.19.0, release notes, 27/03/2026.
- Ollama v0.31.1, release notes, 30/06/2026.
- Apple Machine Learning Research, “Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU”, 19/11/2025.
- Ante Kapetanovic, vergelijking Ollama, llama.cpp en MLX met Qwen3.5 35B, 18/03/2026.
- NVIDIA, technische documentatie NVFP4.
