Cloudflare heeft enkele van de wijzigingen toegelicht die ze hebben doorgevoerd in Workers AI om grote open modellen zoals Kimi K2.6 van Moonshot AI en GLM 5.2 van Z.ai efficiënter uit te voeren. Het bedrijf zegt het GPU-geheugengebruik en de kosten per inferentie aanzienlijk te hebben verminderd door nieuwe optimalisatietechnieken, terwijl de nauwkeurigheid van de modellen vrijwel onaangetast blijft.
De kern van Cloudflare’s optimalisaties in 20 seconden
- Workers AI maakt gebruik van nieuwe technieken om grote open modellen met minder GPU-geheugen uit te voeren.
- Cloudflare combineert KV-cache in FP8, gecomprimeerde gewichten in INT4 en nieuwe geheugenbeveiligingsmechanismen.
- Het bedrijf beweert dat de nauwkeurigheid vrijwel hetzelfde blijft als bij de originele modellen.
- Het doel is het aantal gelijktijdige verzoeken te verhogen en de kosten per inferentie te verlagen.
Het artikel biedt een zeldzaam inkijkje in het werk achter grootschalige taalmodeluitvoering, waarbij de uitdaging niet langer alleen bestaat uit het hebben van krachtigere GPU’s, maar vooral uit het efficiënter gebruik van elke beschikbare gigabyte geheugen.
De echte knelpunt ligt in het geheugen
Cloudflare legt uit dat modellen zoals Kimi K2.6 of GLM 5.2 zich onderscheiden door hun vermogen om zeer lange contexten aan te kunnen en gebruik te maken van Mixture of Experts (MoE)-architecturen. Maar juist deze kenmerken maken het implementeren ervan bijzonder memory-intensief.
In veel gevallen vormen niet de modelparameters zelf de belangrijkste limiet, maar de zogenaamde KV-cache: een structuur die de gegenereerde sleutels en waardes van aandacht opslaat tijdens het gesprek, zodat niet telkens de volledige context opnieuw moet worden berekend.
Bij lange gesprekken kan deze cache meer geheugen innemen dan het model zelf.
Cache halveren met FP8
Een van de optimalisaties bestaat uit het opslaan van de KV-cache in precisie FP8 in plaats van BF16.
Volgens Cloudflare reduceert deze wijziging ongeveer de helft van de benodigde ruimte voor de cache. Voor Kimi K2.6 betekent dit dat het maximale contextvolume dat in het geheugen kan worden gehouden, stijgt van ongeveer 686.000 tokens naar bijna 1,37 miljoen tokens.
Hoewel de prestaties per individueel verzoek licht afnemen door de benodigde conversies tussen formaat, maakt de efficiëntie wel een sprong bij hogere gelijktijdigheid.
Met BF16 liep het systeem vast bij 32 gelijktijdige aanvragen, terwijl FP8 ondersteuning biedt voor tot wel 64 gelijktijdige verzoeken, met een snelheid van ongeveer 2.192 tokens per seconde, wat ongeveer een 41 %-toename betekent ten opzichte van BF16.
Cloudflare voegt toe dat hun interne testen geen merkbare verschillen in nauwkeurigheid aantonen tussen deze twee formaten op benchmarks zoals GSM8K, MMLU of ARC.
GLM verkleint ook het model met INT4
De tweede techniek betreft een directe compressie van de modelgewichten.
Voor GLM 5.2 gebruikt Cloudflare kwantisatie in INT4, waardoor de modelgrootte daalt van ongeveer 705 GB naar 421 GB, bijna 40 % minder.
Deze vermindering maakt het mogelijk om geheugen vrij te maken op elke GPU voor een groter contextvolume en versnelt bovendien de tekstgeneratiefase.
Volgens de gepubliceerde gegevens geeft deze techniek vooral bij lage gelijktijdigheid significante prestatiewinsten. Bij één verzoek per keer stijgt de snelheid bijvoorbeeld van ongeveer 60 tokens per seconde met FP8 naar ongeveer 92 tokens per seconde met INT4.
De firma erkent dat deze methode minder gunstig is tijdens de initiële verwerking (prefill), waar nog steeds FP8 wordt gebruikt omdat deze fase vooral beperkt wordt door rekencapaciteit en niet door geheugenbandbreedte.
Meer efficiëntie vereist strengere beveiligingsmaatregelen
Het verhogen van het aantal verzoeken dat geheugen deelt op een GPU verhoogt ook het risico op fouten bij het hergebruiken van de KV-cache.
Om dat risico te beperken, heeft Cloudflare een intergriteitscontrole voor de cache ontwikkeld die verifieert dat elke aanvraag uitsluitend toegang heeft tot de juiste geheugenpagina’s.
In geval van inconsistenties wordt een verzoek geannuleerd voordat een foutieve reactie wordt teruggegeven.
Volgens interne tests voegt dit mechanisme minder dan 1 % toe aan de impact op prestaties en latency, waardoor het bedrijf vindt dat de kosten acceptabel zijn voor een verbeterde betrouwbaarheid van het systeem.
De volgende uitdaging is meer modellen ondersteunen voor dezelfde kosten
Cloudflare stelt dat het van plan is verdere optimalisaties door te voeren voor haar gehele infrastructuur.
Onder andere wordt gewerkt aan het uitbreiden van het gebruik van FP8 voor de KV-cache, nieuwe compressiemethoden zoals NVFP4 op de Blackwell-architectuur van NVIDIA, en generalisatie van cache-integriteitscontroles.
Los van de technische details weerspiegelt het artikel een groeiende trend in de AI-industrie: de race gaat niet alleen meer om het ontwikkelen van grotere modellen, maar vooral om het efficiënter uitvoeren ervan, zodat meer gebruikers kunnen worden bediend zonder de infrastructuurkosten de pan uit te laten rijzen.
Veelgestelde vragen
Welke modellen optimaliseert Cloudflare?
De verbeteringen zijn voornamelijk toegepast op Kimi K2.6, ontwikkeld door Moonshot AI, en GLM 5.2 van Z.ai, beide beschikbaar via Workers AI.
Wat is het voordeel van FP8 voor de KV-cache?
Het vermindert het geheugenverbruik van de cache met ongeveer de helft, waardoor meer gelijktijdige verzoeken kunnen worden afgehandeld zonder dat de nauwkeurigheid van het model significant wordt aangetast.
Wat doet kwantisatie in INT4?
Het comprimeert de modelgewichten om minder GPU-geheengebruik te realiseren en de generatie-snelheid tijdens het decoderen te verbeteren.
Verliest het model nauwkeurigheid bij het verkleinen?
Volgens de door Cloudflare gepubliceerde benchmarks zijn de verschillen met de originele versies minimaal en niet significant in de geteste scenario’s.
