Kimi K3, DeepSeek V4 en Qwen 3.8 Maximale spanning drijven de wereldwijde AI-race

De Chinese kunstmatige intelligentie heeft binnen enkele dagen drie grote bewegingen geconcentreerd. Moonshot AI moest de nieuwe abonnementen van Kimi K3 beperken vanwege capaciteitsproblemen, DeepSeek is begonnen met de brede uitrol van hun V4-familie en Alibaba heeft Qwen 3.8 Max gepresenteerd. Deze drie modellen concurreren met Amerikaanse voorstellen zoals GPT-5.6 en Claude Opus 5, maar het echte strijdperk ligt niet alleen meer in benchmarks: ook de kosten per antwoord en de beschikbare GPU’s voor de vraag aannemen, bepalen de markt.

De kernpunten van de nieuwe Chinese modellen in 20 seconden

  • Moonshot heeft tijdelijk de nieuwe inschrijvingen voor Kimi K3 stopgezet nadat een deel van de inferentiecapaciteit was overschreden.
  • DeepSeek V4 combineert langdurige context, lagere prijzen en twee varianten voor verschillende belastingniveaus.
  • Alibaba heeft Qwen 3.8 Max geïntroduceerd, een multimodaal model met 2,4 biljoen parameters.
  • GPT-5.6 en Claude Opus 5 behouden een voorsprong op verschillende professionele taken, zij het tegen hogere prijzen.

De reeks aankondigingen bevestigt een belangrijke veranderingen. Tijdens de eerste jaren van generatieve kunstmatige intelligentie was de aandacht vooral gericht op wie het grootste model kon trainen of de hoogste scores kon behalen. Nu is het andere vraagstuk belangrijker: een laboratorium kan beschikken over een competitief model, maar alsnog niet genoeg infrastructuur hebben om alle gebruikers te bedienen.

Kimi K3 illustreert dit het duidelijkst. Slechts 48 uur na de lancering stopte Moonshot AI met het accepteren van nieuwe inschrijvingen. Het bedrijf gaf er de voorkeur aan de dienstverlening aan bestaande klanten te beschermen in plaats van de latentie en stabiliteit verder te laten verslechteren door de groeiende vraag.

Kimi K3 toont de grenzen van het bedienen van een model met 2,8 biljoen parameters

Kimi K3 is een model met 2,8 biljoen parameters, gebaseerd op een mengarchitectuur van experts, bekend als MoE (Mixture of Experts). Dit ontwerp gebruikt niet alle parameters bij elke query. Een routeringsmechanisme selecteert de meest geschikte experts om elk token te verwerken, wat de rekencapaciteit verlaagt in vergelijking met een volledig dense model van dezelfde grootte.

Dat betekent niet dat het goedkoop of eenvoudig te implementeren is.

Moonshot adviseert het gebruik van superknooppunten met minimaal 64 accelerators, zodat communicatie tussen de verschillende experts binnen een netwerk met hoge bandbreedte blijft. De volledige set gewichten neemt ongeveer 1,5 TB in beslag in volledige precisie, terwijl een gekwantiseerde versie op 4 bits nog ongeveer 600 GB aan geheugen vereist.

De Kimi Delta Attention-architectuur vermindert aanzienlijk het geheugengebruik voor de KV-cache, die wordt gebruikt om de context tijdens de generatie te behouden. Toch elimineert deze verbetering niet de fysieke behoeften van het model. Het bedrijf blijft grote hoeveelheden hoog-bandbreedte geheugen, interconnectcapaciteit en GPU’s nodig hebben voor elke aanvraag.

De lancering zorgde voor een plotselinge stijging in de dagelijkse verkoop en API-gebruik, waardoor Moonshot besloot hun abonnement op te splitsen in twee producten: één voor de webapplicatie, werkfuncties en algemene Kimi-services; en een tweede, Kimi Code, dat zich richt op programmeren.

Deze scheiding is technisch verklaarbaar. Een gewone conversatie duurt meestal enkele minuten, terwijl een programmeeragent uren kan werken, complete repositories kan analyseren, tools kan gebruiken en miljoenen tokens kan genereren. Het beheren van beide toepassingen binnen één enkele belasting bemoeilijkt resource toewijzing.

De komende publicatie van de gewichten zal Moonshot ook helpen de kosten beter te verdelen. Cloud-aanbieders, grote bedrijven en datacenteroperators zullen Kimi K3 zelfstandig kunnen draaien, hoewel de grootte van het model nog altijd ver weg is van conventionele servers.

DeepSeek V4 concurreert met prijs en efficiëntie bij langdurige context

Terwijl Moonshot de inschrijvingen voor Kimi K3 beperkte, begon DeepSeek met de grootschalige uitrol van V4 Pro en V4 Flash, twee modellen die sinds april in preview beschikbaar waren.

V4 Pro telt 1,6 biljoen parameters en activeert 49 miljard tokens per token. V4 Flash vermindert de schaal tot 284 miljard parameters en 13 miljard tokens actief. Beiden bieden een contextvenster van één miljoen tokens.

De architectuur is sinds de preview niet wezenlijk gewijzigd. De belangrijkste verbeteringen betreffen reasoning, het gebruik van tools en agentgedrag. Eerste testen wijzen op minder geïmproviseerde antwoorden en duidelijkere reactietijden bij programmeertaken.

DeepSeek heeft ook een prijspolitiek gebaseerd op tijdstip van de dag geïntroduceerd. Tarieven stijgen tijdens de drukke uren in Peking en dalen in rustiger periodes. Dit is gebruikelijk bij elektriciteit, vervoer en cloudcapaciteit, maar vrij zeldzaam voor AI API’s tot nu toe.

Buiten de spitsuren ligt de prijs voor V4 Pro rond $0,87 per miljoen tokens; V4 Flash kost ongeveer $0,28. Deze prijzen zijn aanzienlijk lager dan die van Amerikaanse high-end modellen.

Het vergelijken van kosten per token is echter niet alles. Goedkope modellen kunnen langere antwoorden genereren, meer pogingen vereisen of fouten maken die herhaling nodig maken. Toch is de prijsverschil groot genoeg zodat veel bedrijven DeepSeek kunnen inzetten voor classificatie, data-extractie, routinecodering of grootschalige geautomatiseerde processen.

Een andere belangrijke verandering is dat de oude identificators deepseek-chat en deepseek-reasoner worden vervangen. Ontwikkelaars moeten overstappen op de nieuwe namen van V4 Pro en V4 Flash om nauwkeurig te kunnen bepalen welke variant wordt gebruikt.

Qwen 3.8 Max introduceert 2,4 biljoen parameters en multimodale capaciteiten

Alibaba heeft Qwen 3.8 Max Preview gepresenteerd, een model met 2,4 biljoen parameters dat ook een MoE-architectuur gebruikt. Nog niet is bekendgemaakt hoeveel parameters het per token activeert, een cruciale factor voor het bepalen van snelheid en kosten van inferentie.

Het model ondersteunt tekst, beelden, video en documenten. Het biedt een contextvenster dicht bij 984.000 tokens en kan antwoorden genereren van maximaal 131.072 tokens.

Alibaba heeft verschillende inspanningsniveaus voor reasoning ingebouwd, van laag tot extra hoog. Dit maakt het mogelijk om afhankelijk van de moeilijkheidsgraad middelen aan te passen, terwijl reasoning standaard ingeschakeld blijft.

Qwen 3.8 Max is beschikbaar via Alibaba’s tokenplannen en hun platformen Qoder en QoderWork. Het ondersteunt protocollen van OpenAI en Anthropic, zodat veel apps zonder volledige herintegratie kunnen wisselen tussen endpoints.

De beschikbare tarieven per miljoen tokens en benchmarkresultaten ontbreken nog. Dit is een preliminaire versie die mogelijk in de komende weken wordt aangepast. Alibaba heeft toegezegd de gewichten te publiceren, maar een datum of licentie is nog niet bevestigd.

Kimi, DeepSeek en Qwen versus GPT-5.6 en Claude Opus 5

De Chinese modellen komen met lage prijzen, open architecturen of beloftes tot openheid en contextvensters vlakbij een miljoen tokens. OpenAI en Anthropic behouden een ander voordeel: propriëtaire, meer volwassen modellen, geïntegreerde tools en grotere infrastructuurcapaciteit.

ModelArchitectuurGeschat contextvensterStartprijsBeschikbaarheid
Kimi K3MoE, 2,8 biljoen parameters1 miljoen$15 per miljoen tokensAPI, aangekondigde app en gewichten
DeepSeek V4 ProMoE, 1,6 biljoen totaal1 miljoenVanaf $0,87 buiten spitsurenAPI en open gewichten
DeepSeek V4 FlashMoE, 284 miljard totaal1 miljoenVanaf $0,28 buiten spitsurenAPI en open gewichten
Qwen 3.8 MaxMoE, 2,4 biljoen parametersOngeveer 1 miljoenGeen standaardtarief gepubliceerdPreview
GPT-5.6ProprietairAfhankelijk van versie en modaliteitTot $30 per miljoenAPI en OpenAI services
Claude Opus 5ProprietairTot 1 miljoen$25 per miljoenAPI en Anthropic toepassingen

GPT-5.6 blijft sterk in programmeren, onderzoek, ontwerp en toolgebaseerde automatisering. OpenAI biedt ook varianten en reasoningniveaus die snelheid, kosten en kwaliteit kunnen afstemmen op verschillende projecten.

Claude Opus 5 is vooral gericht op autonome programmering, repository-analyse, langdurige agenten en computergebruik. Anthropic positioneert het dicht bij hun hoogste capaciteit, maar tegen lagere kosten per taak.

De tarieven van beiden liggen hoger dan die van DeepSeek, maar OpenAI en Anthropic beschikken over schaalvoordelen. Ze beheren hun infrastructuur, modellen, tools en veelgebruikte interfaces zelf.

De inferentiecapaciteit wordt de nieuwe bottleneck

Het voorbeeld van Kimi K3 onderstreept de volgende fase in de technologische race: het ontwikkelen van geavanceerde modellen volstaat niet meer. Ze moeten ook aan miljoenen gebruikers worden geleverd zonder dat de latentie, fouten of kosten per antwoord toenemen.

China heeft hierbij nog een extra uitdaging. Beperkingen opgelegd door de VS bemoeilijken de toegang tot de meest geavanceerde accelerators, waardoor laboratoria meer rendement uit elke GPU moeten halen en efficiëntere architecturen moeten ontwerpen.

Deze beperkingen stimuleren ontwikkelingen in expertsystems, efficiënte aandacht, kwantisatie en vermindering van de KV-cache. Maar efficiëntie kan niet volledig de fysieke capaciteit vervangen. Een model met meerdere biljoenen parameters blijft grote clusters, HBM- geheugen en snellopende netwerken nodig hebben om data snel te verplaatsen tussen accelerators.

Voor ontwikkelaars betekent dit een breder aanbod. Er bestaan nu al competitieve modellen voor verschillende combinaties van kosten, privacy, openheid en prestatie. Een bedrijf kan GPT-5.6 of Claude Opus 5 reserveren voor de meest veeleisende taken en DeepSeek, Kimi of Qwen gebruiken voor repetitieve of grootschalige automatisering.

De keuze zal niet meer uitsluitend afhangen van welk model in een ranglijst bovenaan staat. Het gaat ook om kosten per voltooide taak, snelheid, tokenverbruik, API-stabiliteit, mogelijkheid tot privé-implementatie en de daadwerkelijke infrastructuurbeschikbaarheid.

Veelgestelde vragen

Waarom stopte Kimi K3 met nieuwe inschrijvingen?

Moonshot AI heeft de inschrijvingen tijdelijk stilgelegd omdat de vraag de GPU-infrastructuur bijna volledig uit de pan liet rijzen. Bestaande klanten konden wel blijven gebruiken.

Wat is het verschil tussen DeepSeek V4 Pro en V4 Flash?

V4 Pro heeft meer parameters en is ontworpen voor complexe taken. V4 Flash gebruikt minder resources en biedt lagere kosten en latentie voor frequent gebruik.

Is Qwen 3.8 Max een open model?

Alibaba heeft aangekondigd dat ze de gewichten zullen publiceren, maar een datum, licentie of repository is nog niet bekendgemaakt.

Zijn Chinese modellen beter dan GPT-5.6 en Claude Opus 5?

Dat hangt af van de taak. Chinese modellen excellereren in prijs, openheid en context, terwijl GPT-5.6 en Claude Opus 5 nog altijd een voorsprong hebben in diverse professionele toepassingen en meer volwassen diensten aanbieden.

vía: Nieuws Kunstmatige Intelligentie

Scroll naar boven