SpaceX bouwde Colossus op volle snelheid, nu moet hij duurzaam worden gemaakt

SpaceXAI heeft aangetoond dat het in snel tempo AI-infrastructuur kan opbouwen: de eerste Colossus-cluster met ongeveer 100.000 NVIDIA H100 GPU’s en circa 130 MW rekenkracht werd in slechts 122 dagen operationeel. Colossus II was nog sneller. Een recente publicatie door The Information wijst echter op een ander probleem: de eerste centra ondervonden frequente onderbrekingen en SpaceX is bezig met het herzien van delen van het ontwerp om de betrouwbaarheid te verbeteren. Het draait niet langer uitsluitend om hoeveel GPU’s kunnen worden geïnstalleerd, maar vooral om welk niveau van redundantie nodig is om die capaciteit om te zetten in een cloudservice die op een duurzame manier aan derden kan worden aangeboden.

De kern van Colossus en de uitdaging van redundantie in 30 seconden

  • SpaceXAI bouwde de eerste 100.000 H100 GPU’s van Colossus in 122 dagen en het eerste blok van Colossus II in 91 dagen.
  • De twee faciliteiten samen beschikken volgens SpaceX-documentatie over ongeveer 1 GW rekenkracht.
  • The Information meldt dat de eerste centra veelvuldig onderbrekingen hebben gekend en dat delen ervan opnieuw worden ontworpen.
  • SpaceX verkoopt inmiddels capaciteit aan derden, waaronder Google, wat de eisen aan beschikbare uptime verhoogt.
  • Energie, batterijen, koeling, netwerk en redundantie bepalen mede hoeveel dit model kan opschalen.

Deze ontwikkeling is relevant omdat Colossus niet meer alleen als een supercomputer voor het trainen van Grok kan worden gezien. Na de integratie van xAI binnen SpaceX verkoopt het bedrijf nu delen van zijn enorme GPU-infrastructuur aan externe klanten.

Een overeenkomst ingediend bij de Amerikaanse Securities and Exchange Commission (SEC) toont de reikwijdte hiervan. Op 5 juni 2026 tekende SpaceX een contract met Google om capaciteit te leveren op basis van circa 110.000 NVIDIA GPU’s, naast CPU’s, geheugen en andere componenten. Google stemde er mee in maandelijks 920 miljoen dollar te betalen van oktober 2026 tot juni 2029, met voorwaarden voor beëindiging en aanpassing indien SpaceX niet aan de leveringsverplichtingen voldoet.

Met dergelijke grote contracten blijft snel bouwen een voordeel. Het blijven operationeel houden van de infrastructuur wordt even belangrijk.

Van 100.000 H100 in 122 dagen naar meer dan 1 GW rekenkracht

De geschiedenis van Colossus begint met een keuze die de snelheid grotendeels verklaart.

In plaats van een traditioneel datacenter vanaf nul op te bouwen, hergebruikte xAI een oude Electrolux-fabriek in Memphis. In slechts 122 dagen wist het bedrijf circa 100.000 NVIDIA H100 GPU’s en circa 130 MW aan rekenvermogen te installeren.

SpaceX gebruikt deze tijdsduur nu als een marketingargument. In de documenten die zijn ingediend bij de SEC vergelijkt het project met een referentie van ongeveer twee jaar voor het bouwen van een 100 MW groenveld datacenter. Deze vergelijking komt van het bedrijf zelf en betekent niet dat beide projecten qua aard exact vergelijken.

Het aantal GPU’s van Colossus bleef groeien. SpaceXAI beweert dat het systeem daarna werd verdubbeld tot ongeveer 200.000 GPU’s in nog eens 92 dagen. Publieke informatie vermeldt meer dan 0,5 exabytes opslag en tot 2,8 Tb/s connectiviteit per server voor gedistribueerde workloads.

Colossus II zette de groei verder door.

Volgens de door SpaceX gepresenteerde documentatie aan investeerders omvatte het eerste cluster ongeveer 110.000 NVIDIA GB200 GPU’s en 210 MW rekenkracht in 91 dagen.

Het tweede cluster kon binnen slechts 64 dagen nog eens 110.000 GB300 GPU’s en circa 220 MW toevoegen.

DeploymentsGebruikte hardwareRekenkrachtTijd
Colossus, eerste fase~100.000 H100~130 MW122 dagen
Colossus, uitbreidingtot ~200.000 GPU’s+92 dagen
Colossus II, eerste cluster~110.000 GB200 GPU’s~210 MW91 dagen
Colossus II, tweede cluster~110.000 GB300 GPU’s~220 MW64 dagen
Colossus + Colossus IImeerdere generatiesca. 1 GWgecombineerde capaciteit

De cijfers zijn vooral afkomstig van SpaceX en moeten worden gezien als door het bedrijf zelf verstrekte gegevens. Een onafhankelijke organisatie, Epoch AI, gebruikt satellietbeelden, vergunningen en cooling-modellen om de capaciteit van grote AI-centra te schatten. Zij schat dat Colossus II momenteel meer dan een miljoen H100-equivalenten bevat, maar dit is slechts een schatting en geen officieel GPU-inventaris.

Het verschil is belangrijk.

Een ‘H100-equivalent’ probeert de rekencapaciteit van verschillende generaties te normaliseren en betekent niet dat er daadwerkelijk precies dat aantal H100 GPU’s zijn geïnstalleerd.

Snel bouwen en ontwerpen voor fouten zijn niet hetzelfde probleem

De extreme snelheid kan een keerzijde hebben.

The Information meldde in september dat de eerste datacenters van xAI frequente onderbrekingen kenden. Volgens bronnen werd in de eerste fase vooral prioriteit gegeven aan snel operationeel maken van de capaciteit, ten koste van het uitrollen van een volledige betrouwbaarheidssystemen.

De publicatie meldt dat SpaceX tijdens de zomer het datacenter-team reorganiseerde en engineers uit de raketafdeling betrokken. Een deel van de bestaande infrastructuur werd herontworpen.

SpaceX heeft geen gedetailleerde metrics gedeeld over deze onderbrekingen, zoals jaarlijkse uptime, gemiddelde duur, getroffen GPU’s of specifieke oorzaken. Het is daarom niet mogelijk publiek te bevestigen welke componenten faalden of of de incidenten aan een gebrek aan redundantie kunnen worden toegeschreven.

De informatie werpt echter een belangrijke technische vraag op.

Een intern trainingscluster en een infrastructuurservice voor derden kunnen risico’s anders tolereren.

Voor het trainen van een model kunnen softwarecheckpoints worden opgeslagen en kunnen taken hervat worden na sommige falen. Het verlies van een knooppunt leidt niet per definitie tot stilstand van het hele systeem, mits de architectuur is ontworpen om dat te voorkomen.

Maar hoe groter het cluster, hoe meer componenten er kunnen falen.

Honderdduizenden GPU’s impliceren ook servers, voedingen, switches, glasvezelverbindingen, koelsystemen, opslag, pompen, transformatoren en kilometers kabel. De algehele beschikbaarheid hangt niet uitsluitend af van de betrouwbaarheid van de GPU’s zelf.

Traditionele redundantie in een datacenter probeert te voorkomen dat een enkele storing de hele infrastructuur lamlegt. Dit kan inhouden: verschillende stroompaden, UPS-systemen, batterijen, generators, extra koeling, redundante pompen, alternatieve netwerken of systemen waarmee racks en servers geïsoleerd kunnen worden zonder de hele infrastructuur te onderbreken.

Elke extra laag kost echter geld, neemt ruimte in beslag en vertraagt de uitrol.

Daar ligt de kern van het dilemma van Colossus: een deel van zijn voordeel ligt juist in het elimineren of vereenvoudigen van processen die de traditionele bouw vertragen.

Energie-infrastructuur als voorbeeld van evolutie in ontwerp

De elektrische infrastructuur rond Memphis biedt een inkijk in die evolutie.

SpaceX heeft in reglementaire documenten toegelicht dat Colossus en Colossus II aanvankelijk werden gebouwd met een grote mate van eigen energieopwekking op de site zelf. Het bedrijf beschouwt de capaciteit om snel dergelijke energie-infrastructuur op te zetten als één van haar concurrentievoordelen.

Deze strategie veroorzaakte ook controverse.

In juli meldde Reuters dat tientallen gasturbines in Tennessee en Mississippi werden gebruikt, en dat er regulatoire en gerechtelijke geschillen waren over hun vergunningen en emissies. SpaceXAI stelt dat deze installaties tijdelijk zijn totdat permanente oplossingen klaar zijn.

Het bedrijf kondigde later aan dat deze tijdelijke turbine-installaties zullen worden vervangen door een vaste gascentrale van 1,2 GW, met een planning tot juli 2027.

Ook wordt opslag van elektriciteit op grote schaal toegepast.

Canary Media ontdekte via satellietbeelden 720 Tesla Megapacks bij Colossus II in juli. Afhankelijk van de exacte versie kunnen deze gezamenlijk circa 2,8 GWh aan energie opslaan en tussen de 720 MW en 1.400 MW aan vermogen leveren. SpaceXAI heeft nog geen volledige technische datasheet gepubliceerd om deze cijfers te bevestigen.

Zo’n batterij van deze omvang kan meerdere functies vervullen: het stabiliseren van de stroomvoorziening, transienten absorberen, pieken in vraag managen of belastingen op specifieke momenten ondersteunen. Het bestaan ervan zegt echter niet alles over de redundantie-architectuur van het centrum, maar toont wel dat de energiesystemen steeds complexer worden.

SpaceXAI zoekt bovendien extra energievoorzieningen via de Tennessee Valley Authority (TVA) terwijl het eigen opwekking blijft ontwikkelen.

De energie-infrastructuur transformationeert daarmee van een relatief simpele opstelling met provisore turbines naar een energiefaciliteit met meerdere bronnen, opslag en netwerkverbindingen.

Verkoop van compute verandert de spelregels

De betrouwbaarheid wordt nog belangrijker omdat SpaceXAI nu Colossus openstelt aan andere bedrijven.

In mei werd aangekondigd dat een overeenkomst werd gesloten om capaciteit van Colossus 1 te leveren aan Anthropic. Volgens SpaceXAI beschikt die installatie over meer dan 220.000 GPU’s NVIDIA, waaronder H100, H200 en GB200-modellen. Anthropic zal deze capaciteit gebruiken voor zijn diensten Claude Pro en Claude Max.

De overeenkomst met Google geeft een duidelijker beeld van de zakelijke consequenties als capaciteit niet op tijd wordt geleverd.

De documenten ingediend bij de SEC stellen dat als SpaceX het afgesproken aantal GPU’s niet vóór 30 september 2026 levert, Google na een wachttijd van een maand de optie heeft om het contract te beëindigen of een lagere hoeveelheid te accepteren met een evenredige korting op de betalingen.

Dit maakt beschikbaarheid tot een financiële kwestie.

Toen Colossus nog voornamelijk interne infrastructuur was voor xAI, kon onderbreking vertragingen en operationele kosten veroorzaken. Nu de infrastructuur wordt verhuurd voor honderdduizenden dollars per maand, wordt de daadwerkelijk beschikbare capaciteit een contractuele verplichting.

Deze transitie verklaart waarom de volgende fase van Colossus minder draait om opnieuw een bouwrecord te halen en meer om een goede balans tussen snelheid, kosten en redundantie te vinden.

SpaceX kent dat dilemma uiteraard al uit de ruimtevaartindustrie.

Hun ruimtevaartstrategie is afhankelijk van systemen die falen kunnen tolereren, afwijkingen opsporen en blijven functioneren met redundante onderdelen. Dat engineers van de raketorganisatie nu betrokken zijn bij de datacenterinfrastructuur, zoals gerapporteerd door The Information, sluit goed aan bij een focus op betrouwbaarheid, hoewel er nog weinig publieke informatie is over concrete wijzigingen.

De schaal lijkt niet te stuiten. SpaceX schat dat de gezamenlijke rekenkracht van Colossus en Colossus II ongeveer 1 GW bedraagt, terwijl het energieaanbod verder wordt uitgebreid om verdere groei mogelijk te maken. Het publieke doel voor Memphis ligt nu rond de één miljoen GPU’s.

Het eerste Colossus toonde dat een bedrijf een oude fabriek kon transformeren in een van de grootste AI-clusters ter wereld in vier maanden. Colossus II bewees dat het proces nog sneller kon.

De volgende uitdaging is nu andere: SpaceXAI moet aantonen dat deze snelle bouwmethodiek ook de beschikbaarheid kan bieden die externe klanten verwachten die tienduizenden GPU’s afnemen.

In AI-infrastructuur geldt: het snel activeren van 100.000 accelerators is een strategisch voordeel; het garanderen dat ze beschikbaar blijven bij falen, is wat ze tot een cloud maakt.

Scroll naar boven