Featherless AI heeft in Europa een dedicated servercluster van NVIDIA DGX B300 in productie genomen om de capaciteit van hun inferentietechnologie uit te breiden. Deze infrastructuur biedt via een enkele API toegang tot meer dan 40.000 open-source AI-modellen. De infrastructuur is uitgerold in een Tier III datacenter van České Radiokomunikace (CRA) in Tsjechië, met Era Compute als tussenpersoon en projectcoördinator.
De kernpunten van de Featherless AI-implementatie in 30 seconden
- Featherless AI vroeg in juli gedediceerde capaciteit aan op basis van NVIDIA DGX B300 en begon deze begin augustus te gebruiken.
- Era Compute meldt dat het volledige proces minder dan een maand heeft geduurd.
- Elke DGX B300 bevat acht Blackwell Ultra GPU’s met 288 GB HBM3e geheugen per GPU.
- De infrastructuur is gehuisvest in een Tier III-faciliteit van CRA in Tsjechië en is uitsluitend bestemd voor inferentie-opdrachten.
- Featherless AI bedient momenteel meer dan 40.000 open modellen en zoekt aanvullende capaciteit in Europa.
Dit project weerspiegelt een bredere verandering in AI-infrastructuur. Toegang tot de meest geavanceerde GPU’s is niet langer exclusief voor grote Amerikaanse cloudproviders. Europese datacenters integreren nu NVIDIA Blackwell-systemen om direct aan bedrijven te leveren die gereserveerde capaciteit nodig hebben.
In dit geval zocht Featherless AI precies het tegenovergestelde van gedeelde GPU’s op aanvraag: ze hadden fysieke, gereserveerde capaciteit voor productie-inferentie.
De aanvraag kwam in juli 2026 bij Era Compute binnen. Het bedrijf zocht capaciteit bij haar partners en vond beschikbaarheid bij CRA. Volgens de case study van Era Compute begon het cluster begin augustus met echte werkbelastingen, minder dan een maand na de initiële aanvraag.
Acht Blackwell Ultra GPU’s en 2,3 TB HBM3e per DGX B300
De keuze voor NVIDIA DGX B300 positioneert dit project onder de krachtigste GPU-implementaties die momenteel beschikbaar zijn op de markt.
Elke node bevat acht NVIDIA Blackwell Ultra GPU’s, met 288 GB HBM3e geheugen per accelerátor. Samen biedt dit meer dan 2,3 TB aan HBM3e-geheugen per systeem, wat vooral belangrijk is bij het werken met grote modellen of workloads die uitgebreide contexten vereisen.
Featherless AI gebruikt deze systemen voor inferentie: het uitvoeren van vooraf getrainde modellen en het beantwoorden van verzoeken van gebruikers en applicaties.
Het exacte aantal nodes in het cluster is niet publiekelijk bekend, waardoor de totale GPU-capaciteit en systeemkracht niet betrouwbaar kunnen worden berekend. Era Compute beschrijft de infrastructuur als een dedicated DGX B300-cluster.
Het verschil met het huren van reguliere GPU-instanties ligt in de reservering van resources.
Featherless AI wil anticiperen op de vraag van haar klanten en garandeert beschikbaarheid van accelerators. Hun zakelijke aanbod omvat ook dedicated GPU’s, waaronder capaciteit gebaseerd op B300.
Het bedrijf gebruikt een model hot-swapping-architectuur waarmee modellen binnen seconden kunnen worden gewisseld op een gedeelde GPU-flotte. Dit systeem helpt de complexe en kostbare taak te verklaren dat meer dan 40.000 modellen beschikbaar kunnen zijn zonder dat ze permanent in GPU-geheugen geladen hoeven te blijven: meer dan 40.000 modellen betekent niet dat alle modellen altijd in geheugen staan.
De platform load en vervangt modellen afhankelijk van de behoefte.
Featherless AI is ook officieel inferentieprovider voor Hugging Face en werd opgericht door leden van het team achter de RWKV-architectuur. In april 2026 kondigde het een Series A-ronde van 20 miljoen dollar aan, geleid door AMD Ventures en Airbus Ventures.
Tsjechië als belangrijke locatie voor AI-infrastructuur
De fysieke infrastructuur bevindt zich bij České Radiokomunikace (CRA), een van de belangrijkste Tsjechische telecom- en broadcastoperatoren.
CRA beheert 655 communicatietorens en heeft een GPU-divisie met NVIDIA Blackwell-systemen. Volgens Era Compute bevindt de Featherless-implementatie zich in een gecertificeerd Tier III-datacenter.
Deze keuze onderstreept het toenemende belang van geografische locatie in beslissingen over AI-infrastructuur.
Een Europees bedrijf kan modellen draaien via een API vanuit een ander continent, GPU’s huren in een publieke cloud, of reserveringen maken in fysiek lokale infrastructuur binnen Europa.
Deze opties verschillen zowel technisch als zakelijk.
De Europese locatie kan vooral aantrekkelijk zijn voor organisaties die belang hechten aan dataverwerking binnen Europa, lage latentie, controle over infrastructuur of eigen beleidsregels voor technologische soevereiniteit. Toch betekent het hosten van servers in Europa niet automatisch dat een dienst ‘sovereinere AI’ wordt: de soevereiniteit hangt ook af van controle over systemen, software, data en operaties.
In het Featherless-project is er bovendien een internationale samenwerking. NVIDIA levert de accelerators, Featherless AI heeft Amerikaanse roots, CRA biedt de fysieke faciliteiten en operationele capaciteit in Tsjechië, en Era Compute verbindt vraag en aanbod in infrastructuur.
Van GPU zoeken naar productiegebruik binnen minder dan een maand
Een van de punten die Era Compute benadrukt, is de snelheid van de implementatie.
Volgens hun case study begon Featherless in juli met de vraag naar capaciteit, en begin augustus liep het cluster al voor productie.
Era Compute wijt de korte doorlooptijd aan het feit dat CRA al onderdeel was van haar netwerk en er al een bestaande contractuele basis lag.
Dit voorkwam dat het hele acquisitieproces vanaf nul moest worden gestart. Na het vinden van een passende configuratie die aan de eisen voldeed, konden de partijen rechtstreeks door naar documentatie en deploymentplanning.
Era Compute fungeert als een gespecialiseerde tussenlaag voor GPU-infrastructuur.
Ze onderhouden informatie over configuraties, beschikbaarheid, prijzen en locaties van verschillende operators. Bij een verzoek proberen ze dit te matchen met beschikbare infrastructuur binnen hun netwerk.
Voor datacenters betekent dit dat ze proberen de inverse uitdaging op te lossen: high-end AI-servers aanschaffen vergt grote investeringen en het garanderen van ruimte, stroom en koeling garandeert niet dat ze direct kunnen worden verhuurd.
Era Compute wil deze capaciteit koppelen aan bedrijven die GPU-ruimte nodig hebben onder voorafgaande voorwaarden en tijdschema’s.
Volgens CRA heeft het project ervoor gezorgd dat beschikbare datacenter-capaciteit werd omgezet in een GPU-als-service-contract zonder dat er een volledig commercieel traject vooraf moest worden ontwikkeld met Featherless.
Er zijn echter geen details bekendgemaakt over de contractwaarde, de looptijd, het aantal geïnstalleerde DGX B300’s of de maandelijkse kosten. Deze gegevens zouden helpen om het project economisch te vergelijken met publieke cloudalternatieven of gespecialiseerde providers.
Het lijkt erop dat de eerste installatie niet het einde is van de inzet. Era Compute zoekt al naar aanvullende capaciteit voor Featherless AI bij haar partners.
Deze marktontwikkeling past bij de evolutie in inferentie: grote modellen worden getraind met enorme GPU-hoeveelheden voor beperkte perioden, maar later moeten ze continu beschikbaar zijn voor miljoenen gebruikers, waardoor inferentie een permanente belasting wordt.
Platforms zoals Featherless vereisen een capaciteit die niet alleen draait om een paar commerciële modellen, maar die toegang biedt tot tienduizenden open modellen via één API.
Dit vergt een combinatie van GPU-capaciteit, geheugen, opslag en mechanismen voor snel laden en verwijderen van modellen.
De DGX B300 levert hierbij een bijzonder hoge hoeveelheid HBM3e-geheugen, en CRA faciliteert de fysieke Europese infrastructuur, terwijl Era Compute een tussenlaag biedt tussen vraag en aanbod.
De uitkomst is een voorbeeld van hoe de markt voor AI-infrastructuur zich ontwikkelt tussen de traditionele hypermarkt en directe serveraankoop: dedicated GPU-clusters, gehuurd als capaciteit en gehost in Europese datacenters, met gereserveerde resources voor één platform.
Veelgestelde vragen
Wat is Featherless AI?
Featherless AI is een inferentieplatform dat via één API toegang biedt tot meer dan 40.000 open-source modellen, en daarnaast gereserveerde GPU-capaciteit aanbiedt voor zakelijke klanten.
Welke GPU wordt gebruikt in het nieuwe Featherless AI-cluster?
De infrastructuur is gebaseerd op NVIDIA DGX B300. Elke node bevat acht Blackwell Ultra GPU’s met 288 GB HBM3e geheugen per accelerátor.
Waar zijn de NVIDIA DGX B300’s geïnstalleerd?
Het cluster bevindt zich in Tier III-faciliteiten beheerd door České Radiokomunikace (CRA) in Tsjechië.
Hoeveel GPU B300’s heeft het cluster?
De bedrijven hebben het totale aantal geïnstalleerde DGX B300’s niet bekendgemaakt. Daarom is het niet mogelijk om exact het volledige GPU-aantal te bepalen.
vía: era.dev
