IBM en Together AI hebben een meerjarige overeenkomst ondertekend ter waarde van 240 miljoen dollar voor het inzetten op IBM Cloud van een grootschalig NVIDIA-infrastructuurcluster dat specifiek bedoeld is voor AI-inferentie. Het platform zal gebruikmaken van NVIDIA HGX B300-systemen met GPU Blackwell Ultra en Spectrum-X Ethernet-netwerken, met een geplande beschikbaarheid in het eerste kwartaal van 2027.
De kernpunten van de overeenkomst tussen IBM en Together AI in 30 seconden
- De meerjarige overeenkomst tussen IBM en Together AI bedraagt 240 miljoen dollar.
- IBM zal een cluster van NVIDIA HGX B300-systemen inzetten op IBM Cloud, gepland voor het eerste kwartaal van 2027.
- Together AI zal de infrastructuur vooral gebruiken voor het in productie nemen van open models.
- Het bedrijf verwerkt momenteel ongeveer 400 biljoen tokens per maand.
- De overeenkomst onderstreept de toenemende focus op inferentie ten opzichte van modeltraining binnen AI-infrastructuur.
Deze samenwerking brengt drie marktsegmenten samen: IBM levert de cloud-infrastructuur en haar vermogen om bedrijfsomgevingen te beheren; NVIDIA voorziet de geavanceerde hardware en netwerken die de GPU’s verbinden; en Together AI brengt haar inferentie-, training-, finetuning- en agentgerichte workloads in, met behulp van haar platform.
Volgens IBM zal dit resulteren in het eerste grootschalige inferentiecluster gebouwd op IBM Cloud met HGX B300-systemen.
Het aantal servers en GPU’s dat deel uitmaakt van het cluster is niet bekendgemaakt, daardoor kunnen de 240 miljoen dollar contractkosten niet rechtstreeks worden vertaald naar specifieke hardwarecapaciteit of rekenkracht.
NVIDIA B300 voor een groeiende infra-invloed in inferentie
De keuze voor NVIDIA HGX B300-systemen geeft inzicht in de richting waarin investeringen in AI zich ontwikkelen.
Elk HGX B300-systeem beschikt over acht NVIDIA B300 Blackwell Ultra GPU’s, verbonden via NVLink en NVSwitch van de vijfde generatie. NVIDIA’s technische documentatie vermeldt 288 GB HBM3e-geheugen per GPU, wat het totale geheugen per systeem op ongeveer 2,3 TB brengt. De interne connectiviteit biedt een totaalbandbreedte van 14,4 TB/s.
Ook de netwerkinfrastructuur speelt een essentiële rol. NVIDIA combineert HGX B300 met ConnectX-8 en Spectrum-X Ethernet om clusters te bouwen waarin GPU’s grote hoeveelheden data kunnen uitwisselen met lage latency.
Volgens NVIDIA wordt in haar referentie-architectuur configuraties voorzien van 32, 64 en 128 knooppunten, wat overeenkomt met respectievelijk 256, 512 en 1024 GPU’s B300. Elke GPU kan beschikken over Ethernet-verbindingen tot 800 Gb/s via ConnectX-8.
Het is niet officieel bekend of het IBM/Together AI-cluster deze configuraties zal gebruiken. De grootte van het systeem is niet gedeeld, maar de specificaties geven wel een goed beeld van het soort infrastructuur dat ze aan het voorbereiden zijn.
Grootschalige inferentie draait niet meer enkel om het laden van een model op enkele GPU’s en het afhandelen van verzoeken. Complexe reasoning-modellen, uitgebreide contexten, agent-gebaseerde toepassingen en hoge gebruikersaantallen verhogen de eisen aan geheugen, communicatie en rekenkracht.
NVIDIA beweert dat haar huidige HGX-architecturen specifiek ontworpen zijn voor een goede mix van modeltraining en inferentie van middelgrote tot grote modellen.
Together AI verwerkt al 400 biljoen tokens per maand
Voor Together AI betekent de nieuwe infrastructuur een groei in capaciteit tijdens een periode van snelle expansie van hun inferentiediensten.
Het bedrijf geeft aan dat het momenteel ongeveer 400 biljoen tokens per maand verwerkt, oftewel 400 trillion tokens in de numerieke schaal die in het Spaans wordt gebruikt.
Founded in 2022, heeft Together AI zich gespecialiseerd in infrastructuur en diensten voor open modellen. Hun platform omvat inferentie, training, fine-tuning en agent gebaseerde toepassingen.
Recentelijk sloot Together AI een Series C-ronde af van 800 miljoen dollar, met een waardering van 8,3 miljard dollar, volgens IBM-gegevens die in het persbericht werden genoemd.
De dedicated infrastructuur biedt ook meer controle over een van de grootste kostenfactoren voor inferentie-aanbieders: de kosten per gegenereerde token.
Wanneer miljoenen verzoeken dezelfde GPU’s gebruiken, kunnen kleine verbeteringen in efficiëntie, geheugenbeheer, batching, netwerken of software grote impact hebben op de uiteindelijke kosten van de dienst.
Together AI verkoopt al verschillende generaties NVIDIA GPU’s. In augustus 2026 biedt het onder andere H100, H200 en B200 aan, terwijl HGX B300-systemen op aanvraag beschikbaar zijn.
Infra-inzet wordt opnieuw het strijdtoneel in AI
De overeenkomst illustreert hoe de investeringsfocus in AI verschuift.
In de beginjaren van de huidige generatie generatieve AI lag de nadruk op het bouwen en trainen van steeds grotere modellen. Nu verschuift het massaal inzetten van deze modellen meer naar de inferentie, waarbij een steeds groter deel van de infrastructuurvraag ligt.
Elke aanvraag van een virtuele assistent, zakelijk platform of agent vergt rekenkracht. Bij tientallen miljarden tokens wordt de performance per GPU en de kosten per token cruciaal voor de economische haalbaarheid.
Samen kiezen Together AI, IBM en NVIDIA voor deze route, door te investeren in GPU-capaciteit die meegroeit met hun groei en door de kosten per token te optimaliseren.
IBM versterkt hiermee haar positie als AI-infrastructuurleverancier, waarbij een hybride strategie centraal staat — combineren van eigen datacenters, cloud en bedrijfssoftware.
De samenwerking bouwt voort op eerdere projecten tussen IBM en NVIDIA, waaronder aangekondigde initiatieven in maart 2026 voor geavanceerde GPU-versnelling van analytics, ongestructureerde data en AI-infrastructuur in zowel privé- als cloud-omgevingen.
Together AI voegt nu een gespecialiseerde laag toe voor het uitvoeren van open modellen.
In tegenstelling tot het huren van GPU’s op afroep, biedt dit contract dedicated capaciteit op grote schaal voor meerdere jaren, wat Together AI meer voorspelbaarheid geeft voor de groei van haar diensten.
Indien alles volgens planning verloopt, zal het systeem in het eerste kwartaal van 2027 in productie gaan. Tot die tijd blijven enkele cruciale details ongewisseld, zoals het aantal HGX B300-systemen, het totale GPU-deel, de locatie, de elektrische capaciteit en de maximale inferentiecapaciteit.
Veelgestelde vragen
Hoeveel is de overeenkomst tussen IBM en Together AI waard?
De meerjarige overeenkomst, ter waarde van 240 miljoen dollar, richt zich op het inzetten van AI-infrastructuur op IBM Cloud voor de diensten van Together AI.
Welke GPU zal het cluster gebruiken?
Het cluster zal gebaseerd zijn op NVIDIA HGX B300-systemen, waarin elke systeem acht B300 Blackwell Ultra GPU’s bevat. Het exacte aantal knooppunten en GPU’s is nog niet bekendgemaakt.
Waarvoor zal Together AI deze infrastructuur gebruiken?
Voor vooral het uitvoeren van inferentie op open modellen op grote schaal. Daarnaast biedt Together AI ook diensten voor training, finetuning en agent-gebaseerde applicaties.
Wanneer wordt het cluster operationeel?
IBM verwacht dat het beschikbaar zal zijn in het eerste kwartaal van 2027. De firma benadrukt dat plannen kunnen veranderen en dat deze plannen doelen zijn.
via: newsroom.ibm
