NVIDIA heeft NVHBM geïntroduceerd, een nieuwe high-bandwidth memory-architectuur die de controlecontroller verplaatst van de accelerator naar de basischip van de HBM-stack. Het bedrijf beweert dat deze verandering tot wel 30% meer bandbreedte kan opleveren, het energieverbruik van het geheugen met 15% kan verminderen en tot 25% meer ruimte op de XPU kan vrijmaken ten opzichte van een conventionele implementatie met HBM4E. Deze technologie wordt geïntegreerd in NVLink Fusion en Amazon Web Services (AWS), via Annapurna Labs, dat als eerste partner wordt genoemd die ermee zal werken.
De kernpunten van NVIDIA NVHBM in 20 seconden
- NVHBM integreert de geheugencontroller van NVIDIA direct in de basischip van de driedimensionale HBM-stapel.
- NVIDIA beweert dat het tot wel 30% meer bandbreedte biedt en 15% minder energie verbruikt.
- De wijziging kan tot 25% ruimte op de XPU vrijmaken in vergelijking met standaard HBM4E.
- Meerdere fabrikanten kunnen NVHBM leveren onder een uniforme implementatie.
- Annapurna Labs werkt samen met NVIDIA aan NVHBM en NVLink Fusion voor toekomstige AWS-architecturen.
De aankondiging komt op een moment dat geheugen een van de hoofdcomponenten is die de prestaties van AI-accelerators bepalen. Modellen met honderden miljarden of zelfs biljoenen parameters vereisen enorme datatransfers tussen geheugen en rekenunits, waardoor een toename van FLOPS weinig uitmaakt als de processor wacht op de benodigde gegevens.
NVHBM probeert precies datverhouding tussen computationele kracht en geheugen te veranderen.
De controller verlaat de XPU en komt in de HBM-stack
In een traditionele HBM-architectuur bevindt de geheugencontroller die de communicatie met het geheugen regelt zich binnen de accelerator zelf. Dit betekent dat een deel van de beschikbare siliconen op de XPU gereserveerd moet worden voor geheugenfuncties in plaats van voor rekenunits.
NVIDIA stelt voor dit onderdeel te verplaatsen.
NVHBM integreert de aangepaste NVIDIA-controller binnen de basischip van de driedimensionale HBM-stapel, waardoor het uit de chip van de hoofd-XPU wordt gehaald.
Volgens de gegevens die het bedrijf publiceert, zou de vergelijking met een standaard HBM4E-implementatie er als volgt uitzien:
| Kenmerk | Conventionele HBM4E | NVIDIA NVHBM |
|---|---|---|
| Geheugencontroller | In de XPU | In de basischip van HBM |
| Bandbreedte | Referentie | Tot +30% |
| Energieverbruik HBM | Referentie | Tot -15% |
| Ruimte op de XPU voor controller | In de chip geïntegreerd | Verplaatst naar HBM |
| Extra beschikbare ruimte op de XPU | — | Tot +25% |
| Focus | Conventionele integratie | Semi-aangepaste infrastructuur |
De cijfers zijn schattingen van NVIDIA en moeten nog beoordeeld worden bij concrete producten zodra NVHBM op de markt komt. De vergelijking betekent niet dat elke accelerator automatisch 25% meer prestaties zal behalen: NVIDIA spreekt over vrijgekomen siliciumruimte, niet over extra rekencapaciteit.
Het grote voordeel voor ontwerpers is dat ze kunnen bepalen wat ze met die ruimte doen.
Een fabrikant kan het bijvoorbeeld gebruiken voor meer rekenunits, grotere caches, gespecialiseerde accelerators, of gewoon een efficiëntere XPU ontwerpen.
NVIDIA wil ook de controle over op maat gemaakte chips vergroten
NVHBM krijgt extra betekenis wanneer het onderdeel wordt van NVLink Fusion, de strategie waarmee NVIDIA haar technologie wil toepassen op processors die niet noodzakelijk door haar zelf ontworpen zijn.
Grote cloudproviders ontwikkelen al jaren eigen accelerators om kosten te besparen en hardware af te stemmen op hun workloads. Google heeft TPU’s, AWS ontwikkelt Trainium en Inferentia, Microsoft heeft Maia en Meta werkt aan haar eigen MTIA-accelerators.
Dat kan worden gezien als een bedreiging voor NVIDIA: elke op maat gemaakte accelerator van een hyperscaler betekent dat die workload niet op NVIDIA’s GPU wordt uitgevoerd.
NVLink Fusion biedt een andere mogelijkheid.
In plaats van klanten te dwingen te kiezen tussen een NVIDIA-accelerator of een eigen ASIC, wil NVIDIA dat op maat gemaakte processors gebruik kunnen maken van haar componenten, waaronder NVLink, NVLink-C2C, NVLink Switch, MGX en nu NVHBM.
Het resultaat is een NVIDIA die probeert financieel te participeren in AI-infrastructuur, zelfs wanneer de hoofdprocessor geen NVIDIA-logo draagt.
De strategie wordt gekarakteriseerd als een «verticale integratie en horizontale openheid». Het is belangrijk om het verschil te benadrukken: openheid betekent dat derden processors kunnen integreren in de infrastructuur, maar dan met technologieën ontwikkeld door NVIDIA.
AWS wordt eerste partner voor NVHBM
De eerste aangekondigde samenwerking is bijzonder belangrijk.
Annapurna Labs, de divisie van Amazon die verantwoordelijk is voor een groot deel van het aangepaste silicon van AWS, gaat samenwerken met NVIDIA aan NVHBM en de NVLink-schaalarchitectuur binnen rack-omgevingen.
Deze samenwerking versterkt de eerdere overeenkomst rondom NVLink Fusion. AWS voorziet in het integreren van deze technologie in toekomstige generaties van haar Trainium-accelerators, te beginnen met Trainium4.
Het doel is dat Amazon-chips en NVIDIA GPU’s onderdeel kunnen worden van een gedeelde rack-infrastructuur.
Dit schetst een ander beeld dan enkele jaren geleden. AWS concurreert met NVIDIA door haar eigen accelerators te ontwikkelen, maar kan tegelijkertijd gebruik maken van NVIDIA’s interconnectie- en geheugentechnologieën om heterogene systemen te bouwen.
De infrastructuur die hieruit voortkomt kan verschillende processor-typen combineren afhankelijk van de workload.
De AI-race verschuift naar geheugen
De aankondiging illustreert ook hoe het ontwerp van accelerators verandert.
In de eerste fasen van de AI-ontwikkeling lag de focus vooral op TFLOPS of PFLOPS. Met steeds groter wordende modellen wordt de capaciteit en bandbreedte van geheugen even belangrijk.
HBM gebruikt meerdere lagen DRAM gestapeld en verbonden via extreem brede interfaces. De industrie heeft al stappen gezet van HBM2 naar HBM2E, HBM3 en HBM3E, terwijl HBM4 en latere generaties de integratie verder verhogen.
Het verplaatsen van de controller naar de basischip is een verdere stap: het geheugen wordt niet langer alleen een component verbonden aan de accelerator, maar krijgt ook functies die voorheen bij de processor lagen.
Daarnaast streeft NVIDIA ernaar een gemeenschappelijke implementatie van NVHBM te ontwikkelen die via meerdere geheugenleveranciers beschikbaar is.
Voor ASIC-ontwerpers kan dit de integratie en validatie van verschillende geheugarchitecturen vereenvoudigen. Het stelt NVIDIA ook in staat haar architectuur uit te breiden zonder direct in de DRAM-markt actief te worden.
Van CUDA en GPU’s naar rack-infrastructuur
NVHBM past ook bij de recente evolutie van NVIDIA’s businessmodel.
Het bedrijf heeft onlangs bekendgemaakt dat Data Center ongeveer 92,5% van de omzet in het kwartaal uitmaakt. En in dat segment probeert het niet meer alleen snelste GPU’s te verkopen.
Het aanbod omvat GPU, CPU, netwerken, NVLink, rack-achtige systemen, software en volledige AI-datacenters. Met NVLink Fusion breidt NVIDIA haar strategie uit naar op maat gemaakte accelerators.
| Infrastructuurlagen | NVIDIA-technologieën |
|---|---|
| Computing | GPU, Grace en rack-platforms |
| Geheugen | NVHBM en controllers |
| Schaalvergroting | NVLink en NVLink Switch |
| Chip-naar-chip | NVLink-C2C |
| Netwerken | Spectrum-X en InfiniBand |
| Systeemintegratie | MGX en rack-oplossingen van NVIDIA |
| Software | CUDA en AI-bibliotheken |
| Op maat gemaakte chips | NVLink Fusion |
Dit betekent dat NVIDIA niet meer per se alle processoren binnen een systeem hoeft te fabriceren om haar technologie erin te integreren.
Een hyperscaler kan bijvoorbeeld zelf een XPU ontwerpen en nog steeds gebruik maken van NVLink, NVHBM en andere NVIDIA-technologieën om dat in een rack-infrastructuur te integreren.
Zo kan NVIDIA inspelen op de groei van op maat gemaakte siliciumchips zonder daar overal in te hoeven investeren.
De belangrijkste vraag wordt nu: hoeveel van die 30% meer bandbreedte en 15% energiebesparing behouden blijft zodra NVHBM in commercial products wordt toegepast, en welke geheugenfabrikanten aansluiten bij de standaard.
Maar het signaal is duidelijk: de infrastructuur van AI wordt minder afhankelijk van het fabriceren van de snelste GPU’s en meer van wie de communicatie tussen rekenkracht, geheugen en honderden accelerators binnen één systeem beheert.
Veelgestelde vragen
Wat is NVIDIA NVHBM?
NVHBM is een high-bandwidth geheugenstechnologie die NVIDIA’s aangepaste controller direct integreert in de basischip van de HBM-stapel, in plaats van deze binnen de XPU te houden.
Welke voordelen biedt NVHBM ten opzichte van HBM4E?
NVIDIA beweert dat het tot 30% meer bandbreedte kan leveren, 15% minder energie verbruikt en tot 25% meer ruimte op de XPU kan vrijmaken in vergelijking met een conventioneel HBM4E-ontwerp.
Wordt NVHBM exclusief gebruikt door NVIDIA GPU’s?
Nee, de aankondiging richt zich op NVLink Fusion en door derden ontworpen processors. NVIDIA geeft aan dat een gezamenlijke standaard zal ontstaan die door meerdere geheugenleveranciers wordt ondersteund.
Hoe verhoudt AWS zich tot NVHBM?
Annapurna Labs, de divisie van Amazon verantwoordelijk voor veel van AWS’s custom silicon, zal samenwerken met NVIDIA aan NVHBM en de NVLink-schaalarchitectuur binnen rack-omgevingen.
Deze samenwerking bouwt voort op eerdere overeenkomsten over NVLink Fusion. AWS plant om deze technologie in toekomstige generaties van haar Trainium-accelerators te integreren, te beginnen met Trainium4.
Het doel is dat Amazon-silicon en NVIDIA-GPU’s kunnen functioneren binnen één gedeelde rack-infrastructuur.
Zo ontstaat een ander scenario dan enkele jaren geleden. AWS concurreert met NVIDIA door eigen accelerators te ontwikkelen, maar kan tegelijkertijd gebruik maken van NVIDIA’s interconnectie- en geheugentechnologieën om heterogene systemen te bouwen.
De infrastructuur die hieruit voortkomt, kan verschillende processorsamenstellingen combineren afhankelijk van de workload.
De AI-oorlog verschuift naar geheugen
De aankondiging illustreert ook hoe het ontwerp van accelerators verandert.
In de beginfase van AI-ontwikkeling lag de nadruk vooral op TFLOPS of PFLOPS, maar naarmate modellen groter worden, worden capaciteit en bandbreedte van geheugen even belangrijk.
HBM gebruikt meerdere lagen DRAM gestapeld en verbonden via zeer brede interfaces. De industrie heeft al stappen gezet van HBM2 naar HBM2E, HBM3 en HBM3E, terwijl HBM4 en latere generaties de integratie verder verbeteren.
Het verplaatsen van de controller naar de basischip is een verdere ontwikkeling: geheugen wordt niet alleen een component verbonden aan de accelerator, maar krijgt ook functies die voorheen bij de processor hoorden.
Daarnaast streeft NVIDIA ernaar een gemeenschappelijke NVHBM-implementatie te ontwikkelen die door meerdere geheugenfabrikanten kan worden aangeboden.
Voor ASIC-ontwerpers kan dit de integratie en validatie van diverse geheugenoplossingen vereenvoudigen. Het stelt NVIDIA ook in staat haar architectuur verder uit te breiden zonder direct in de DRAM-productie te investeren.
Van CUDA en GPU’s naar rack-infrastructuur
NVHBM past goed bij de recente evolutie van het NVIDIA-ecosysteem.
NVIDIA heeft recent aangekondigd dat Data Center ongeveer 92,5% van haar kwartaalomzet uitmaakt. En in dat segment beperkt het zich niet tot het verkopen van de snelste GPU’s.
Het aanbod omvat GPU’s, CPU’s, netwerken, NVLink, rack-achtige systemen, software en complete AI-centra. Met NVLink Fusion wil NVIDIA haar strategie verder uitbreiden naar op maat gemaakte accelerators.
| Infrastructuurniveaus | NVIDIA-technologieën |
|---|---|
| Computing | GPU, Grace en rack-oplossingen |
| Geheugen | NVHBM en controllers |
| Schaalvergroting | NVLink en NVLink Switch |
| Chip-naar-chip | NVLink-C2C |
| Netwerken | Spectrum-X en InfiniBand |
| Systeemintegratie | MGX en rack-architecturen |
| Software | CUDA en AI-libraries |
| Op maat gemaakte chips | NVLink Fusion |
Hieruit blijkt dat NVIDIA niet meer per se alle processoren in een systeem hoeft te produceren om haar technologie te integreren.
Een hyperscaler kan bijvoorbeeld zelf een XPU ontwerpen en gebruik maken van NVLink, NVHBM en andere NVIDIA-technologieën om dat te integreren in een rack-omgeving.
Zo kan NVIDIA blijven inspelen op de groei van eigen siliciumchips zonder overal in te moeten investeren.
De belangrijkste vraag wordt nu: hoeveel van die 30% extra bandbreedte en 15% energiebesparing wordt daadwerkelijk gerealiseerd zodra NVHBM in commerciële producten wordt toegepast, en welke geheugenfabrikanten zich bij de standaard aansluiten.
Maar de boodschap is duidelijk: de AI-infrastructuur verschuift van het simpelweg bouwen van de snelste GPU’s naar het versterken van de communicatie tussen compute, geheugen en honderden accelerators binnen één systeem.
Veelgestelde vragen
Wat is NVIDIA NVHBM?
NVHBM is een high-bandwidth geheugentechnologie die NVIDIA’s aangepaste controller direct integreert in de basischip van de HBM-stapel, in plaats van binnen de XPU zelf.
Welke voordelen biedt NVHBM tegenover HBM4E?
NVIDIA claimt dat het tot 30% meer bandbreedte kan leveren, 15% minder energie verbruikt en tot 25% meer ruimte vrijmaakt op de XPU dan een conventioneel HBM4E-ontwerp.
Wordt NVHBM exclusief gebruikt door NVIDIA GPU’s?
Nee, de strategie richt zich op NVLink Fusion en op derde partijen ontworpen processors. NVIDIA verwacht dat een gezamenlijke standaard zal ontstaan die door meerdere geheugenleveranciers wordt ondersteund.
Hoe hangt AWS samen met NVHBM?
Annapurna Labs, de AWS-divisie voor custom silicon, zal samenwerken met NVIDIA aan NVHBM en de NVLink-schaalarchitectuur binnen rack-omgevingen.
Deze samenwerking bouwt voort op eerdere afspraken over NVLink Fusion. AWS plant om deze technologie te integreren in toekomstige generaties van haar Trainium-accelerators, te beginnen met Trainium4.
Het doel is dat Amazon-chips en NVIDIA-GPU’s binnen één gedeelde rack-infrastructuur functioneren.
Dit schetst een ander toekomstbeeld dan enkele jaren geleden, waarin AWS haar eigen accelerators ontwikkelde, maar ook gebruik kan maken van NVIDIA’s interconnectie- en geheugentechnologieën om heterogene systemen te bouwen.
De infrastructuur die hieruit voortkomt kan verschillende procesortypen combineren afhankelijk van de workload.
De AI-wereld verschuift richting geheugen
De aankondiging laat zien hoe het ontwerp van accelerators verschuift.
In de beginjaren van AI lag de nadruk vooral op TFLOPS of PFLOPS. Naarmate modellen groter worden, zijn capaciteit en bandbreedte van geheugen even belangrijk.
HBM bestaat uit meerdere gestapelde DRAM-lagen die via extreem brede interfaces verbonden zijn. De industrie heeft al stappen gezet van HBM2 naar HBM2E, HBM3 en HBM3E, terwijl HBM4 en latere generaties de integratie nog verder verbeteren.
Het verplaatsen van de controller naar de basischip betekent een nieuwe stap: geheugen wordt niet langer beperkt tot een component verbonden aan de accelerator, maar krijgt ook functies die voorheen bij de processor hoorden.
Bovendien streeft NVIDIA ernaar een algemene NVHBM-implementatie te ontwikkelen die door meerdere geheugentoezitters kan worden aangeboden.
Voor ASIC-ontwerpers kan dit de integratie en validatie van verschillende geheugensystemen vereenvoudigen. Het stelt NVIDIA bovendien in staat haar architectuur uit te breiden zonder direct in de DRAM-productie te investeren.
Van CUDA en GPU’s naar rack-infrastructuur
NVHBM sluit ook aan bij de recente veranderingen in het strategie- en businessmodel van NVIDIA.
NVIDIA kondigde onlangs aan dat Data Center ongeveer 92,5% van haar kwartaalomzet uitmaakt. In dat segment verkoopt het niet meer alleen snelste GPU’s.
Het aanbod omvat GPU’s, CPU’s, netwerktechnologieën, NVLink, rack-infrastructuren, software en volledige AI-datacenters. Met NVLink Fusion wil NVIDIA haar strategie verder uitbreiden naar op maat gemaakte accelerators.
| Infrastructuurlaag | NVIDIA-technologieën |
|---|---|
| Computing | GPU, Grace en rack-platforms |
| Memory | NVHBM en controllers |
| Schaalvergroting | NVLink en NVLink Switch |
| Chip-to-chip verbinding | NVLink-C2C |
| Netwerkverbindingen | Spectrum-X en InfiniBand |
| Systeemintegratie | MGX en rack-oplossingen |
| Software | CUDA en AI-bibliotheken |
| Op maat gemaakte chips | NVLink Fusion |
Hieruit blijkt dat NVIDIA niet meer per se alle processoren in een systeem hoeft te ontwerpen om haar technologieën te integreren.
Een hyperscaler kan bijvoorbeeld zelf een XPU ontwikkelen en nog steeds gebruik maken van NVLink, NVHBM en andere NVIDIA-technologieën om dat in een rack-omgeving te integreren.
Zo kan NVIDIA inspelen op de groei van eigen silicium, zonder overal zelf te investeren.
De grote vraag wordt nu: hoeveel van die 30% extra bandbreedte en 15% energiebesparing behouden blijft zodra NVHBM in commerciële producten wordt toegepast, en welke geheugenfabrikanten aansluiten bij de standaard.
Maar het signaal is duidelijk: de AI-infrastructuur verschuift van het simpelweg bouwen van snelste GPU’s naar het optimaliseren van communicatie tussen computationele eenheden, geheugen en honderden accelerators binnen één systeem.
Veelgestelde vragen
Wat is NVIDIA NVHBM?
NVHBM is een high-bandwidth geheugentechnologie die NVIDIA’s aangepaste controller direct integreert in de basischip van de HBM-Stack, in plaats van binnen de XPU zelf.
Welke voordelen biedt NVHBM ten opzichte van HBM4E?
NVIDIA beweert dat het tot 30% meer bandbreedte kan leveren, 15% minder energie verbruikt en tot 25% meer ruimte op de XPU vrijmaakt in vergelijking met een conventioneel HBM4E-ontwerp.
Wordt NVHBM exclusief gebruikt door NVIDIA GPU’s?
Nee, de strategie richt zich op NVLink Fusion en third-party processors. NVIDIA geeft aan dat een gezamenlijke standaard zal worden ontwikkeld die door meerdere geheugenleveranciers wordt ondersteund.
Wat is de relatie tussen AWS en NVHBM?
Annapurna Labs, de AWS-divisie verantwoordelijk voor een groot deel van het custom silicon van AWS, zal samenwerken met NVIDIA aan NVHBM en de NVLink-schaalarchitectuur binnen rack-omgevingen.
Deze samenwerking verbindt zich met eerdere afspraken over NVLink Fusion. AWS plant om deze technologie te verwerken in toekomstige generaties Trainium-accelerators, te beginnen met Trainium4.
Het uiteindelijke doel is dat Amazon-chips en NVIDIA-GPU’s kunnen functioneren binnen één gedeelde rack-infrastructuur.
Zo ontstaat een toekomstbeeld waarin OEM’s en hyperscalers flexibeler kunnen samenwerken, zonder volledige afhankelijkheid van één leverancier.
