SanDisk wil NAND samen met AI-GPU’s brengen, maar HBF vervangt niet HBM

SanDisk streeft ernaar een nieuwe categorie geheugen voor artificiële intelligentie te introduceren met High Bandwidth Flash (HBF), een technologie die grote hoeveelheden NAND dicht bij de versnellingskaarten wil brengen zonder de kosten en capaciteitbeperkingen van HBM-geheugen. Na de presentatie tijdens de Investor Day op 13 augustus kreeg deze aanpak meer aandacht, hoewel sommige vergelijkingen die het bedrijf gebruikte tot technische kritiek hebben geleid: HBF kan veel capaciteit leveren, maar de eigenschappen verschillen sterk van die van DRAM in HBM.

De kernpunten van SanDisks HBF in 20 seconden

  • HBF gebruikt gestapelde NAND-geheugen om honderden GB dicht bij AI-versnellingskaarten te brengen.
  • SanDisk en SK hynix werken aan standaardisatie binnen het Open Compute Project (OCP).
  • Het belangrijkste doel is het opslaan van modelgewichten tijdens inferentie, niet het volledig vervangen van HBM.
  • NAND biedt veel capaciteit, maar heeft hogere latentie en beperkingen op schrijfbewerkingen.
  • De eerste HBF-voorbeelden maken al deel uit van de roadmaps van SanDisk.

Deze aanpak is een reactie op een probleem dat het ontwerp van AI-servers begint te beïnvloeden: meer FLOPS zijn niet altijd nodig. Bij veel inferentietaken ontbreekt het vooral aan voldoende geheugen om grotere modellen dicht bij de processor te houden.

High Bandwidth Memory (HBM) pakt het bandbreedteprobleem goed aan, maar is duur en de capaciteit wordt beperkt door het aantal en de grootte van de stacks rond de processor.

HBF probeert een andere benadering te vinden.

Van 192 GB HBM tot meerdere terabytes flash naast de versneller

De opzet van SanDisk houdt in dat enkele van de ideeën uit de HBM-structuur worden toegepast op NAND-geheugen.

HBF stapelt talloze flash-dies en benut een hoge mate van parallelisme om de bandbreedte aanzienlijk te vergroten ten opzichte van een conventionele SSD. SanDisk gebruikt daarnaast technologieën zoals CBA (CMOS directly Bonded to Array) om de besturing close bij de NAND-array te brengen.

De fundamentele verschillen blijven echter liggen in de geheugencellen zelf.

HBM gebruikt DRAM, terwijl HBF NAND gebruikt.

DRAM biedt minder capaciteit per oppervlak en vereist constante voeding om data te behouden, maar heeft veel lagere latentie. NAND is langzamer, maar wel veel dichter, goedkoper en persistent.

Dit maakt het mogelijk om architecturen voor te stellen met honderden gigabytes of zelfs meerdere terabytes rondom een AI-versneller.

Tijdens de Investor Day van SanDisk in 2025 illustreerde het bedrijf dat een configuratie met acht stacks HBM ongeveer 192 GB bood, terwijl acht HBF-apparaten samen 4.096 GB (4 TB) bereikten.

Later verduidelijkte SanDisk dat een enkele HBF-stack van 16 dies ongeveer 512 GB kan leveren. Internere simulaties suggereren dat HBF zelfs dicht in de buurt kan komen van het prestatieniveau van een onbeperkte HBM-capaciteit, bijvoorbeeld bij het uitlezen van de gewichten van het Llama 3.1 405B-model.

Een belangrijke kanttekening is dat dit gebaseerd is op simulaties door SanDisk voor een specifiek gebruiksscenario en niet op commercieel verkrijgbare producten.

De potentie is duidelijk.

Een model dat enorm veel gewichten vereist, kan dichterbij de processor blijven zonder dat er dure HBM-stacks of extra versnellers nodig zijn enkel om meer geheugen te bieden.

HBF is zinvol voor modelgewichten; de KV-cache stelt een andere uitdaging

Een nuance die sommige vergelijkingen tussen HBF en HBM kunnen verdoezelen, is dat tijdens inferentie van een taalmodel verschillende soorten gegevens in het geheugen bestaan, met elk hun eigen patronen van toegang.

Aan de ene kant staan de modelgewichten, de geleerde parameters uit training. Bij inferentie worden deze voornamelijk gelezen.

Voor dit gebruik is NAND zeer aantrekkelijk.

Aan de andere kant is er de KV-cache (key-value cache) die tijdens inferentie wordt gegenereerd, en info bewaart over tokens die al verwerkt zijn om herberekeningen te minimaliseren. Dit groeit mee met de context en inkomende verzoeken.

Dit impliceert vooral schrijfbewerkingen.

Hier ligt een inherente beperking voor HBF ten opzichte van HBM: NAND heeft een beperkt aantal schrijfbegrepen en hogere latentie voor schrijfbewerkingen.

Het hoge parallelisme van HBF kan de gecombineerde read-bandbreedte sterk verhogen, maar verandert niets aan de fysieke eigenschappen van NAND-cellen.

Daarom wordt HBF waarschijnlijk beter gezien als een nieuw niveau in de geheugentrap dan als een volledige vervanging voor HBM.

SK hynix beschrijft HBF als een nieuwe laag tussen HBM en SSD; SanDisk spreekt over technologie die vooral gericht is op inferentie.

Toekomstige systemen zouden bijvoorbeeld data met extreem snelle en frequente toegang in HBM houden, terwijl HBF enorme hoeveelheden gewichten zou kunnen bewaren.

Deze scheiding is vooral interessant voor modellen met Expert Mixture (MoE), waar slechts een deel van de parameters tegelijk wordt geactiveerd voor een token.

Het bandbreedteverhaal vereist context

Een ander punt van discussie betreft de vergelijkingen van SanDisk tussen HBF en HBM.

Het bedrijf gebruikte referentiescenario’s met 192 GB HBM, terwijl de ontwikkelingen doorgaan en zowel de capaciteit als de bandbreedte blijven groeien.

Vergelijken met een toekomstige geheugenstandaard zonder duidelijk te specificeren welke generatie wordt bedoeld, kan een incompleet beeld geven.

Hetzelfde geldt voor de numerieke precisie van modellen.

BF16 (Brain Floating Point 16) wordt vaak gebruikt om eenvoudig aan te tonen hoeveel geheugen de modelparameters innemen, maar moderne inferenties gebruiken vaak lagere precisies zoals FP8, INT8 of FP4, afhankelijk van hardware en model.

Lagere precisie vermindert de benodigde geheugenruimte voor gewichten.

Een model met 400 miljard parameters zou ongeveer 800 GB vereisen bij BF16 (2 bytes per parameter). Bij 4 bits per parameter daalt dat theoretisch naar ongeveer 200 GB, exclusief schaling, metadata en overhead.

Dit verandert de omvang van het geheugenprobleem dat HBF probeert op te lossen, maar de mate van het probleem wijzigt aanzienlijk.

Ook moet een onderscheid worden gemaakt tussen bandbreedte en latentie.

SanDisk en SK hynix werken aan specificaties voor HBF met configuraties tot 512 GB per apparaat en bandbreedtes die meerdere TB/s kunnen bereiken. De recente bekendmaking noemt waarden tussen 0,4 en 3 TB/s, afhankelijk van configuratie.

Dat is enorm voor flash-geheugen.

Maar het bereiken van meerdere TB/s door duizenden NAND-operaties parallel te schakelen, maakt een NAND-cel niet gelijk aan DRAM. Latentiegevoelige toepassingen kunnen zich anders gedragen, ook al lijkt de totale bandbreedte vergelijkbaar.

SanDisk en SK hynix streven naar een standaard voor HBF

HBF is niet alleen een intern project van SanDisk.

SanDisk en SK hynix ondertekenden in augustus 2025 een overeenkomst om samen aan specificaties te werken. In februari 2026 richtten ze een werkgroep op binnen het Open Compute Project (OCP) om de standaardisatie verder vorm te geven.

Dit is belangrijk omdat een nieuwe geheugentechnologie meer vereist dan alleen chips.

Processors, accelerators, controllers, systemen met firmware, besturingssystemen en AI-frameworks moeten begrijpen waar de data ligt en beslissen wanneer ze moeten worden verplaatst.

HBF zou in de praktijk een extra geheugenniveau kunnen worden binnen de AI-servers:

GPU → HBM → HBF → SSD → gedistribueerde opslag.

De software zou dan moeten beslissen welke data in het snelste en duurste geheugen blijft, en welke op lagere niveaus kan worden opgeslagen.

SanDisk meldde initiële monsters van HBF voor de tweede helft van 2026 en eerste inferentie-apparaten met HBF begin 2027. Het bedrijf streeft naar capaciteiten acht tot zestien keer groter dan HBM tegen vergelijkbare kosten, maar deze voorspellingen moeten nog worden bevestigd door daadwerkelijke producten.

De werkelijke kracht van HBF ligt in het veranderen van de inferentie-economie

De belangrijkste vraag is niet of HBF HBM in specificaties kan verslaan.

Ze zijn ontworpen voor verschillende problemen.

HBM blijft waardevol waar lage latentie, frequente schrijfbewerkingen en extreem hoge bandbreedte essentieel zijn. NAND biedt veel meer capaciteit voor een lagere prijs, maar met verschillende toegangseigenschappen.

HBF probeert juist dat voordeel te benutten.

Als toekomstige versnellers terabytes aan gewichten dicht genoeg bij de GPU kunnen blijven, zou het mogelijk zijn om bepaalde grote modellen uit te voeren met minder exclusieve geheugen-accelerators.

Die verandering zou significante economische gevolgen kunnen hebben voor inferentie.

Maar er blijven vragen over de werkelijke latentie onder real-world condities, energieverbruik, koeling, duurzaam presteren, schrijfwijdte, foutbeheer en vooral hoe systemen de data verdelen tussen HBM en HBF.

In investeerderspresentaties worden deze complexiteiten vaak gereduceerd tot capaciteit en bandbreedte, terwijl de architectuur van AI-servers veel ingewikkelder is.

HBF hoeft niet sneller te zijn dan HBM om succesvol te worden. Het moet vooral bieden dat het opslaan van enorme modellen dicht bij de accelerators snel en veel goedkoper wordt.

Veelgestelde vragen

Wat is HBF?

HBF betekent High Bandwidth Flash. Het is een NAND-gebaseerde technologie die door stapeling en hoog parallelisme veel meer capaciteit en bandbreedte kan bieden dan conventioneel flash-opslag.

Vervangt HBF HBM in AI-GPU’s?

Niet noodzakelijk. HBF is vooral interessant voor het bewaren van grote hoeveelheden gewichten tijdens inferentie, terwijl HBM de voordelen van lage latentie en frequente schrijfbewerkingen behoudt.

Welke capaciteit kan HBF bieden?

SanDisk stelt apparaten voor met 512 GB via stacks van 16 dies, wat betekent dat meerdere apparaten samen multi-terabyte systemen kunnen vormen rond een accelerator.

Wanneer wordt HBF beschikbaar?

SanDisk streeft ernaar om in de tweede helft van 2026 eerste monsters te presenteren en begin 2027 de eerste inferentie-ervaringen met HBF aan te bieden. De commerciële adoptie hangt af van standaardisatie, fabricanten en softwareontwikkeling.

Scroll naar boven