Huawei heeft OceanStor M900 Context Memory Storage geïntroduceerd, een opslagsysteem ontworpen om de inferentie van kunstmatige intelligentie in grootschalige datacenters te versnellen. Het voorstel breidt het beschikbare geheugen uit voor KV-caching, dat wordt gebruikt tijdens de inferentie van grote modellen, van accelerators en DRAM tot SSD’s, met een totale capaciteit die Huawei op tot 64 PB per cluster plaatst.
De kernpunten van OceanStor M900 in 20 seconden
- Huawei vergroot de KV-cache van de SuperPoD tot 64 PB per cluster.
- Het systeem combineert geheugen van de accelerator, DRAM en SSD via UnifiedBus.
- Huawei beweert dat de toegangsvertraging wordt teruggebracht van milliseconden naar 60 microseconden.
- De fabrikant claimt tot 40 TB/s totaal bandbreedte en tweemaal de token-prestaties.
- Een adaptieve opslecl technology verlengt de levensduur van SSD’s naar verwachting 16 keer.
Huawei kondigde OceanStor M900 aan op 17 september tijdens HUAWEI CONNECT 2026 in Shanghai. Het systeem maakt deel uit van een strategie waarbij het bedrijf de architectuur van de SuperPoD wil uitbreiden voorbij louter berekeningen en krachtig wil integreren computing, netwerken en opslag.
De drijfveer hierachter is de evolutie van AI-modellen. Naarmate de contextvensters groeien en agenten langer gesprekken en taken voeren, neemt de hoeveelheid gegevens die tijdens inferentie moet worden vastgehouden toe. Huawei ziet in KV-caching een van de elementen die de capaciteit en kosten van de beschikbare geheugenbronnen bij accelerators en DRAM onder druk zetten.
Het bedrijf stelt OceanStor M900 voor als een aanvullende laag om deze informatie te bewaren en hergebruiken zonder strikt afhankelijk te zijn van geheugen naast de verwerkingsunits.
Een KV-cache die tot SSD’s reikt
De KV-cache slaat gegevens op van het type Key en Value die tijdens de inferentie van een model worden gegenereerd. Wanneer delen van de context opnieuw kunnen worden gebruikt, kan het systeem die gegevens ophalen in plaats van de berekeningen opnieuw uit te voeren.
Deze aanpak wint aan belang bij modellen die met contextvensters van meer dan een miljoen tokens werken, aldus Huawei. Meertrapsdialogen en complexe taken genereren bovendien meer informatie die beschikbaar blijft voor latere bewerkingen.
Het probleem is dat het geheugen van accelerators en DRAM beperkt is in capaciteit en dat de kosten toenemen naarmate er op grotere schaal moet worden opgeschaald.
OceanStor M900 gebruikt UnifiedBus, Huawei’s onderliggend netwerk voor de onderlinge verbindingen, om een wereldwijde KV-cache te creëren met gelaagde opslag. Informatie kan worden verdeeld over geheugen van de accelerator, DRAM en SSD, zodat de totale beschikbare capaciteit toeneemt zonder uitsluitend afhankelijk te zijn van geheugen dicht bij de processor.
Huawei stelt dat een enkel cluster tot 64 PB KV-cachecapaciteit kan bereiken. Ook geeft het aan dat de beschikbare capaciteit per NPU is toegenomen van gigabytes naar terabytes.
Volgens Huawei maakt deze toename in capaciteit het mogelijk om meer context op te slaan, te delen en te hergebruiken, wat de cache-hitsnelheid kan verhogen. Deze cijfers en effecten zijn uitingen van de fabrikant en de gepubliceerde informatie is niet onafhankelijk geverifieerd.
Van milliseconden naar 60 microseconden, volgens Huawei
Het tweede onderdeel van de voorstel betreft de manier waarop toegang wordt verkregen tot de opgeslagen gegevens.
Huawei beweert dat OceanStor M900 is opgebouwd uit een architectuur die CPU, netwerkkamer en NAND-controller integreert. Dit ontwerp biedt native semantics voor de KV-cache en maakt een één-sprung connectie mogelijk tussen de NPUs van de SuperPoD en SSD’s.
Volgens Huawei voorkomt deze architectuur protocoleomwisselingen en bepaalde overdrachten via de CPU. De toegangsvertraging wordt volgens hen teruggebracht van milliseconden naar 60 microseconden, wat volgens hun schatting een vermindering van 90% betekent.
Het systeem behaalt ook een totaal bandbreedte van tot wel 40 TB/s per cluster, een cijfer dat 1,5 keer hoger ligt dan vergelijkbare oplossingen.
Het doel is om de wachttijd voor gegevens door accelerators te verminderen. In AI-workloads waarbij berekeningen en contexttoegang nauw met elkaar verbonden zijn, is meer opslagruimte nutteloos als het ophalen van die informatie te lang duurt.
Huawei stelt dat OceanStor M900 in standaard AI-programmeringscenario’s het verdubbelen van de tokensnelheid in het inference-cluster en het halveren van de tijd tot het eerste token (TTFT) mogelijk maakt. Dit zijn eveneens door Huawei gemelde resultaten op basis van hun eigen testsituaties.
Opslag moet ook duurzaam zijn
De grote hoeveelheid schrijftoepassingen in een cache-infrastructuur beïnvloedt de duurzaamheid van SSD’s.
Huawei introduceert daarom KV-aware adaptive storage technology, een technologie die rekening houdt met het gedrag en de levensduur van cachegegevens bij het verdelen ervan over verschillende opslagmedia.
Het idee is om de waarde en verwachte levensduur van data te identificeren en hun opslaglocatie daaraan aan te passen. Zo worden niet alle writes op dezelfde wijze belast, wat de levensduur van SSD’s ten goede komt.
Huawei beweert dat OceanStor M900 tot 24 write cycles per dag (DWPD) kan ondersteunen en dat deze technologie de weerstand van SSD’s tot 16 keer verhoogt. De verwachting is dat de opslag onder die condities minstens drie jaar stabiel blijft.
Het primaire doel is om het aantal vervangingen en de operationele en onderhoudskosten in grote inferentiesystemen te verminderen.
Van een berekeningsgerichte infrastructuur naar een driedelige architectuur
De lancering van de M900 past in een bredere Huawei-strategie voor AI-systemen. Het bedrijf ziet in dat de groei van modellen en agenten de opslag van context belangrijker maakt binnen de infrastructuur.
Tot nu toe lag de focus bij veel AI-systemen op het vergroten van het rekenvermogen van GPU’s of NPUs. Huawei stelt nu een architectuur voor waarin berekening, netwerk en opslag nauw samenwerken.
In grootschalige SuperPoD-omgevingen kan de hoeveelheid data die tussen accelerators en geheugen wordt uitgewisseld een bottleneck vormen. Een gedistribueerde en gedeelde KV-cache stelt volgens Huawei in staat meer context te bewaren en te hergebruiken vanuit verschillende rekenbronnen.
Dit is vooral relevant voor inferentiesystemen met uitgebreide contexten of meervoudige stappen. In dergelijke scenario’s bestaat een belangrijk deel van het werk uit het ophalen van eerder gegenereerde informatie en die op het juiste moment beschikbaar maken voor het model.
OceanStor M900 wil SSD’s zien als een uitbreiding van die contextgeheugen, zij het met een andere hiërarchie qua capaciteit en toegangssnelheid ten opzichte van het geheugen dichtbij de accelerator.
De innovatie maakt deel uit van Huawei’s uitgebreide infrastructuurpresentaties op HUAWEI CONNECT 2026, waaronder nieuwe SuperPoD- en SuperCluster-architecturen. Geheel genomen streeft het bedrijf naar een AI-infrastructuur waarbij de prestaties niet alleen afhangen van het aantal verwerkingsunits, maar ook van de snelheid waarmee deze toegang krijgen tot de benodigde context.
Veelgestelde vragen
Wat is OceanStor M900?
Een door Huawei ontwikkeld opslagsysteem voor AI-inferentie in grote datacenters. De voornaamste functie is het uitbreiden en delen van de KV-cache tussen acceleratorgeheugen, DRAM en SSD’s.
Wat is de maximale capaciteit?
Huawei beweert dat een cluster met OceanStor M900 tot 64 PB KV-cachecapaciteit kan leveren.
Wat is KV-caching?
Een gestructureerde opslag van gegevens uit de inferentie van een model, bedoeld voor hergebruik en om herhaalde berekeningen te voorkomen. De omvang groeit met lange contextfensters en meervoudige ronden van taken.
Welke prestatieverbeteringen biedt Huawei?
Het systeem zou de toegangslatentie kunnen reduceren tot 60 microseconden, tot 40 TB/s aan totale bandbreedte, het tokenrendement verdubbelen en de tijd tot het eerste token halveren in bepaalde scenario’s.
