NetApp heeft DataPelago overgenomen, een Californisch bedrijf dat zich specialiseert in het versnellen van data-verwerking met central processing units (CPU’s) en grafische verwerkingsunits (GPU’s). Deze overname stelt de fabrikant in staat om deze capaciteiten te integreren in haar opslaginfrastructuur en een stap te zetten richting een model waarin informatie wordt voorbereid voor kunstmatige intelligentie (AI) en analyse, zonder dat daarvoor kopieën naar andere systemen hoeven te worden gemaakt.
De kernpunten van de overname van DataPelago in 30 seconden
- NetApp heeft DataPelago overgenomen, hoewel de financiële details en voorwaarden nog niet zijn aangekondigd.
- De technologie Nucleus van DataPelago verwerkt gegevens met CPU en GPU dicht bij de opslaglocatie.
- Het doel is om kopieën en dataverplaatsingen voorafgaand aan AI-projecten te verminderen.
- DataPelago beweert dat hun platform de prestaties kan vertienvoudigen en de infrastructuurkosten tot 80% kan reduceren, afhankelijk van de workload.
- Een publieke planning voor de integratie in NetApp-producten is nog niet bekendgemaakt.
DataPelago zal opereren als een dochteronderneming van NetApp. Het bedrijf heeft nog niet details vrijgegeven over het aantal werknemers dat zal worden overgenomen, de waardering van de startup of de financiële impact. De directe relevantie van de deal moet vooral worden beoordeeld op basis van de technologische innovaties die zijn verworven.
Deze overname weerspiegelt een trend in de opslagmarkt voor ondernemingen. Al jaren is de primaire functie van dergelijke systemen het snel bewaren, beveiligen en leveren van data. De groei van AI stelt echter nieuwe eisen: het prepareren van grote datasets voordat ze kunnen worden gebruikt voor training, modelafstemming, semantische zoekopdrachten of het bouwen van generatieve applicaties via retrieval augmented generation (RAG).
Dit werk vereist vaak het extraheren van informatie uit productieopslag, het dupliceren naar data lakes of verwerkingsclusters en het transformeren van data daar. Het proces is tijdrovend en vergt veel netwerkcapaciteit, opslagruimte en rekencapaciteit. Bovendien ontstaan er duplicaten die beheerd, geüpdatet en beveiligd moeten worden.
NetApp wil deze dataverplaatsingen beperken door een deel van de verwerking dichter bij de gegevens zelf uit te voeren.
Nucleus brengt CPU en GPU nabij de data
De kerntechnologie van DataPelago is Nucleus, een verwerkingsmotor ontworpen om operaties te verdelen over verschillende hardwaretypes. Het kan CPU’s, GPU’s en programmeerbare logicaparen (FPGA’s) inzetten, afhankelijk van de taakvereisten.
Het doel is om transformaties uit te voeren op gestructureerde, semi-gestructureerde en ongestructureerde data zonder dat alle gegevens eerst hoeven te worden overgebracht naar een aparte verwerkingsplatform.
DataPelago positioneert Nucleus als een universele motor die compatibel is met diverse analysesystemen. Het platform maakt gebruik van open standaarden zoals Substrait en Apache Gluten om verbinding te maken met query-engines en gedistribueerde verwerkingsplatformen zoals Apache Spark en Trino.
Volgens het bedrijf kan deze technologie prestaties tot tien keer hoger leveren en de infrastructuurkosten tot 80% beperken in vergelijking met sommige conventionele aanpakken. Deze resultaten zijn gebaseerd op DataPelago’s eigen tests en worden niet automatisch gegarandeerd voor alle omgevingen. De uiteindelijke prestatie hangt af van datavolume, querytype, hardware, architectuur en integratiekosten.
Het belangrijkste voordeel is dat het rekenen dichter bij de opslaglocatie wordt gebracht. Het verplaatsen van petabytes aan data voor verwerking kan duurder en trager zijn dan operaties uitvoeren op de plek waar de data zich al bevinden.
Deze aanpak elimineert niet volledig dataverplaatsingen, aangezien modellen, applicaties en accelerators nog steeds tijdens verwerking informatie nodig hebben. Het streven is vooral om de systematische creatie van tussenkopieën te verminderen, zoals voor filtering, classificatie, fragmentatie of vectorisatie van datasets.
Wat betekent activatie zonder kopieën?
NetApp gebruikt de term zero-copy of activatie zonder kopieën om deze aanpak te omschrijven. Dit betekent niet dat er geen gegevens ooit worden gekopieerd, maar dat organisaties kunnen voorkomen dat volledige duplicaties permanent worden aangemaakt vóór bepaalde AI- of analysemotoren.
Deze aanpak is belangrijk omdat bedrijfsgegevens zelden direct klaar zijn om een model te voeden. Ze bevinden zich vaak verspreid over bestanden, databases, objectopslag, documenten, historische logs en interne applicaties.
Voor gebruik moeten ze vaak worden ontdekt, geverifieerd op rechten, duplicaten worden verwijderd, governancebeleid worden toegepast, inhoud worden geëxtraheerd, fragmenten worden gegenereerd en sommige gegevens worden omgezet in vectorrepresentaties. Dit proces kost vaak veel tijd en budget, en beïnvloedt de snelheid van AI-projecten.
NetApp wil deze processen stroomlijnen door DataPelago-technologie te integreren in haar data platform, dat onder meer ONTAP, de gedeelde opslag AFX en AI Data Engine omvat. Het bedrijf staat al voor een model waarbij AI-tools dicht bij de data worden gebracht in plaats van eerst alles samen te brengen in een nieuwe, centrale platform. De overname versterkt deze gedachte met een versneld verwerkingsmotor.
Desalniettemin benadrukt NetApp dat de genoemde capaciteiten onderdeel vormen van haar toekomstige technologische koers. Het bedrijf heeft nog niet bevestigd in welke producten Nucleus wordt geïntegreerd, wanneer dat zal gebeuren, of onder welke commerciële voorwaarden. Het betekent dus niet dat deze functies al actief zijn in ONTAP, AFX of AI Data Engine.
Opslagbedrijven willen meer functies in het AI-tijdperk
De aankoop laat ook zien dat opslagfabrikanten hun scope uitbreiden. De drijfveren gaan niet meer alleen over meer capaciteit of snelheid, maar ook over het vinden, beveiligen, classificeren en voorbereiden van data voor AI-toepassingen.
Hoewel bedrijven GPU’s hebben ingezet, blijven deze acceleratoren onderbenut wanneer data te traag arriveren, niet goed zijn voorbereid of meerdere transformaties vereisen. Dit heeft geleid tot de ontwikkeling van architecturen die hoge prestaties combineren met snelle netwerken, catalogi, vectorengestuurde verwerkingsmotoren en governance-ondersteuning.
Met DataPelago wil NetApp meer controle krijgen over dat traject. In plaats van simpelweg data te leveren aan externe clusters, zou haar infrastructuur enkele verwerkingen kunnen uitvoeren met CPU en GPU, direct op de data-layer.
De overname sluit bovendien aan bij AFX, de gedisaggregeerde architectuur van NetApp die capaciteit, diensten en beheer scheidt, en met AI Data Engine dat erop gericht is bedrijfsinformatie voor AI-initiatieven te ontdekken en voor te bereiden.
De overname past ook binnen de strategieën van NetApp in samenwerking met bedrijven als Cisco, Google Cloud, Red Hat en SK Telecom. Wat deze overname onderscheidt, is dat DataPelago technologische eigendommen en een eigen team meebrengt dat direct in de productstrategie kan worden geïntegreerd.
Hoe NetApp deze motor winstgevend zal maken binnen heterogene zakelijke omgevingen blijft nog onduidelijk. Prestaties vormen slechts een deel van de uitdaging. Ook moet het bedrijf rekening houden met toegangsbeheer, workload-isolatie, compatibiliteit met verschillende formaten, monitorbaarheid, GPU-gebruik en workflowmanagement.
Indien de integratie zoals gepland verloopt, zou NetApp kunnen besparen op een van de duurste taken binnen bedrijfsmatige AI: het verplaatsen en dupliceren van grote datasets voorafgaand aan gebruik. Op dit moment geeft de overname een duidelijke technische richting aan. De daadwerkelijke voordelen worden echter pas zichtbaar wanneer de DataPelago-technologie beschikbaar komt in producten die klanten kunnen gebruiken.
Veelgestelde vragen
Wat heeft NetApp gekocht?
NetApp heeft DataPelago overgenomen, een startup die een motor ontwikkelt om data-verwerking te versnellen met CPU’s, GPU’s en ander hardware. De prijs van de transactie is niet bekendgemaakt.
Wat is DataPelago Nucleus?
Nucleus is een verwerkingsmotor die operaties verdeelt over verschillende versnellingshardware en gericht is op werken dicht bij de data voor AI, analyse en grootschalige datavoorbereiding.
Wat betekent zero-copy bij deze overname?
Het betekent dat NetApp mikt op het minimaliseren van volledige datakopieën in externe systemen voordat gegevens worden verwerkt. Het betekent niet dat er geen dataverplaatsingen blijven plaatsvinden tijdens verwerking.
Is de DataPelago-technologie al beschikbaar in NetApp-producten?
NetApp heeft nog geen planning bekendgemaakt voor integratie of voor welke producten deze functies bestemd zijn. De genoemde mogelijkheden worden beschouwd als onderdeel van de toekomstige evolutie van hun platform.
Bronnen:
- NetApp, officiële aankondiging over acquisitie van DataPelago, 16/07/2026.
- NetApp, technische analyse over Nucleus en zero-copy datastromen.
- DataPelago, technische informatie over Nucleus en heterogene verwerking.
