Red Hat AI 3.5 legt de focus op beveiliging, observatie en controle van GPU

Red Hat heeft Red Hat AI 3.5 gelanceerd, een update van hun kunstmatige intelligentieplatform gericht op het begeleiden van projecten van de pilotfase naar productieomgeving met meer controle, vergelijkbaar met die van een enterprise-infrastructuur. De nieuwe versie introduceert pre-evaluatie van modellen en agents, nieuwe observatiemetrics, multitenancy-capaciteiten op gedeelde GPU’s en tools voor het uitrollen van RAG-applicaties en agents met meer operationele controle.

De kernpunten van Red Hat AI 3.5 in 20 seconden

  • EvalHub bevat nu beveiligingsbeoordelingen en genereren auditeerbare rapporten.
  • Red Hat voegt inference-metrics, tokenverbruik en GPU-utilisatie toe.
  • De platform versterkt multitenancy met isolatie via OpenShift Virtualization.
  • AutoRAG en agent-templates versnellen bedrijfsscenario’s met private data.
  • Red Hat AI 3.5 is nu algemeen beschikbaar.

Deze update markeert een duidelijke verschuiving in de markt voor zakelijke AI. Organisaties zijn voorbij de experimentele fase met modellen en richten zich nu op minder zichtbare, maar complexere uitdagingen: wie gebruikt welke GPU, wat kost elke workload, hoe update je een model zonder de service te verstoren, welk isolatieniveau bestaat er tussen teams, en hoe bewijs je dat een systeem voldoet aan bepaalde kwaliteitscriteria voordat het in productie gaat.

Red Hat wil precies dat operatie-laagje boven OpenShift en haar AI-platform aanreiken.

EvalHub en Garak maken veiligheid voorafgaand aan deployment zichtbaar

Een belangrijke nieuwigheid is EvalHub, beschikbaar in Red Hat AI 3.5 voor algemeen gebruik.

EvalHub is ontworpen om modellen, RAG-systemen en agents te beoordelen vóór publicatie. Volgens Red Hat automatiseert het beveiligingstests en genereert het rapporten voor interne nalevings- en auditprocessen.

Daarnaast integreert het Garak-scores, een evaluatietool voor kwetsbaarheden en gedrag van taalmodellen, binnen het gecertificeerde modelportfolio van Red Hat.

Red Hat meldt dat ze meer dan 20 nieuwe modellen hebben toegevoegd, met tests voor prestaties, veiligheid, risico op identificatie-informatie en toxiciteit.

Onder de voldoenende fabrikanten bevinden zich Google, NVIDIA en Alibaba Cloud, met modellen zoals Gemma 4, Nemotron 3 en Qwen.

Het is belangrijk te verduidelijken wat zo’n validatie betekent. Een goede score op tests garandeert niet dat het model voor alle toepassingen veilig is, noch dat het per definitie compliant is met regelgeving.

Het nut ligt in de beschikbaarheid van reproduceerbare en vergelijkbare bewijzen, die kunnen worden ingepast in interne goedkeuringsprocessen van een organisatie.

Red Hat onderscheidt ook modellen als gevalideerd voor tool calling, een capaciteit die vooral relevant is voor agents die acties kunnen uitvoeren op externe systemen.

GebiedNieuw in Red Hat AI 3.5
EvaluatieEvalHub in algemene beschikbaarheid
ModelbeveiligingGarak-scores en risicorapporten
AgentsGeldige models voor tool calling
NalevingAuditeerbare evaluatierapporten
UpdatesGeleidelijke uitrol van nieuwe versies

Gedeelde GPU’s worden een platformprobleem

Red Hat AI 3.5 besteedt ook veel aandacht aan GPU-beheer in gedeelde omgevingen.

Bij kleine proefprojecten met dedicated GPU’s is resourceverdeling eenvoudig. Maar wanneer tientallen teams gebruik maken van gedeelde acceleratoren, wordt het complexer: sommige workloads vereisen lage latentie, terwijl anderen op de achtergrond kunnen draaien.

De nieuwe versie introduceert fair-share GPU scheduling, dat resources verdeelt tussen verschillende tenants, en prioriteitsmechanismen voor inference-services.

Het systeem kan verzoeken prioriteren en afhandelen op basis van urgentie, waardoor voorkomen wordt dat secundaire workloads de totale capaciteit overnemen en realtime-reactietaken verstoren.

Red Hat biedt nu ook officiële ondersteuning voor het draaien van haar AI-platform op hosted control planes van OpenShift, geïmplementeerd via OpenShift Virtualization.

Hierdoor kan elke tenant zijn eigen control plane hebben, terwijl de fysieke hardware wordt gedeeld.

AI-workloads kunnen binnen virtuele machines op gedeelde GPU-servers draaien, waardoor een extra isolatielaag ontstaat tussen klanten of businessunits.

Dit biedt niet de volledige fysieke isolatie, maar wel een praktische oplossing voor interne cloud-diensten en bedrijfsplatformen met gedeeld gebruik.

Meer metrics: inzicht in token- en GPU-gebruik

Observatie en monitoring worden versterkt in AI 3.5.

Het platform bevat dashboards voor het monitoren van inference-gezondheid, modelprestaties en GPU-utilisatie.

Daarnaast worden tokenverbruiken per gebruiker weergegeven.

Dit is vooral handig voor platform- en FinOps-teams: wanneer AI voor honderden of duizenden gebruikers wordt gebruikt, is inzicht in de verbruikscijfers noodzakelijk om kosten te alloceren, onregelmatigheden te detecteren en uitbreidingen te verantwoorden.

Red Hat noemt dit showback, in tegenstelling tot chargeback.

Bij showback worden verbruik en kosten zichtbaar gemaakt voor teams zonder dat ze daadwerkelijk gefactureerd worden, terwijl chargeback de kosten direct toewijst.

De nieuwe versie ondersteunt ook visuele agent-tracering via MLflow, zodat het mogelijk is om complexe workflows van meerdere stappen, tools en modelaanroepen te volgen.

Omdat agents meerdere calls kunnen initiëren op verschillende punten, is observatie van hun gedrag complexer dan bij eenvoudige API-aanroepen.

AutoRAG reduceert de inspanning voor koppeling van modellen aan bedrijfsdata

Red Hat breidt verder met tools voor RAG-toepassingen, oftewel Retrieval-Augmented Generation.

AutoRAG automatiseert delen van het proces om interne repositories te koppelen aan AI-toepassingen.

In versie 3.5 komen multilinguale documenten, conversational testing, contextuele retrieval en compatibiliteit met pgvector erbij.

Ook wordt een visuele interface meegeleverd om het ontwerp en de evaluatie van workflows vooraf te kunnen doen, vóór implementatie.

Het doel is de handmatige stappen te minimaliseren: bepalen hoe documenten worden opgesplitst, embeddings worden gegenereerd, welke retrieval-methode wordt gebruikt en hoe de kwaliteit van de antwoorden wordt beoordeeld.

Daarnaast bevat Red Hat AutoML en een functie genaamd Inference-Time Scaling, die de rekencapaciteit dynamisch aanpast op basis van de complexiteit van de vraag.

Hierdoor wordt voorkomen dat eenvoudige queries dezelfde resources krijgen als complexe, terwijl het systeem probeert de kosten zo effectief mogelijk te beheren.

Agents met templates en toegangscontrole

Red Hat AI 3.5 introduces vooraf geconfigureerde agent-templates voor veelgebruikte taken zoals code review, documentverwerking en onderzoek.

Deze templates maken deel uit van AI Hub en bieden basisframeworks, tools en deployment-instellingen.

Het bedrijf wil dat agents direct binnen de beveiligings- en operationele controles van het platform ontstaan, niet naderhand worden toegevoegd.

Ook komt er algemene ondersteuning voor Responses API en geïntegreerde RAG, met een open interface voor multi-turn agentgesprekken.

Verder wordt integratie met NVIDIA NeMo Guardrails toegevoegd, bedoeld om bepaalde schadelijke of niet-toegestane aanroepen naar tools te voorkomen.

Dit is vooral relevant wanneer agents kunnen wijzigen, raadplegen of acties uitvoeren op bedrijfssystemen, wat het risiconiveau verhoogt.

Meer opties voor geheugenbeheer buiten de GPU

Het geheugbeheer krijgt aanzienlijke verbeteringen.

Red Hat maakt nu CPU offloading algemeen beschikbaar, zodat data kan worden verplaatst van GPU-geheugen naar het systeemgeheugen.

Daarnaast introduceert het bedrijf in developer preview storage offloading, waarmee data van GPU naar opslag kan worden overgebracht.

Deze technieken maken langere conversaties mogelijk en grotere modellen zonder direct meer HBM te nodig te hebben.

Het nadeel is dat dataoverdracht traag is: verplaatsen tussen GPU, RAM en opslag kost meer tijd dan het gebruik van high-speed GPU-geheugen, afhankelijk van de workload.

Ze passen in een bredere trend om geheugen als meerlaagse hiërarchie te beschouwen in plaats van alles binnen HBM te houden.

llm-d breidt gedistribueerde inferentie uit buiten OpenShift

Een andere nieuwe functie is de uitbreiding van llm-d, Red Hat’s technologie voor gedistribueerde inferentie.

Red Hat AI 3.5 ondersteunt nu ook services van derden via Kubernetes.

Het bedrijf kondigt algemene beschikbaarheid aan voor CoreWeave Kubernetes Service en Microsoft Azure, terwijl early access wordt gegeven voor Amazon EKS.

Dit maakt het mogelijk om een uniforme modelservice laag te gebruiken, zelfs op Kubernetes-omgevingen die niet op OpenShift draaien.

Er is ook early support voor vLLM Omni, dat bedoeld is voor tekst, audio en beeldgeneratie via één gedeelde laag.

Omdat deze functionaliteit nog in early access is, moet het niet worden gezien als een volwaardige productiefunctie.

Red Hat wil dat AI wordt beheerd als andere kritieke infrastructuur

De koers van Red Hat AI 3.5 is duidelijk.

Het bedrijf richt zich minder op de strijd om de krachtigste modellen en meer op het beheren van de laag die rondom modellen komt wanneer organisaties ze continu willen inzetten.

Evaluaties, isolatie, GPU-gebruik, tokenmonitoring, gefaseerde deployment, RAG, agents en traceerbaarheid vormen die laag.

Niet alle functies zijn even rijp: sommige zijn al algemeen beschikbaar, andere bevinden zich nog in developer preview, technology preview of early access.

Die onderscheidingen zijn belangrijk voor bedrijven die Red Hat AI 3.5 in productie willen nemen.

De versie is nu algemeen beschikbaar en maakt deel uit van Red Hat AI Factory with NVIDIA.

Meer dan een modelupdate wil Red Hat AI 3.5 AI meer beheerbaar maken voor platformteams, met controles vergelijkbaar met die voor applicaties en kritieke services.

Scroll naar boven