Het moeilijkste examen over AI-veiligheid geeft een duidelijke boodschap: niemand slaagt

Het debat over de veiligheid van kunstmatige intelligentie richt zich vaak op welk model het krachtigst is of welke de hoogste prestaties levert. Echter, een recent rapport van het Future of Life Institute verschuift de focus volledig. De AI Safety Index zomer 2026 beoordeelt hoe belangrijke bedrijven in de sector omgaan met risico’s en het resultaat is opvallend: geen enkel bedrijf behaalt een onderscheiding en de hoogste score bedraagt slechts C+.

De kernpunten van de AI Safety Index in 30 seconden

  • Het Future of Life Institute heeft negen AI-ontwikkelaars geëvalueerd op basis van 37 indicatoren verdeeld over zes categorieën.
  • Anthropic krijgt de beste beoordeling (C+), gevolgd door OpenAI en Google DeepMind, beide met een C.
  • xAI, DeepSeek en Mistral slagen niet voor de algehele veiligheidsbeoordeling.
  • Het rapport waarschuwt voor achteruitgang bij sommige publieke veiligheidsinspanningen en een groeiende interesse van verschillende bedrijven in defensiecontracten.
  • De slechtst beoordeelde categorie is ‘existentiële veiligheid’, waar geen enkel bedrijf een beter dan C- behaalt.

Het index is opgesteld door een onafhankelijk panel van zeven onderzoekers gespecialiseerd in veiligheid, governance en afstemming van kunstmatige intelligentie. De evaluatie omvat zes grote domeinen: risico-evaluatie, actuele schade, veiligheidskaders, existencele veiligheid, governance en verantwoording, en informatie-uitwisseling. Hiervoor worden 37 indicatoren gebruikt op basis van publieke documentatie en reacties van deelnemende bedrijven.

De beoordeling laat weinig redenen tot optimisme

Anthropic staat opnieuw op de eerste plaats dankzij een combinatie van meer transparantie, onderzoek naar veiligheid en relatief meer ontwikkelde governance-structuren, hoewel het panel nog steeds belangrijke tekortkomingen ziet. OpenAI en Google DeepMind completeren de top met een score van C.

Meta verbetert ten opzichte van de vorige editie en stijgt naar de vierde positie met een D+, terwijl Z.ai en Alibaba Cloud een D- behalen. Aan de onderkant van de ranglijst staan xAI, DeepSeek en Mistral, die allemaal een onvoldoende krijgen in de globale beoordeling.

examen dev

Een van de meest opvallende aspecten van het rapport is dat het onvoldoende niet beperkt blijft tot één regio. Volgens het panel zijn er minimaal één bedrijf dat niet voldoet in de Verenigde Staten, China en Europa, wat de auteurs ertoe brengt te concluderen dat het gebrek aan adequate veiligheidsmaatregelen een wereldwijd probleem is en niet enkel een kwestie van regelgeving.

Europese regelgeving garandeert geen betere resultaten

Het voorbeeld van Mistral krijgt bijzondere aandacht in de conclusies van het rapport.

De auteurs benadrukken de schijnbare tegenstelling tussen de leidersrol van de Europese Unie op het gebied van AI-regelgeving en de slechte score van haar belangrijkste modelontwikkelaar, dat de laagste beoordeling krijgt.

Het gaat niet om een oordeel over de technologische kwaliteit van de modellen, maar over aspecten zoals de aanwezigheid van publieke veiligheidskaders, governance-mechanismen, transparantie en risicobeheer.

Het rapport beveelt Mistral aan om een uitgebreider veiligheidskader te publiceren, haar afstemmingsstrategie te versterken en haar resultaten op het gebied van modelveiligheid te verbeteren.

Militaire veiligheid wordt een nieuwe zorg

Een van de meest zorgwekkende ontwikkelingen die het panel signaleert, wordt niet alleen in de scores weerspiegeld.

Het rapport stelt dat tussen 2024 en 2026 verschillende bedrijven hun beleid rond militair gebruik van AI-modellen hebben aangepast. Bedrijven zoals Anthropic, OpenAI, Google DeepMind en Meta, die eerder dergelijke toepassingen beperkten, zouden deze restricties hebben versoepeld terwijl de interesse in samenwerking met de defensiesector toeneemt.

In het geval van Anthropic noemt het panel expliciet ’twijfelachtige militaire toezeggingen’ als aandachtspunten, hoewel het bedrijf nog steeds de algemene ranglijst aanvoert.

De beoordelaars menen dat sommige bedrijven hun toezeggingen om de ontwikkeling of inzet van modellen te stoppen bij bepaalde risicodrempels, hebben versoepeld. Dit wordt beschouwd als een achteruitgang ten opzichte van eerdere standpunten.

Existentiële veiligheid blijft een grote uitdaging

Als er één categorie is waar het panel uiterst kritisch over is, dan is dat de zogeheten existentiële veiligheid.

Geen van de negen bedrijven behaalt hoger dan C-, en de meeste scoren D of F. Het rapport wijst erop dat, ondanks initiatieven zoals veiligheidsclassificatoren, interpretatiemethoden en governance-voorstellen, de huidige maatregelen onvoldoende blijven voor de risico’s verbonden aan steeds geavanceerdere AI-systemen.

De auteurs betwijfelen ook dat veel strategieën zich vooral richten op het detecteren van gevaarlijk gedrag, in plaats van het te voorkomen door ontwerpkeuzes.

Meer transparantie, maar nog steeds weinig garanties

Een ander belangrijke boodschap uit de AI Safety Index is dat vrijwel alle grote bedrijven nu meer documentatie over veiligheid publiceren dan twee jaar geleden.

Toch concludeert het panel dat veel van die kaders nog steeds problemen vertonen: onmeetbare drempels, gebrek aan onafhankelijke audits, onduidelijkheid over wie deployment kan stoppen en verschillen tussen publieke toezeggingen en latere zakelijke besluiten.

In een wereld waarin AI-modellen blijven groeien in kracht en worden geïntegreerd in kritieke sectoren, luidt het rapport dat de voortgang op het gebied van veiligheid achterblijft bij de technologische ontwikkeling.

Veelgestelde vragen

Wat is de AI Safety Index?

Een rapport van het Future of Life Institute dat de veiligheidspraktijken van toonaangevende AI-bedrijven evalueert met 37 indicatoren verdeeld over zes categorieën.

Welke organisatie krijgt de hoogste score?

Anthropic staat bovenaan met een C+, gevolgd door OpenAI en Google DeepMind, beide met een C.

Welke bedrijven worden als onvoldoende beoordeeld?

xAI, DeepSeek en Mistral krijgen een globale onvoldoende.

Wat is de belangrijkste conclusie van de studie?

Volgens het panel bereiken geen enkele grote speler een veiligheidsniveau dat als volledig bevredigend kan worden beschouwd. Bovendien blijven de vorderingen op het gebied van governance en risicobeperking achter bij de snelle ontwikkeling van AI.

vía: AI Safety Index — Zomer 2026 | Future of Life Institute

Scroll naar boven