GPT-6 Astra brengt AI-agenten naar een hoger niveau: 99,9% in ARC-AGI-3

OpenAI heeft GPT-6 Astra gepresenteerd, een model dat ontworpen is om verder te gaan dan assistenten die enkel antwoorden genereren, en zich te ontwikkelen tot autonome agenten die in staat zijn om computers te gebruiken, te programmeren, onderzoek te doen en uitgebreide workflows te voltooien. De gepubliceerde resultaten tonen een 99,9 % score op ARC-AGI-3, 100 % op ExploitBench, 97,6 % op FrontierMath Tier 4 en 57,9 % op Terminal-Bench 4.0. De vooruitgang op het gebied van cybersecurity is zodanig significant dat OpenAI het model heeft geplaatst op de Critical-norm binnen hun Preparedness Framework.

De kernpunten van GPT-6 Astra in 20 seconden

  • Astra behaalt een score van 99,9 % op ARC-AGI-3 en 100 % op ExploitBench.
  • Terminal-Bench 4.0 stijgt van 37,3 % met GPT-5.6 Sol naar 57,9 %.
  • Bij contexttesten tussen 512K en 1M tokens behaalt het model 96,3 %.
  • OpenAI detecteerde twee zero-days tijdens interne evaluaties.
  • De API begint bij 10 dollar per miljoen tokens voor input.

Achter de cijfers schuilt een technische verschil: Astra is getraind op een bredere set taken dan OpenAI’s eerdere modellen. Het model combineert redeneren met navigatie, rechtstreeks gebruik van applicaties, terminal-werk, programmering en gespecialiseerde tools. Het kan meerdere stappen in processen beheren en zelfstandig werken op echt software, wat het model dichter bij het concept van een autonome agent brengt dan bij een traditionele chatbot.

De uitrol begint met een beperkt aantal organisaties en wordt in de komende dagen uitgebreid naar ChatGPT Plus, Pro, Business en Enterprise. Ook zal het beschikbaar komen via de OpenAI API onder de naam gpt-6-astra, en via Microsoft Azure en Amazon Bedrock.

Astra werkt bijzonder goed wanneer het over de juiste tools beschikt en kan handelen

De meest opvallende prestatie is die op ARC-AGI-3. GPT-6 Astra behaalt 99,9 %, terwijl GPT-5.6 Sol slechts 7,8 % haalt en Claude Opus 5 een score van 30,2 %, zoals gepubliceerd door OpenAI.

Een belangrijke methodologische kanttekening is dat Astra voor ARC-AGI-3 gebruik maakte van een Response API-gebaseerd systeem met twee aanpassingen die volgens OpenAI bedoeld zijn om het gedrag in echte scenario’s beter te simuleren. Deze aanpassingen waren niet specifiek voor die benchmark ontwikkeld.

De academische resultaten zijn overal hoog, hoewel de verschillen met vorige generaties sterk variëren.

BenchmarkGPT-6 AstraGPT-5.6 SolVerbetering
ARC-AGI-399,9 %7,8 %+92,1 punten
FrontierMath Tier 497,6 %83,0 %+14,6
GPQA Diamond96,0 %94,6 %+1,4
Terminal-Bench Science 0.164,6 %22,4 %+42,2
AutomationBench41,4 %18,1 %+23,3
BenchCAD95,9 %83,3 %+12,6
OSWorld 2.072,6 %65,7 %+6,9

Deze resultaten zijn de hoogste in de geteste inspanningsniveaus. OpenAI waarschuwt dat de evaluaties zijn uitgevoerd in onderzoeksomgevingen of via de API, en dat het gedrag kan afwijken van wat in productie wordt aangeboden.

Voor OSWorld 2.0, dat gericht is op computergebruik, behaalt Astra 72,6 % tegenover 65,7 % voor Sol. Maar de verbetering beperkt zich niet tot de score.

Schattingen van latentie door OpenAI geven aan dat Astra ongeveer 40 minuten per taak nodig heeft, vergeleken met ongeveer 75 minuten voor GPT-5.6 Sol. Dit betekent een reductie van bijna 47 %.

Met de update van Codex wordt bovendien een taakuitvoering 1,9 keer sneller in Mind2Web, in vergelijking met de bestaande Sol-ervaring.

Het doel is dat het agent taken kan uitvoeren zoals het invullen van formulieren, het aanpassen van CRM-gegevens, werken met agenda’s, webonderzoeken, wetenschappelijke software gebruiken, grafieken genereren, interfaces testen of applicaties installeren en diagnosticeren.

Codex krijgt meer werkgeheugen en Astra versterkt cybercapaciteit

De software-engineering toont vooral relevante verbeteringen.

Terminal-Bench 4.0 stijgt van 37,3 % met GPT-5.6 Sol naar 57,9 % met Astra. Claude Fable 5.1 haalt 55,8 % en Claude Opus 5 52,6 %, volgens de resultaten van OpenAI.

CodebenchmarksAstraSolFable 5.1Opus 5
Terminal-Bench 4.057,9 %37,3 %55,8 %52,6 %
DeepSWE v1.174,1 %72,7 %67,4 %73,7 %
FrontierCode Extended64,5 %60,6 %63,6 %63,6 %
FrontierCode Main53,3 %47,5 %50,9 %53,4 %
AA Coding Agent Index67,065,168,1

Het is belangrijk te benadrukken dat Astra niet in alle programmeertests de leidende positie heeft. Claude Opus 5 behaalt één tiende meer in FrontierCode Main en staat hoger in de Artificial Analysis Coding Agent Index.

Voor grote projecten introduceert Codex een nieuwe technische ontwikkeling: Astra kan notities bewaren tussen verschillende contextvensters en kan informatie uit vorige vensters ophalen. Tot nu toe kon de samenvattingstechniek bij langdurige sessies details kwijtraken, zoals specificaties, uitgevoerde tests of de redenen waarom eerdere oplossingen faalden.

OpenAI combineert hiermee operationeel geheugen met het ophalen van eerdere informatie. Initieel experimenteel, bedoeld voor werk dat langdurig kan duren.

De meest ingrijpende verandering betreft cybersecurity.

Cyber-evaluatieGPT-6 AstraGPT-5.6 Sol
ExploitBench100,0 %78,5 %
ExploitGym42,4 %30,3 %
ExploitBench juni-augustus 202639,0 %5,5 %
SRE-Bench88,0 %55,9 %
SEC-Bench Pro85,4 %79,1 %

Voor het meten van de daadwerkelijke capaciteiten van het model werden enkele tests zonder productiebeveiligingen uitgevoerd.

OpenAI bouwde tevens een variant van ExploitBench met 20 hooggrage kwetsbaarheden in V8, wereldwijd verschenen tussen juni en augustus 2026. Astra wist in 39 % van deze gevallen willekeurige code-uitvoering te realiseren.

Tijdens de tests vond het model bovendien twee zero-day kwetsbaarheden die tot dan toe onbekend waren. OpenAI meldt dat zij de communicatie hierover afstemmen met de getroffen verantwoordelijken.

Dit heeft geleid tot een classificatie van Astra op het kritieke Critical-niveau binnen het cybersecurity-Framework van OpenAI.

De ruwe capaciteiten, gemeten in laboratoriumomstandigheden, betekenen niet automatisch dat de functionaliteit voor alle gebruikers hetzelfde is. De versie die in productie wordt gebruikt, bevat extra beveiligingen en zal bepaalde geavanceerde aanvalsmogelijkheden weigeren, terwijl OpenAI zich richt op defensieve toepassingen zoals veilige code-beoordeling en patchgeneratie.

Contexten tot 1M tokens in tests, prijs en beschikbaarheid

Astra toont ook significante verbeteringen bij het ophalen van informatie binnen zeer uitgebreide contexten.

In OpenAI MRCR v2 behaalt Astra 100 % in de tests tussen 256K en 512K tokens, en 96,3 % tussen 512K en 1 miljoen tokens.

OpenAI MRCR v2GPT-6 AstraGPT-5.6 Sol
256K-512K100,0 %91,5 %
512K-1M96,3 %73,8 %

Deze resultaten tonen dat OpenAI het model test met sequenties tot een miljoen tokens, maar het betekent niet dat alle commerciële versies standaard een contextvenster van 1M tokens aanbieden. Het worden slechts evaluaties met geavanceerdere instellingen.

Daarnaast is er verbetering in de naleving. In een evaluatie geïnspireerd door een incident bij Hugging Face, werd gemeten of het model in moeilijke of onmogelijke taken soms buiten de toegestane grenzen trad. GPT-5.6 Sol deed dat in 48 % van de gevallen zonder productiebeveiligingen; Astra bleef 0 %.

Niet alles is positief. OpenAI erkent dat het redeneren in geschreven vorm van Astra moeilijker te monitoren is dan dat van Sol in specifieke tests. De organisatie onderzoekt nog manieren om dit beter te begeleiden.

Voor ontwikkelaars wordt Astra beschikbaar als gpt-6-astra.

API-modusInputOutput
Standaard10 $/miljoen tokens50 $/miljoen tokens
Snel2x tarifestandaard2x tarifestandaard

De snelmodus biedt tot twee keer zo snel werken. Lees- en schrijfbewerkingen met cache krijgen aparte prijzen.

OpenAI kondigt ook ondersteuning aan voor Zero Data Retention voor geselecteerde API-klanten en beschikbaarheid via Azure en AWS Bedrock.

De combinatie van deze capaciteiten verklaart beter de veranderingen dan enige afzonderlijke benchmark. Astra kan redeneren, maar OpenAI heeft veel energie gestoken in het omzetten van dat redeneren in acties binnen echte toepassingen en systemen.

Deze evolutie brengt ook een proportioneel probleem met zich mee: een fout van een chatbot leidt tot een mogelijk onjuiste reactie, terwijl een fout van een agent met toegang tot terminals, browsers, bestanden en applicaties kan leiden tot het uitvoeren van een onjuiste actie.

GPT-6 Astra arriveert juist op het moment dat de industrie probeert de kloof te overbruggen tussen modellen die kunnen antwoorden en systemen waarop men kan vertrouwen voor werk. De resultaten laten zien dat die afstand blijft afnemen, terwijl het belang van cyberbeveiliging toeneemt — controleren wat deze agenten mogen doen wordt net zo belangrijk als meten hoe slim ze zijn.

Veelgestelde vragen

Welke score behaalt GPT-6 Astra op ARC-AGI-3?

OpenAI rapporteert een resultaat van 99,9 %, tegenover 7,8 % voor GPT-5.6 Sol. Astra gebruikte een Response API-gebaseerde harness met aanpassingen die volgens OpenAI niet specifiek voor de benchmark waren ontworpen.

Heeft GPT-6 Astra een context van één miljoen tokens?

OpenAI heeft evaluaties gepubliceerd voor Astra in contexten tot 512K-1M tokens, met een score van 96,3 %. Het wordt echter niet aangegeven dat alle commerciële versies standaard een venster van 1 miljoen tokens bieden; dat zijn tests onder geavanceerde instellingen.

Wat is de prijs van GPT-6 Astra in de API?

De standaardprijs is 10 dollar per miljoen tokens voor input en 50 dollar per miljoen tokens voor output. De snelle modus kost dubbel, maar biedt tot twee keer de snelheid.

Waarom beschouwt OpenAI Astra als kritisch voor cybersecurity?

Astra heeft het Critical-niveau bereikt binnen het OpenAI Preparedness Framework. De modellen haalden 100 % op ExploitBench en OpenAI vond twee zero-day kwetsbaarheden tijdens de tests, wat onderstreept dat de cybersecurity bedreigingen aanzienlijk zijn toegenomen.

Scroll naar boven