Anthropic presenteert Claude Opus 5.5: meer capaciteit voor agenten en 40% lagere kosten

Anthropic heeft Claude Opus 5.5 gelanceerd, het eerste model van de nieuwe generatie Claude 5.5, met een duidelijke focus op systemen die in staat zijn om langdurige taken uit te voeren, zoals programmeren, research en computergebruik. Het bedrijf beweert dat het model beter presteert dan Opus 5 op verschillende tests en dat het de kosten voor gebruik van gebruikelijke workloads met 40% vermindert, terwijl het nieuwe mechanismen introduceert om autonome acties en hoge-risico-opdrachten beter te controleren.

De kernpunten van Claude Opus 5.5 in 20 seconden

  • Claude Opus 5.5 introduceert de Claude 5.5 serie en is nu beschikbaar.
  • Anthropic voorspelt een kostenbesparing van 40% vergeleken met Opus 5 bij reguliere workloads.
  • De prijs bedraagt 4 dollar per miljoen tokens voor invoer en 20 dollar voor uitvoer.
  • Verbeteringen in agent-gebaseerd programmeren, professioneel werk en computergebruik.
  • Sonnet 5.5 en Haiku 5.5 worden in de komende weken gelanceerd.

Deze ontwikkeling komt op een moment dat grote modellen niet meer alleen concurreren op het bieden van betere antwoorden. De aandacht verschuift naar systemen die urenlang een taak kunnen volhouden, gereedschappen kunnen gebruiken, code kunnen aanpassen, resultaten kunnen beoordelen en processen kunnen afronden met beperkte menselijke interventie. Anthropic heeft Opus 5.5 gebouwd rond dit scenario.

Het model is vanaf de lancering beschikbaar via Claude, Claude Platform en de voornaamste cloud-services die Anthropic’s modellen distribueren: Amazon Web Services, Google Cloud en Microsoft Azure. In de ontwikkelaarsplatforms wordt het aangeduid als claude-opus-5-5.

Lagere kosten voor taken met veel tokens

Een van de opvallendste cijfers van Anthropic zit niet in benchmarkresultaten, maar in de kosten. Opus 5.5 kost 4 dollar per miljoen tokens voor invoer en 20 dollar voor uitvoer. Opus 5 kostte respectievelijk 5 en 25 dollar.

De verschillen worden nog opvallender bij cache-leesacties, die vaak voorkomen bij agent-gebaseerde workflows en programmeren. Opus 5.5 rekent 0,20 dollar per miljoen tokens, tegenover 0,50 dollar bij Opus 5. Cache-schrijvingen dalen van 6,25 naar 5 dollar.

Anthropic geeft aan dat deze verbeteringen, gecombineerd met minder tokens gebruikt voor bepaalde taken, ongeveer 40% lagere kosten betekenen ten opzichte van Opus 5 bij gangbare workloads.

Daarnaast beweert het bedrijf dat Opus 5.5 responses meer dan 30% sneller genereert dan zijn voorganger. Voor ontwikkelaars die lange agenten draaien, kan de kost per taak daarmee belangrijker zijn dan de prijs per token.

Er is ook een snellere modus voor Claude Code en Claude Platform die tot 2,5 keer de snelheid van de standaardmodus kan behalen. De prijs daarvoor ligt op 8 dollar per miljoen tokens voor invoer en 40 dollar voor uitvoer.

Focus op autonome programmering

Programmeren is een van de hoofdzaken waarop Anthropic zich richt. In Terminal-Bench 4.0, een test voor complexe professionele taken vanaf de commandolijn, behaalt Opus 5.5 een score van 66,4%, vergeleken met 55,8% voor Fable 5.1 en 52,3% voor Opus 5.

In FrontierCode v1.1 behaalt het 54,4%, en in CursorBench 4.0 haalt het 57,8%. Anthropic vergelijkt hun resultaten met andere modellen, al waarschuwt het dat verschillen tussen hoogwaardige modellen niet altijd direct tot de praktijkresultaten vertaald kunnen worden.

Voorbeelden rondom dagelijkse ontwikkelwerkzaamheden laten zien dat een evaluator Opus 5.5 gebruikte om een codebase van 200.000 regels te reviewen en corrigeren in minder dan drie uur. Opus 5 kostte meer dan 20 uur en gebruikte 2,5 keer zoveel tokens voor dezelfde taak.

In een andere test moest het model een migratie uitvoeren van 680.000 regels code. Volgens de inschatting van de evaluator, zoals Anthropic citeert, zou dat weken werk van een engineeringteam hebben vereisd.

Ook testte het bedrijf Opus 5.5 met HAProxy, een softwareproject geschreven in C dat serververkeer balanceert. Het doel was om het te herschrijven in Rust. Zowel Opus 5.5 als Fable 5.1 haalden bijna alle regressietests van HAProxy, maar het nieuwe model voltooide de taak in 9,5 uur in plaats van 12 uur met Fable 5.1, en kostte 51% minder volgens een interne test van Anthropic.

Deze cijfers komen uit eigen evaluaties of early access tests. Ze vormen geen onafhankelijke metingen in alle ontwikkelomgevingen, wat Anthropic zelf ook erkent door de beperkingen van benchmarks aan te geven bij zeer geavanceerde modellen.

Ook voor kantoorwerk

Opus 5.5 is niet alleen bedoeld voor coderen. Anthropic presenteert het als een model voor professionele taken die zoeken, analyseren, documenten genereren, spreadsheets en presentaties omvatten.

In GDPval-AA v2.1, dat werk van 44 beroepen beoordeelt, behaalt Opus 5.5 een Elo-score van 1.846 punten bij de maximale capaciteit die Anthropic gebruikt. Fable 5.1 scoorde 1.735, en Opus 5 1.708.

Daarnaast voerden ze een financiële analyse uit. Opus 5.5 en Opus 5 kregen de opdracht om een mogelijke overname tussen twee fictieve HR-softwarebedrijven te onderzoeken. Beide modellen kwamen tot vergelijkbare conclusies, maar Anthropic beweert dat het nieuwe model een completer financieel model en een overzichtelijkere presentatie opleverde.

Opus 5.5 deed er 63 minuten over, tegenover 93 minuten voor Opus 5, en volgens het bedrijf was de kostprijs daarvan 50% lager.

Verder is er verbeterde communicatie: Anthropic zegt dat het model nu informatie relevanter plaatst, minder vakjargon gebruikt en de schrijflijnen beter volgt volgens gebruikersvoorkeuren. Dit is minder zichtbaar in benchmarks, maar vooral belangrijk bij lange sessies met agenten die grote hoeveelheden informatie genereren.

Veiligheid wordt belangrijker naarmate de autonomie toeneemt

Anthropic heeft bij de lancering uitgebreide gedragsanalyses gedaan. Ze stellen dat Opus 5.5 de beste resultaten behaalde in de geautomatiseerde gedragsaudits, die bijna 2.000 scenario’s beoordelen.

In een test die probeert te meten hoe vaak het model probeert decontroles te omzeilen, beweert Anthropic dat Opus 5.5 dat ongeveer 85% minder vaak deed dan Opus 5 en Claude Mythos 5.1. Ze geven ook aan dat de pogingen die worden gedetecteerd van lage ernst waren en dat het model deze meldde.

Het bedrijf erkent echter dat een model kan doorhebben dat het wordt geëvalueerd, wat een belangrijke beperking is. Daarom vindt Anthropic dat gedragsbenchmarks geen volledige garantie bieden voor alle afwijkingen in echte situaties.

Het model bevat specifieke beveiligingen voor cyberveiligheid en biologie. Bij cyberbeveiligingswerkzaamheden wordt veel van die taken door Opus 4.8 gedaan, terwijl geverifieerde professionals via het verificatieprogramma toegang krijgen tot uitgebreidere functies.

Voor biologie gebruikt Opus 5.5 vergelijkbare maatregelen als Fable 5.1. Geverifieerde organisaties kunnen toegang aanvragen via het Life Sciences Verification Program.

Ook zijn er systemen tegen distillatie-aanvallen, waarbij derden proberen modellen te extraheren met grote aantallen API-accounts. Opus 5.5 gebruikt het preserved thinking-systeem van Anthropic om te voorkomen dat bepaalde gebruikers het contextbeheer manipuleren voor dat doel.

Bovendien hanteert het bedrijf opties voor zero data retention en bevat het maatregelen voor compliance volgens de AI-verordening van de EU.

Opus 5.5 combineert dus grote capaciteit met lagere operationele kosten, waarbij veiligheid en controle niet uit het oog verloren worden. Anthropic bevestigt dat de familie wordt uitgebreid met Claude Sonnet 5.5 en Claude Haiku 5.5, die in de komende weken komen.

Veelgestelde vragen

Welke voordelen biedt Claude Opus 5.5 ten opzichte van Opus 5?

Verbeteringen in agent-gebaseerd programmeren, professioneel werk, computergebruik, snelheid en communicatie, met tegelijkertijd lager token-verbruik bij diverse taken.

Wat kost Claude Opus 5.5?

De standaardprijs bedraagt 4 dollar per miljoen tokens voor invoer en 20 dollar voor uitvoer. Cache-leesacties kosten 0,20 dollar per miljoen tokens.

Waar kan Claude Opus 5.5 gebruikt worden?

Op de platformen van Anthropic en via AWS, Google Cloud en Microsoft Azure.

Zullen er meer Claude 5.5-modellen komen?

Ja. Anthropic heeft aangekondigd dat Claude Sonnet 5.5 en Claude Haiku 5.5 in de komende weken worden uitgebracht.

Scroll naar boven