Een benchmark test 24 AI-modellen tegen menselijke schrijvers in 475 verhalen

Vulsar AI heeft een benchmark gepubliceerd die de creatieve schrijftoepassingen van 24 kunstmatige intelligentiemodellen test en vergelijkt met teksten van menselijke auteurs. De studie, gebaseerd op 475 prompts, plaatst GPT 6 Astra met een verwachte succespercentage van 87,8 % in de algemene ranglijst, tegenover 86,6 % voor de menselijke referentie. De verschillen worden echter groter wanneer onderscheid wordt gemaakt tussen professionele en hobbyistische schrijvers.

De kernpunten van de Vulsar creatieve schrijfbenchmark in 20 seconden

  • Vulsar heeft 24 AI-modellen vergeleken met menselijke schrijvers via 475 prompts.
  • GPT 6 Astra behaalt een verwachte succesratio van 87,8 % in de algemene uitslag.
  • Menselijke schrijvers scoren 86,6 % in dezelfde classificatie.
  • Voor professionele schrijvers daalt Astra naar 76,2 %, terwijl de menselijke referentie bijna perfect is met 99,9 %.
  • Onder hobbyisten bereikt Astra 93,9 %, tegenover 79,7 % bij menselijke amateurs.

De benchmark, gepubliceerd op 17 september 2026, probeert een capaciteit te meten die lastiger te vergelijken is dan de gebruikelijke tests in wiskunde, programmeren of kennis. Vulsar zoekt niet alleen te bepalen of een model coherente tekst kan genereren, maar ook welke verhalen het meest door mensen worden gewaardeerd.

De methode gebruikt een beloningsmodel dat is getraind op menselijke voorkeuren voor creatieve teksten. Vulsar gebruikt geen ander taalmodel als ultieme beoordelaar of een traditionele beoordelingsrubriek met meerdere criteria. Het systeem vergelijkt de antwoorden en berekent een voorspelde overwinningratio voor elk deelnemend model.

GPT 6 Astra leidt de algemene ranglijst

GPT 6 Astra behaalt een verwachte succesratio van 87,8 %, vergeleken met 86,6 % voor de menselijke referentie. Het verschil van 1,2 procentpunt wordt gepresenteerd als een inschatting van voorkeur, niet als een absolute maat voor literaire kwaliteit.

PositieModel of referentieVerwachte overwinning
1GPT 6 Astra87,8 %
2Menselijke schrijvers86,6 %
3GPT 5.6 Sol77,6 %
4Muse Spark 1.370,6 %
5Claude Fable 5.170,3 %
6Claude Opus 563,4 %
7GPT 5.6 Terra62,6 %
8GPT 5.6 Luna61,8 %
9Kimi K361,0 %
10Grok 4.659,3 %

Onder de modellen vinden we GLM 5.3 Flash met 54,6 %, Qwen3.8 2.4T A95B met 53,9 %, en Inkling met 52,3 %. Verder naar onderen in de ranglijst staan Gemma 4 31B met 23,4 %, Qwen3.8 27B met 23,2 %, DeepSeek V4.1 Flash met 19,8 %, DeepSeek V3.2 met 16,5 %, en Gemma 4 26B A4B met 10,9 %.

De studie registreert ook verschillen in de lengte van verhalen. Menselijke schrijvers produceren gemiddeld 2.592 tokens, terwijl GPT 6 Astra op 1.537 blijft. Claude Opus 5 haalt 2.330 tokens en Claude Fable 5.1 bereikt 2.114 tokens.

Lengte wordt echter niet als criterium gebruikt voor de rangschikking. De benchmark is ontworpen om de verwachte voorkeur te meten volgens het beloningsmodel van Vulsar.

Professionele schrijvers maken een veel groter verschil

Het verschil wordt duidelijker wanneer de benchmark professionele auteurs onderscheidt. In deze categorie behaalt menselijke auteurs een succesratio van 99,9 %. GPT 6 Astra scoort 76,2 %, terwijl Grok 4.6 78,5 % behaalt.

PositieModel of referentieVerwachte overwinning
1Professionele schrijvers99,9 %
2Grok 4.678,5 %
3GPT 6 Astra76,2 %
4Claude Fable 5.169,8 %
5Muse Spark 1.364,9 %
6Qwen3.8 2.4T A95B63,6 %
7Claude Opus 563,3 %
8GPT 5.6 Sol63,1 %

De verschillen in tekstlengte tussen AI-modellen en professionele auteurs bevestigen dat professionele auteurs gemiddeld 4.528 tokens per verhaal produceren, tegenover 1.745 tokens voor GPT 6 Astra. Vulsar benadrukt dat de prompts voor professionele schrijvers meer gedetailleerde instructies en eisen bevatten, zodat deze classificatie niet simpelweg kan worden vergeleken met de algemene rangorde.

De vergelijking toont dat de prestaties van een model kunnen variëren afhankelijk van de taak en het niveau van de menselijke referentie. Een wereldwijde ranking verdoezelt die nuances.

Modellen presteren beter bij hobbyisten

In de categorie van hobbyistische schrijvers laten modellen een ander patroon zien. GPT 6 Astra behaalt 93,9 %, GPT 5.6 Sol 85,2 %, en de referentie onder hobbyisten ligt op 79,7 %.

PositieModel of referentieVerwachte overwinning
1GPT 6 Astra93,9 %
2GPT 5.6 Sol85,2 %
3Hobbyistische schrijvers79,7 %
4Muse Spark 1.373,5 %
5Claude Fable 5.170,5 %
6GPT 5.6 Terra70,2 %
7GPT 5.6 Luna67,4 %
8Claude Opus 563,5 %

De significante dal tussen deze categorie en die van professionele auteurs is een van de meest opvallende uitkomsten. GPT 6 Astra scoort 93,9 % bij hobbyisten maar daalt naar 76,2 % bij professionele auteurs.

Het resultaat impliceert dat de vergelijking altijd afhankelijk blijft van de gebruikte prompts, de referentiegroep en het systeem om voorkeuren te meten, zodat geen echte algemene uitspraak gemaakt kan worden over of AI beter schrijft dan mensen.

Scroll naar boven