Mellem oktober 2018 og juli 2026 er AI-modeller gået fra simple systemer som BERT til massive agenter, der løser kompleks matematik og skriver software. Ifølge en ny analyse på arXiv er evnen til at løse reelle kodeproblemer forbedret med næsten seks gange om året siden slutningen af 2024. Det er ikke en lineær udvikling – det er en eksponentiel acceleration, der fundamentalt ændrer, hvad organisationer kan forvente af deres AI-investeringer.

Den vigtigste strategiske pointe er, at prisen på topydelse er kollapset. OpenAIs budgetmodel GPT-5.6 Luna matcher ifølge analysen flagskibskapaciteter for blot 1-6 dollars per million tokens – og slår ældre versioner til en brøkdel af prisen. For beslutningstagere betyder det, at det ikke længere er nødvendigt at betale premium-priser for at få state-of-the-art resultater. Du kan læse de konkrete tal i den fulde analyse.

Samtidig er topydelsen ikke længere samlet i én model. Analysen viser, at markedet er fragmenteret: Claude Opus 5 fører inden for frontend-kodning, Claude Fable 5 excellerer i repository-level kodning, og GPT-5.6 Sol dominerer terminal-opgaver. For en virksomhed betyder det, at valget af model ikke længere er et enten-eller – det handler om at matche den rette model til den rette opgave. En one-size-fits-all-tilgang vil efterlade værdi på bordet.

Endelig viser analysen, at avancerede sampling-metoder kan løfte præstationen markant: I en grundskole-matematiktest løste basale metoder 58 ud af 100 problemer, mens avancerede metoder løste op til 79. Et confidence-ranking-værktøj identificerede korrekt 47 rigtige svar i sine top 50-valg – hvilket gør det yderst nyttigt til at sortere opgaver. Alt forskningsmateriale er offentligt tilgængeligt, så I kan selv validere resultaterne.