En ny benchmark, ASI-Bench, er den første til at teste AI-systemers evne til at drive videnskabelig forskning autonomt – fra metodevalg til verificerbare resultater. Resultaterne er nedslående: Selv de bedste agent-modeller falder fra en gennemsnitlig score på 50,91 med fuld menneskelig vejledning til 26,62, når de selv skal bestemme metoden. Det viser, at nutidens AI stadig er dybt afhængig af menneskelig styring og langt fra kan gennemføre forskning end-to-end uden hjælp.
Benchmarken, bygget af over 40 eksperter med 31.000+ arbejdstimer, indeholder 60 projektniveau-forskningsopgaver på tværs af 11 videnskabelige domæner. Den adskiller sig ved gradvist at fjerne metodisk vejledning for at se, hvor langt AI kan klare sig alene – et centralt skridt mod at forstå, hvornår vi kan forvente kunstig superintelligens (ASI).
For beslutningstagere er implikationen klar: Hvis du overvejer at investere i eller bygge autonome forskningssystemer, er der stadig et stort gab mellem ambition og realitet. De nuværende systemer er gode til at anvende eksisterende viden, men de mangler evnen til at udforske det ukendte og skabe ny viden selvstændigt. Det betyder, at menneskelig ekspertise forbliver uundværlig i forskningsprocessen – i hvert fald indtil videre.
ASI-Bench er åben for verden, og forskere opfordres til at bidrage med nye opgaver for at udfordre AI'ens grænser. Det er et vigtigt redskab for alle, der vil måle fremskridt mod ægte autonom forskning.
