En ny undersøgelse fra arXiv sår tvivl om pålideligheden af moderne LLM-ledertavler. Forskere har systematisk varieret evalueringsopsætningen – rækkefølgen af svarmuligheder, promptens formulering og om svaret læses fra genereret tekst eller fra sandsynligheder for hver mulighed – og fundet, at en models score kan variere dramatisk afhængigt af disse valg. Eksempelvis scorer modellen gemma4-31b mellem 31 og 89 procent korrekt, alt efter hvilken opsætning der bruges.

Forskerne introducerer et 'fragility grid', hvor 12 åbne, instruktions-tunede LLM'er fra 4 familier besvarer de samme 3.679 spørgsmål fra fire benchmarks under 26 forskellige, men lige forsvarlige, opsætninger. Resultatet: en models score er et bånd, ikke et punkt. Fire af de 12 modeller kan nå førstepladsen under en eller anden opsætning, hvilket betyder, at selve evalueringsopsætningen kan afgøre, hvem der vinder.

Vigtigst er, at de spørgsmål, der adskiller to nærliggende modeller – og som derfor er afgørende for rangeringen – er netop de mest skrøbelige. Hele 95,7 procent af forskellen mellem to tilstødende modeller kan tilskrives sådanne skrøbelige spørgsmål. Desuden finder forskerne en korrelation på 0,28 mellem et spørgsmåls diskriminationsevne (hvor godt det adskiller modeller) og dets skrøbelighed, hvilket betyder, at metoder til at komprimere benchmarks ofte bevarer de skrøbelige spørgsmål frem for at fjerne dem.

For beslutningstagere, der bruger ledertavler til at vælge eller investere i AI-modeller, er implikationen klar: En models placering kan være et artefakt af evalueringsopsætningen, ikke et udtryk for reel overlegenhed. Forskningen understreger behovet for at se på robusthed på tværs af opsætninger, ikke kun en enkelt score. Forskerne har offentliggjort deres data og analyse-script, så resultaterne kan efterprøves.