En ny forskningsartikel på arXiv viser, at en multimodal sprogmodel kan rekonstruere, hvordan elever svarer på multiple-choice-spørgsmål – og dermed forudsige, hvor svære opgaverne er. Forskerne har finjusteret en model baseret på Qwen3.5 til at gengive valgsandsynligheder for både billed- og tekstbaserede opgaver, trænet på et stort korpus af testopgaver med kendte elevsvar.

Det interessante er ikke kun, at modellen kan forudsige rigtige svar, men at den lærer at reproducere elevernes systematiske fejlmønstre på tværs af forskellige færdighedsniveauer. På den måde fanger modellen de underliggende responssandsynligheder, som traditionelt beskrives med psykometriske modeller som 3PL og MCM. Resultatet er en præcis estimering af opgavesværhedsgrad direkte fra modellens forudsagte svar.

For beslutningstagere i uddannelsessektoren – fra lærebogsforlag til digitale testplatforme – betyder det, at man kan få automatiseret vurdering af opgavers kvalitet og sværhedsgrad uden at skulle gennemføre omfattende pilottests med tusindvis af elever. Det kan accelerere udviklingen af adaptive læringsplatforme og gøre det billigere at validere nye testmaterialer.

Metoden er stadig på forskningsstadiet, men potentialet er klart: Hvis modellen kan generalisere til nye opgavetyper og fagområder, kan den blive et standardværktøj til at kalibrere tests i stor skala – noget der i dag kræver både tid og store elevpopulationer.