Når AI bruges til at generere testspørgsmål, er der en skjult mellemregning: et computerværktøj, der vælger, hvilke spørgsmål der overhovedet når frem til de psykometriske eksperter. En ny undersøgelse fra arXiv viser, at dette værktøj ikke er neutralt – det kan ændre, hvilke spørgsmål der overlever, og hvilke egenskaber de måler.
Forskerne bag undersøgelsen fulgte 32.000 udvalgte Big Five-spørgsmål gennem hele processen: fra semantisk repræsentation, over strukturel screening, til konstruktion af kandidat-formularer. Selvom de overordnede mønstre så ens ud, afslørede detaljerne store forskelle: identiske formuleringer fik forskellig evidens, forskellige spørgsmål overlevede, og tilsigtede egenskaber kunne forsvinde – selv når den samlede overensstemmelse blev bedre.
Den mest markante konsekvens: På tværs af forskellige opsætninger delte de inklusive primære formularer kun i gennemsnit 6 ud af 40 spørgsmål. Med andre ord: Ændrer man bare repræsentationen, ændres indholdet dramatisk – selvom de samlede statistikker ser stabile ud.
For beslutningstagere betyder det, at man ikke kan stole på, at et AI-system til testudvikling er ensartet, bare fordi de overordnede resultater ligner hinanden. Hvis man køber eller bygger sådanne værktøjer, skal man kræve gennemsigtighed i, hvordan spørgsmålene udvælges – og være opmærksom på, at små tekniske valg kan have store konsekvenser for, hvad der reelt bliver målt.
