Når en AI-model opdateres, klarer den sig typisk bedre i gennemsnit – men det skjuler, at enkelte svar kan blive forringet. Et nyt studie fra arXiv undersøger, hvordan man kan forudsige sådanne regressioner, og finder, at der ikke findes ét universelt signal, der virker på tværs af opgavetyper og modelversioner.
Forskerne sammenlignede signaler fra én enkelt model (tillid, logit-margin, opmærksomhedsentropi) med signaler, der sammenligner versioner (output-KL-divergens, likelihood-drift, token-niveau KL, repræsentationsdrift). Resultaterne viser, at effektiviteten afhænger af opgaven: tillid er stærkest ved multiple-choice og simpel matematik, mens likelihood/KL-signaler giver flest gevinster ved sværere matematik og kode.
For beslutningstagere betyder det, at man ikke blindt kan stole på en ny models overordnede forbedringer. Hvis din organisation bruger AI til opgaver, hvor fejl er dyre – fx kodegenerering eller kompleks matematik – bør du overveje at implementere en selektiv fallback-mekanisme, der sender højrisiko-samples tilbage til den gamle model. Studiet viser, at nogle krydsversionssignaler forbliver informative, selv når tillid fejler, og uden behov for labels – hvilket understøtter et proof-of-concept for en sådan løsning.
Du kan dykke ned i de tekniske detaljer og koden i studiets repository på GitHub.
