En ny forskningsartikel fra Hugging Face viser, at instruction-tuned sprogmodeller – altså modeller, der er finjusteret til at følge instruktioner – bliver markant mere verbalt selvsikre, uden at deres præcision forbedres tilsvarende. Faktisk falder deres kalibrering, hvilket betyder, at modellernes tillid til egne svar i stigende grad afviger fra, hvor ofte de faktisk har ret.
Forskerne evaluerede tre matchede par af base- og instruction-tuned modeller på question-answering benchmarks. Resultaterne viser, at instruction tuning konsekvent ændrer modellernes selvtillid, selvom den prædiktive nøjagtighed kun ændrer sig begrænset. Samtidig falder diversiteten i de rationale-ræsonnementer, modellerne genererer – de bliver mere ensartede i deres tankeprocesser, hvilket kan være et problem i opgaver, hvor variation er vigtig.
For beslutningstagere, der bruger AI i kritiske processer – eksempelvis kundesupport, juridisk analyse eller medicinsk rådgivning – er dette en vigtig påmindelse om, at en models verbale selvsikkerhed ikke er et pålideligt signal for korrekthed. En model, der lyder overbevisende, er ikke nødvendigvis mere præcis – tværtimod kan finjusteringen have skabt en skævvridning.
Forskningen understreger behovet for at validere AI-output i kontekster, hvor fejl har konsekvenser, og for at være opmærksom på, at finjustering kan have utilsigtede effekter på modellens adfærd ud over de umiddelbare præstationsmålinger.
