En ny undersøgelse fra arXiv viser, at indholdet i svar fra store sprogmodeller (LLM'er) ikke er stabilt, når man skifter mellem forskellige modeller. Forskerne sammenlignede svar genereret af forskellige LLM'er på baggrund af beskeder fra ægte samarbejdssamtaler – både med og uden forudgående chat-historik. Resultaterne viser, at både modelvalg og kontekst påvirker, hvor ens svarene er, og hvor tæt de ligger på menneskelige svar. Det betyder, at prompting og samtale-kontekst alene ikke er nok til at sikre ensartede svar på tværs af modeller, hvilket understreger behovet for infrastruktur og designstrategier, der kan opretholde stabile og sammenlignelige svar i takt med den hurtige udvikling af LLM'er.

For beslutningstagere er implikationen klar: Hvis din virksomhed bruger LLM'er til automatiserede vurderinger – fx i undervisning, HR eller kundeservice – kan resultaterne ændre sig, blot fordi du opgraderer til en nyere model eller skifter leverandør. Det gør det vanskeligt at sammenligne resultater over tid og at stole på, at AI-baserede vurderinger er konsistente. Forskerne peger på, at der er behov for nye designstrategier og infrastruktur, der kan sikre stabile svar på tværs af modeller – et område, der bliver kritisk, efterhånden som flere processer automatiseres.