En ny undersøgelse fra arXiv stiller skarpt på, hvordan mennesker og sprogmodeller vurderer citater i AI-svar – et område, der er centralt for at forstå og forbedre pålideligheden af AI-systemer. Undersøgelsen, offentliggjort på arXiv, viser, at menneskelige dommere og fire open-source sprogmodeller har forskellige præferencer, når de sammenligner svar med citater.
Forskerne bag undersøgelsen har analyseret, hvordan citater påvirker parvise vurderinger af AI-svar i forbindelse med videnskabelige spørgsmål. Et af de centrale fund er, at mennesker foretrækker flere forskellige citater, men færre i alt. Sprogmodellerne udviser derimod nogle citation-relaterede præferencer, selvom de ikke har adgang til de faktiske kilder – men disse præferencer afhænger af både data og den specifikke model.
For virksomheder og organisationer, der bygger eller køber AI-systemer, har dette betydning. Præference-data bruges til at træne belønningsmodeller, som er en central del af moderne AI-posttræning. Hvis menneskelige og modelbaserede vurderinger af citater ikke stemmer overens, kan det påvirke, hvordan AI-systemer lærer at præsentere og validere information – og dermed pålideligheden af de svar, de giver.
Undersøgelsen peger på, at der er behov for at gentænke, hvordan præference-data indsamles og bruges, så AI-systemer i højere grad matcher menneskelige forventninger til kildehenvisninger. Det er særligt relevant for beslutningstagere, der skal vurdere kvaliteten af AI-løsninger, hvor troværdighed og kildeangivelse er afgørende.
