En ny undersøgelse fra arXiv sår tvivl om, hvorvidt automatiske evalueringsmetoder overhovedet kan måle kreativitet i tekster genereret af store sprogmodeller (LLM'er). Forskningen, som er beskrevet i papiret på arXiv, sammenligner menneskelige vurderinger af noveller fra WritingPrompts-datasættet med både automatiske objektive metrikker og LLM-as-a-Judge-evalueringer.
Resultaterne viser en markant uoverensstemmelse mellem automatiske og menneskelige vurderinger. LLM-baserede dommere udviser en systematisk præference for AI-genererede historier, idet de konsekvent foretrækker deres stilistiske karakteristika frem for uforudsigeligheden og andre kvaliteter ved menneskeskrevne tekster. Korrelationsanalyser viser desuden, at almindeligt anvendte automatiske metrikker har næsten nul sammenhæng med menneskelige vurderinger – både for menneske- og AI-genererede historier.
For beslutningstagere, der bruger automatiske evalueringer til at vurdere kvaliteten af AI-genereret indhold – for eksempel i content-produktion, marketing eller kreative workflows – er dette en vigtig advarsel. Hvis metrikkerne ikke fanger kreativitet, kan man risikere at optimere på forkerte parametre og overse det, der faktisk skaber værdi for menneskelige brugere. Det understreger også vanskeligheden ved at reducere kreativitetens multidimensionelle og subjektive natur til beregningsmæssige målinger.
