Efterhånden som sprogmodeller automatiserer skrivningen af videnskabelige oversigtsartikler, bliver den sværeste opgave at vurdere kvaliteten af resultatet. Et nyt forskningsprojekt, SurveyReview, præsenterer et benchmark og et datasæt, der systematisk måler, hvor godt automatiske evaluatorer matcher menneskelige reviewere.
Forskerne bag har indsamlet og annoteret 675 oversigtsartikler med 1.630 review-rapporter. De strukturerer fritekst-kommentarer fra ægte peer review i fire dimensioner: Læsbarhed, Kritiskhed, Dækning og Struktur. Dette gør det muligt at sammenligne automatiske evaluatorer med menneskelige vurderinger på en reproducerbar måde.
Som baseline har de udviklet SurveyAlign, en evaluator baseret på Qwen3-32B, finjusteret med LoRA på det annoterede data. På testsettet reducerer SurveyAlign den gennemsnitlige kvadratfejl (MSE) fra 2,28 til 1,38 og den gennemsnitlige absolutte fejl (MAE) fra 1,15 til 0,69 sammenlignet med prompt-baseret bedømmelse med GPT-5.2. Det er en markant forbedring i overensstemmelse med menneskelige reviewere.
For beslutningstagere, der overvejer at bruge AI til at generere eller kvalitetssikre forskningsoversigter — fx i due diligence, markedsanalyser eller teknologiscans — betyder dette, at der nu findes en standard for, hvor pålidelige automatiske evaluatorer kan være. Det gør det lettere at vurdere, om en AI-genereret oversigt kan stole på, og hvor meget menneskelig kontrol der stadig er nødvendig.
