En ny undersøgelse fra arXiv viser, at AI-genererede litteraturreviews — selv med store kontekstvinduer — ikke lever op til akademiske standarder uden menneskelig gennemgang. Forskerne evaluerede 20 AI-genererede reviews baseret på kilder fra Semantic Scholar og arXiv og fandt, at LLM'erne har svært ved at balancere bredde og dybde.
Resultaterne peger på, at større kontekstvinduer giver LLM'erne mulighed for at inkorporere mere information og opretholde sammenhæng over længere input, men samtidig forværrer de problemer som indholdsgentagelse, udeladelse af kritisk arbejde og en tendens til beskrivelse frem for syntese. Det betyder, at AI-genererede reviews kan fungere som fundamentale oversigter, men at deres output skal kritisk evalueres og forfines af domæneeksperter.
For beslutningstagere i forskning og uddannelse er implikationen klar: AI kan accelerere den indledende litteratursøgning, men ikke erstatte den menneskelige vurdering, der kræves for at sikre kvalitet og relevans. Virksomheder og institutioner, der overvejer at implementere AI-assisterede forskningsværktøjer, bør budgettere med menneskelig oversight som en fast del af workflowet.
