En ny evalueringsplatform, LitReview Arena, viser, at selv de bedste AI-systemer til litteraturgennemgang stadig er markant ringere end menneskelige eksperter. I en battle-style test, hvor domæneeksperter sammenlignede anonymiserede udkast, vandt de stærkeste AI-systemer kun 23,0% af de afgørende matcher mod menneskelige udkast på overordnet nytteværdi.
Platformen, beskrevet i et nyt arXiv-paper, indsamlede cirka 3.000 ekspertvurderinger fordelt på fem litteraturgennemgangsspecifikke kriterier. Resultaterne viser, at agentiske LLM'er som Sonar Deep Research klarer sig markant bedre end basismodeller – med over 60% forbedring – men stadig ikke på niveau med mennesker.
Endnu vigtigere for beslutningstagere: Eksisterende LLM-as-a-judge-metoder er stærkt misalignerede med menneskelige eksperter (Spearman's rho=0,467), især på syntesetunge kriterier som papirstruktur og forskningsforslag. Det betyder, at automatiske evalueringer af AI-genereret forskning ikke kan stole blindt på.
Platformen introducerer også en ekspertkalibreret evaluator, LitJudge, som forbedrer alignment til Spearman's rho=0,78 – sammenligneligt med konsistensen mellem menneskelige eksperter. Kode og data er offentligt tilgængelige.
For organisationer, der overvejer at bruge AI til litteraturgennemgange – fx i forskning, due diligence eller strategisk analyse – er implikationen klar: AI kan være et supplement, men ikke en erstatning for menneskelig ekspertise, og automatiske kvalitetsmål skal valideres mod menneskelige domme.
