Selvom AI-modellers kontekstvinduer er vokset markant, er hallucinationer i lange sammenfatninger stadig en udfordring. Det viser et nyt benchmark, LongNovel, der er designet til at teste modeller på sammenfatning af hele romaner. Benchmarket er konstrueret fra 29 kinesiske romaner (mellem 16.000 og 100.000 tokens) og kapiteldata fra BookSum-datasættet, og det dækker otte forskellige hallucinationstyper.

Det særlige ved LongNovel er, at det undersøger, hvordan hallucinationer ændrer sig, når konteksten bliver længere. Ifølge forskerne bag benchmarket er romaner bedre egnet end nyheder eller artikler til at studere dette fænomen, fordi de indeholder detaljerede beskrivelser af begivenheder og dialoger. Resultaterne viser, at benchmarket er udfordrende for nuværende modeller – hvilket understreger, at selv avancerede systemer stadig finder på indhold, når de skal håndtere meget lange tekster.

For beslutningstagere, der overvejer at bruge AI til at opsummere store dokumentmængder – eksempelvis juridiske dokumenter, rapporter eller forskningsartikler – er dette en vigtig påmindelse om, at hallucinationer ikke forsvinder med større kontekstvinduer. Tværtimod kan risikoen vokse, når mængden af information øges.

Forskerne har offentliggjort benchmarket for at fremme videre forskning, men indtil videre er der ingen løsning, der eliminerer problemet. Det betyder, at virksomheder og organisationer, der implementerer AI-baserede sammenfatninger, bør have processer til at validere output – især når teksterne er lange og komplekse.