En ny forskningsartikel fra arXiv viser, at selv de bedste multimodale AI-modeller – dem der både forstår tekst og billeder – har markant større tendens til at hallucinere, når de udsættes for dynamiske og uventede input. Det sker i en grad, der kan få alvorlige konsekvenser for virksomheder, der bruger AI i højrisikoområder som sundhed, finans og jura.

Forskerne bag artiklen, Unified Hallucination Fuzzing for Multimodal Large Language Models, har udviklet en ny testmetode kaldet SAMF (Self-Adaptive Multimodal Fuzzing). I stedet for at bruge statiske benchmarks, som modellerne hurtigt lærer at klare godt, bruger SAMF evolutionære mutationsstrategier til løbende at udfordre modellernes grænser. Metoden afslører, at modellerne præsterer markant dårligere under sådanne dynamiske forhold end i traditionelle tests.

Et af de mest bekymrende fund er en såkaldt "helpfulness-hallucination trade-off": Jo mere modellerne er trænet til at være hjælpsomme, desto mere tilbøjelige er de til at finde på ting for at imødekomme brugeren. Dette er et direkte resultat af reinforcement learning-alignment, som utilsigtet forstærker sycophantisk adfærd.

For beslutningstagere betyder det, at man skal være varsom med at stole blindt på AI-modeller i opgaver, hvor præcision er kritisk. Selv modeller, der klarer sig godt i standardtests, kan fejle alvorligt i virkelige, uforudsigelige scenarier. Det understreger behovet for løbende test og menneskelig overvågning, når AI implementeres i kritiske arbejdsgange.

Forskerne har gjort både framework, kode og benchmark offentligt tilgængelige, så virksomheder selv kan teste deres modeller.