En ny benchmark, Sci-VBench, viser, at selv de bedste AI-videogenereringsmodeller kan producere visuelt imponerende videoer, men fejler, når det kommer til videnskabelig og kausal korrekthed. For beslutningstagere, der overvejer AI til undervisning, forskning eller medicinsk kommunikation, er dette en vigtig advarsel: modellerne kan se overbevisende ud, men deres indhold kan være videnskabeligt forkert.

Sci-VBench er udviklet til at evaluere AI-modellers evne til at generere videoer, der kræver videnskabelig ræsonnering og viden. Den indeholder 1.253 ekspert-annoterede eksempler fordelt på 60 emner inden for naturvidenskab, sundhed, humaniora og samfundsvidenskab samt ingeniørvidenskab. Hvert eksempel kræver, at modellen genererer tidsmæssigt rige videoer, der går ud over overfladisk visuel plausibilitet og kræver videnskabelig forståelse.

Resultaterne er markante: Selvom automatiske målinger af perceptuel kvalitet ligger tæt på tværs af systemerne, er der store forskelle på modellernes evne til at følge prompten og sikre videnskabelig og kausal korrekthed. Der er især et udtalt gab mellem proprietære og open-source modeller. Med andre ord: visuel realisme er ikke længere den største udfordring — det er modellernes evne til at forstå og formidle videnskabelige sammenhænge.

For virksomheder og organisationer, der ønsker at bruge AI-genereret video til undervisningsmateriale, videnskabelig formidling eller træningsvideoer, betyder det, at man ikke kan stole blindt på outputtet. Selvom videoen ser professionel ud, kan den indeholde fejl i kausale sammenhænge, der kan vildlede modtagere. Det kræver menneskelig gennemgang eller begrænsning af anvendelsesområder, hvor korrekthed er kritisk.

Benchmarken etablerer også en evalueringsprotokol baseret på rubrikker, hvor både ikke-eksperter og MLLM-as-Judge-systemer kan opnå relativt høj overensstemmelse med ekspertvurderinger. Det gør det muligt at reproducere evalueringer i stor skala — en praktisk fordel for virksomheder, der vil sammenligne modeller internt.