Et nyt benchmark, Video-IFBench, viser, at selv avancerede multimodale AI-modeller har store problemer med at følge komplekse instruktioner i video-sammenhænge. Mens eksisterende benchmarks primært måler, om modellerne kan fortolke videoindhold korrekt, fokuserer Video-IFBench på, hvorvidt modellerne rent faktisk overholder brugernes specifikke krav – såsom at vælge den rigtige handling baseret på både visuelt og lydmæssigt indhold.

Benchmarket, udviklet af forskere og præsenteret på Hugging Face, introducerer en instruktionstaksonomi med fire skabeloner: enkeltopgave, multi-opgave, selektion og indlejrede instruktioner. Det dækker 32 opgavetyper og 39 forskellige begrænsningskategorier, både semantiske og formelle. Dataene er bygget via en semi-automatisk pipeline, der kombinerer MLLM'er, programmatisk behandling og menneskelig verifikation, hvilket resulterer i 1.500 prøver.

Evalueringen af mere end 20 nylige MLLM'er viser, at instruktionsfølgning i video forbliver en udfordring – især når instruktioner indeholder mange begrænsninger, semantiske krav eller komplekse betingede strukturer, hvor modellen skal vælge den korrekte gren eller sti baseret på videoindholdet.

For beslutningstagere, der overvejer at implementere multimodal AI i produkter eller processer – for eksempel inden for automatiseret videoanalyse, kundesupport eller indholdsmoderering – er dette en vigtig påmindelse om, at modellernes evne til at forstå video ikke er det samme som deres evne til at følge instruktioner. Hvis en model ikke kan håndtere komplekse betingede instruktioner pålideligt, kan det føre til fejl i automatiserede workflows, hvor præcision er afgørende.