Når virksomheder implementerer multimodale AI-modeller, bruger de ofte systembeskeder til at styre adfærd – men en ny benchmark viser, at denne styring har en pris. VSysBench, udviklet på baggrund af MMVet-v2, tester 16 multimodale modeller og finder, at systembeskeder markant forringer modellernes grundlæggende opgaveløsning. Ifølge undersøgelsen er der en direkte afvejning mellem compliance og kapacitet: Jo mere modellen følger systembeskeder, desto dårligere klarer den selve opgaven.

Benchmarken organiserer begrænsninger i 5 hovedkategorier og 22 underkategorier, fra tekstuelle direktiver i visuelle kontekster til fuldt visionsbaserede krav. Hver kategori har en modstridende variant, der stress-tester modellens instruktionshierarki. Resultaterne er klare: Kompliance kollapser under brugerkonflikt for open-weight-modeller, mens top-proprietære modeller forbliver stabile. Visionsbaserede begrænsninger er desuden den sværeste kategori for alle modeller.

For beslutningstagere betyder det, at valget af model ikke kun handler om rå kapacitet, men om hvor robust modellen er i komplekse produktionsmiljøer. Hvis din applikation kræver, at modellen håndterer modstridende instruktioner – fx fra systemet og brugeren – kan open-weight-modeller være en risikabel investering. Proprietære modeller klarer sig bedre, men til en højere pris. Det er værd at overveje, om din use case reelt kræver systembeskeder, eller om de gør mere skade end gavn.