Vision-sprogmodeller (VLM'er) klarer sig stærkt på opgaver som billedtekstgenerering og visuel spørgsmål-besvarelse, men de er primært trænet på engelsksprogede data. Det begrænser deres evne til at forstå kulturelt funderet visuel information og fører til fejl i fortolkningen af regionsspecifikke betydninger, symbolske indhold og kontekstafhængige visuelle signaler. Det skriver forskerne bag det nye benchmark PoVisLE, som er designet til at evaluere kulturel kompetence hos VLM'er i en polsk kontekst.
Eksisterende benchmarks for kulturel kompetence er ofte skabelondrevne og fokuserer på overfladisk genkendelse, hvilket gør dem utilstrækkelige til at vurdere dybere sproglig og pragmatisk forståelse i kulturelt situerede sammenhænge. PoVisLE adresserer dette ved at introducere en monokulturel benchmark, hvor sprog fortolkes i interaktion med visuel kontekst. Datasættet indeholder 1.117 billeder og 2.366 manuelt annoterede VQA-par, hvilket giver en kontrolleret og udfordrende ressource til at vurdere kulturelt funderet vision-sprogforståelse ud over overfladisk genkendelse.
For beslutningstagere betyder dette, at modeller, der skal implementeres i ikke-engelske markeder, kan have skjulte svagheder, som ikke opdages med eksisterende benchmarks. Virksomheder, der bygger eller køber AI-løsninger til lokale markeder, bør overveje at teste modeller mod kulturelt specifikke evalueringer som PoVisLE for at undgå fejl i brugeroplevelsen og forstå modellernes reelle kapabiliteter.
