En ny testmetode fra forskere på arXiv viser, at selv de bedste AI-agenter har markante problemer med rumlig forståelse – en grundlæggende evne, når de skal navigere eller manipulere objekter i den fysiske verden. Metoden, kaldet MetaSpace, opdagede over 90.000 fejl i topmodeller og giver dem en gennemsnitlig score på 0,44-0,52, mens mennesker klarer sig med 0,96.
Forskerne bag MetaSpace argumenterer for, at traditionel evaluering af AI-agenter – som manuel VQA-annotering eller opgavegennemførelse – er utilstrækkelig. Manuel annotering er arbejdskrævende og varierer i kvalitet, mens opgavemålinger kan skjule alvorlige svagheder, fordi agenter kan fuldføre opgaver på uhensigtsmæssige eller usikre måder. MetaSpace automatiserer testen ved at generere testcases baseret på logiske regler og fysiske love, kodet i Prolog, og registrerer overtrædelser som tegn på fejl i rumlig kognition.
For beslutningstagere er konsekvensen klar: AI-agenter, der skal bruges i fysiske miljøer – eksempelvis robotter i lagerhaller eller autonome køretøjer – er ikke pålidelige nok endnu. Den lave score indikerer, at der er et stort gab mellem nuværende modellers evner og de krav, som virkelige opgaver stiller. Det betyder, at virksomheder bør være varsomme med at implementere sådanne systemer i sikkerhedskritiske sammenhænge, og at der er behov for mere robust testning, før man kan stole på dem.
MetaSpace tilbyder en ny standard for evaluering, som kan hjælpe med at identificere svagheder tidligere i udviklingsprocessen. For investorer og teknologiledere er det et signal om, at der stadig er betydelige udfordringer at løse, før AI-agenter kan udbredes bredt i fysiske opgaver.
