En ny benchmark fra Hugging Face, MobilePA-Bench, sætter fokus på en af de helt store udfordringer for AI-agenter: at navigere i den komplekse, virkelige verden på en mobilenhed. Mens eksisterende benchmarks enten tester overfladisk skærmmanipulation eller offline API-kald, der er afkoblet fra virkelighedens begrænsninger, simulerer MobilePA-Bench et eksekverbart miljø med levende app-databaser og struktureret feedback. Det giver et mere realistisk billede af, hvordan agenter klarer sig, når de skal samarbejde med underagenter, huske tidligere præferencer og bruge færdigpakkede færdigheder – tre avancerede dimensioner, som de fleste nuværende benchmarks overser.
Resultaterne er nedslående for de førende AI-modeller: Ydeevnen falder markant, når agenterne skal håndtere strenge værktøjsrækkefølger, tilladelsesbegrænsninger og uventede runtime-fejl. Det betyder, at selv de bedste modeller i dag er upålidelige i mobile sammenhænge – en central erkendelse for enhver, der overvejer at bygge eller investere i mobile AI-assistenter.
For beslutningstagere er implikationen klar: Mobile AI-agenter er endnu ikke klar til mission-critical opgaver. Men MobilePA-Bench tilbyder også en konstruktiv vej frem – den fungerer både som et diagnostisk værktøj og som en interaktiv platform for forstærkningslæring, hvilket kan accelerere udviklingen af pålidelige mobile agenter. Det er værd at følge, hvis man planlægger at implementere eller investere i denne teknologi.
