GUI-agenter, der automatiserer opgaver på Android-enheder, er markant sårbare over for uventede hændelser under kørsel – såsom pop-ups eller fejlagtige handlinger. Det viser en ny benchmark kaldet AnTrap, som systematisk tester agenters robusthed ved at injicere dynamiske forstyrrelser i deres eksekveringsforløb. Ifølge undersøgelsen afslørede evaluering af 16 førende GUI-modeller en universel sårbarhed, hvor selv de stærkeste modeller oplevede betydelig præstationsforringelse.

AnTrap introducerer en taksonomi, der organiserer virkelige anomalier i fire lag – State, Thinking, Action og Round – med ti underkategorier. Denne struktur gør det muligt at adskille forskellige typer af fejl og vurdere, hvorvidt de kan løses gennem træning. Forskerne testede også GRPO-træning i både originale og adversarielle miljøer, hvilket viste, at enkeltstående fælder på state- og action-lagene i høj grad kan håndteres gennem adversariel reinforcement learning. Dybere kontekstuelle fælder, som state deadlock, afslørede dog iboende begrænsninger, der ikke kan løses alene ved træning i miljøer med fælder.

For beslutningstagere, der overvejer at implementere GUI-agenter i produktionsmiljøer – eksempelvis til automatiseret test, kundesupport eller app-administration – er dette en kritisk advarsel. Selv avancerede agenter kan fejle uforudsigeligt i dynamiske miljøer, hvilket stiller krav til menneskeligt tilsyn og robustheds-testning før udrulning. AnTrap kan fungere som et værktøj til at evaluere agenters pålidelighed, men resultaterne understreger, at nuværende modeller ikke er klar til fuldautomatisk drift uden overvågning.