AI-agenter, der bruger eksterne værktøjer, er sårbare over for indirekte prompt-injections gemt i miljøets tilstand. Men hidtidig forskning har været begrænset af manuelt byggede miljøer og foruddefinerede angrebspunkter. Nu introducerer ToolHazard, et nyt framework fra Hugging Face-forskningsmiljøet, en skalerbar metode til at syntetisere fjendtlige miljøer, der kan udvides med nye domæner og beregningskraft.
ToolHazard består af tre komponenter: en Environment Simulator, en Attacker Agent og en User Simulator. Sammen genererer de eksekverbare, tilstandsbaserede miljøer, opdager levedygtige injectionspunkter og skaber miljøspecifikke payloads samt langtidsholdbare opgaver. Baseret på frameworket er ToolHazard-Bench bygget til at stressteste agenter under komplekse arbejdsgange og forskellige miljøangreb.
Eksperimenter viser betydelige sårbarheder hos agenter, og at timing og placering af injectioner påvirker angrebseffektiviteten. Vigtigst: Træningsdata genereret med ToolHazard forbedrer sikkerheden på både ToolHazard-Bench og AgentDojo, uden at det går ud over almindelig opgaveløsning.
For beslutningstagere betyder det, at sikkerhedsvurdering af AI-agenter ikke længere behøver at være en manuel, dyr proces. Frameworket gør det muligt at teste agenter i langt bredere domæner og dermed opdage svagheder, før de udnyttes i praksis. Det er et skridt mod mere robuste agent-systemer, men også en påmindelse om, at nuværende agenter er mere sårbare end ofte antaget.
