Når flere AI-agenter skal koordinere deres handlinger – fx i logistik, energistyring eller finans – er de sårbare over for angreb, hvor en eller flere agenter i al hemmelighed overskriver den fælles plan. Hidtil har det været uklart, hvor meget sikkerhed man reelt kan garantere. Ny forskning fra arXiv giver nu både et teoretisk loft og en konkret algoritme til at lære sikker adfærd under sådanne skjulte angreb.
Forskerne viser, at angriberens information afgør problemets struktur: En angriber, der kan se den planlagte handling, før den overskrives, skaber en anden type usikkerhed end en blind angriber. Det betyder, at sikkerhedsstrategien skal tilpasses, afhængigt af hvad man antager om angriberen. Læs mere om de tekniske detaljer i det originale paper.
Det vigtigste resultat er, at man kan opnå en såkaldt sikkerhedsregret, der vokser med kvadratroden af antallet af beslutningsrunder – et teoretisk optimalt niveau. Samtidig viser de, at man ikke kan undgå en vis afhængighed af, hvor meget angriberen kan afvige fra den forventede adfærd. Det giver virksomheder en klar forventning: Sikkerhed koster noget, men det er begrænset og forudsigeligt.
For beslutningstagere betyder det, at multi-agent-systemer kan designes med et dokumenteret sikkerhedsniveau, selv når man ikke kan stole på alle agenter. Det er relevant for alle, der overvejer at udrulle autonome agenter i kritiske processer – fra forsyningskæder til infrastruktur.
