En ny sikkerhedsvurdering fra Tencent af DeepSeek Harness (DSH) – et agentisk AI-system – viser, at det er muligt at manipulere systemet via indirekte prompt injection i op til 25,5 % af forsøgene. Angrebet udnytter skjult Unicode i filer, og selv i tekstbaserede angreb nåede man en succesrate på 17,0 %. Det skriver forskerne i et paper på Hugging Face, hvor de også har offentliggjort deres kode.
Undersøgelsen, der omfatter 14.560 kontrollerede kørsler over 16 forskellige kanaler for indirekte indhold, 35 angrebsmål og 12 angrebsmetoder, viser, at DSH's agent-løkke, værktøjsregistrering og modeladapter er sårbare over for indhold, der ikke er blevet betroet. Forskerne brugte både en regelbaseret dommer og en semantisk LLM-baseret dommer til at evaluere resultaterne, og de fandt, at den semantiske dommer oftere tildelte delvis efterlevelse (7,3 % mod 2,0 %).
For beslutningstagere, der overvejer at implementere agentiske AI-systemer, er dette en vigtig påmindelse om, at sikkerhed ikke kun handler om at beskytte mod direkte angreb, men også om at håndtere indirekte indhold – for eksempel filer, e-mails eller websider, som systemet læser. Forskerne peger på, at der bør indføres kontroller mellem upålideligt indhold og følsomme handlinger, og at DSH's behandling af værktøjsresultater og ekstra kontekster bør revurderes.
Selvom undersøgelsen er specifik for DeepSeek Harness, er den et eksempel på en bredere udfordring: Agentiske systemer, der selvstændigt henter og behandler indhold, er sårbare over for manipulation, hvis ikke der er stærke sikkerhedsforanstaltninger på plads. Det bør indgå i enhver risikoanalyse, når man vælger eller bygger AI-løsninger.
