Forskere har præsenteret en ny forsvarsmetode mod generering af skadeligt indhold i tekst-til-billede-modeller. Metoden, kaldet DiSCO, er den første af sin slags, der fungerer fuldstændigt black-box – altså uden adgang til modellens interne mekanismer. Det gør den relevant for virksomheder, der bruger kommercielle, lukkede modeller, hvor man ikke selv kan ændre på vægte eller træningsdata.

DiSCO angriber problemet på prompt-niveau. Den udvider brugerens prompt med en såkaldt suffix via beam search, og optimerer den gennem kontrastiv scoring over billeder, som modellen selv genererer. På den måde undgår den det, forskerne kalder 'benign adversarial'-problemet: prompter, der sprogligt er uskyldige, men som alligevel trigger skadelig generering på grund af modellens lærte datafordeling. Metoden kræver ingen gen-træning, finjustering eller adgang til modelinterna – den kan sættes på som et plug-and-play-modul.

På I2P-benchmarket reducerede DiSCO angrebsraten (ASR) med 37,7 % på ubeskyttede modeller og 25,13 % på allerede forsvarede modeller, samtidig med at den bevarede semantisk troskab og forbedrede billedkoherens. Det er dokumenteret i arXiv-papiret.

For beslutningstagere er pointen klar: Tidligere forsvarsmetoder har krævet white-box-adgang – noget der er umuligt med lukkede API-modeller som dem fra OpenAI, Google eller Anthropic. DiSCO ændrer det regnestykke. Virksomheder, der bygger på kommercielle tekst-til-billede-systemer, kan nu implementere et ekstra sikkerhedslag uden at skulle skifte leverandør eller bede om intern adgang. Det gør metoden interessant for compliance- og sikkerhedsafdelinger, der skal håndtere NSFW-risici i produkter, der eksponerer billedgenerering.

Metoden er stadig på forskningsstadiet, men den peger på en ny retning: at forsvare mod skadeligt indhold kan ske på prompt-niveau, uafhængigt af den underliggende model. Det er en strategisk fordel i et marked, hvor modellerne bliver stadig mere lukkede og kontrollerede.