En ny forsvarsmekanisme mod generering af upassende billeder lover at beskytte tekst-til-billede-modeller uden at kræve adgang til selve modellen. Metoden, kaldet DiSCO, er designet som et plug-and-play-modul, der opererer udelukkende på prompt-niveau og dermed kan anvendes på enhver eksisterende model – også proprietære systemer, hvor man ikke kan ændre på de interne vægte.
DiSCO adresserer et kritisk hul i eksisterende forsvar: det såkaldte 'benigne adversarial problem', hvor en prompt er sprogligt uskyldig, men stadig trigger skadelig generering på grund af modellens lærte datafordeling. Tidligere forsvarsmetoder har enten krævet hvid-boks-adgang (adgang til modelinterna) eller været begrænset til LLM-baseret prompt-omskrivning, som netop fejler i dette regime.
DiSCO løser problemet ved at udvide prompten med en suffix, der optimeres via beam search og kontrastiv scoring over sikre og usikre billeder genereret af selve modellen. Processen er iterativ og adaptiv, indtil der produceres sikkert indhold – alt sammen uden at ændre på modellen. På I2P-benchmarken reducerer DiSCO angrebsraten (ASR) med 37,7% på ubeskyttede modeller og 25,13% på allerede forsvarede modeller, samtidig med at den bevarer semantisk troskab og forbedrer billedkoherens.
For beslutningstagere, der bygger eller køber tekst-til-billede-systemer, betyder det, at sikkerhed nu kan håndteres som et eksternt lag – uden at skulle investere i dyre modelændringer eller opgive fleksibiliteten ved at bruge proprietære API'er. DiSCO er arkitektur-agnostisk og kan implementeres direkte på ethvert eksisterende system, hvilket gør det til en attraktiv mulighed for virksomheder, der ønsker at styrke deres indholdsmodereringskapacitet uden at kompromittere ydeevne eller fleksibilitet.
