Forskere har udviklet NeuronFuzz, en ny metode til at evaluere sikkerheden af sprogmodeller (LLM'er) mod jailbreak-angreb. Metoden adskiller sig markant fra eksisterende tilgange ved at analysere modellens interne 'sikkerheds-neuroner' i stedet for kun at vurdere de genererede svar. Dette gør processen markant hurtigere og mere effektiv, især for stærkt justerede modeller, hvor traditionelle metoder ofte giver begrænset feedback.

Traditionel sikkerhedstestning af LLM'er kræver, at hvert kandidat-prompt genererer et svar fra modellen for at vurdere, om angrebet lykkes. Dette er både ressourcekrævende og giver kun sparsom vejledning, når modellen afviser de fleste angreb med samme fejlmeddelelse. NeuronFuzz løser dette ved at bruge en 'SafetyOracle', der konverterer aktiveringer fra sikkerheds-neuroner til en kontinuerlig sikkerhedsalarm-score. Denne score kan opnås under 'prefill'-fasen, hvilket eliminerer behovet for at generere svar i fuzzing-loopet.

Metoden identificerer et kompakt sæt af sikkerheds-neuroner ved hjælp af skabelon-invariante skadelige og godartede input samt stabilitetsbaseret udvælgelse. Da sikkerhedsalarm-scoren er differentiabel, kan NeuronFuzz bruge gradienter til at identificere sikkerhedsfølsomme skabelonpositioner og en maskeret sprogmodel til at generere flydende, kontekstkompatible mutationer, der bevarer det oprindelige skadelige indhold.

Evalueringer på tværs af 21 tekst- og multimodale modeller viser, at NeuronFuzz opnår en jailbreak-opdagelsesrate på 76-100% på fem white-box-kildemodeller, hvilket overgår baseline-metoder med op til 48 procentpoint. De optimerede skabeloner overføres desuden zero-shot til open-weight og seks proprietære target-modeller med gennemsnitlige ASR- og top-5 ensemble ASR (EASR) på henholdsvis 69,6%\/92,6% og 44,1%\/60,0%.

For beslutningstagere og sikkerhedsansvarlige i organisationer, der implementerer eller køber AI-løsninger, er dette en vigtig udvikling. NeuronFuzz tilbyder en mere effektiv måde at teste og validere sikkerheden af LLM'er, hvilket kan reducere omkostningerne og tiden forbundet med sikkerhedsevaluering. Det giver også mulighed for at opdage sårbarheder, som traditionelle metoder overser, især i stærkt justerede modeller.

Læs mere i den originale forskningsartikel.