To nye forskningsartikler adresserer et centralt problem i store sprogmodeller: at de kan omgås til at udføre skadelige handlinger, især på lavressourcesprog eller efter simple angreb. Den første metode, Latent Space Refusal Anchoring, gør det muligt at genoprette sikkerhedsadfærd uden at genoptræne modellen. Den anden, Abliteration Mitigation via Refusal Aliases, beskytter mod en kendt angrebsteknik, der fjerner modellens evne til at nægte skadelige anmodninger.

Sikkerhedshullet i lavressourcesprog

Forskere har observeret, at instruktionsjusterede modeller ofte nægter at svare på skadelige anmodninger på engelsk, men efterkommer de samme anmodninger på sprog som Yoruba, Igbo, Igala og Hausa. Årsagen er, at nægtelsesmekanismen findes i modellens interne repræsentationer, men ikke aktiveres korrekt for input på lavressourcesprog. Traditionelt kræver det mærkede data og genoptræning at løse problemet – ressourcer, der ikke findes i tilstrækkelig mængde for de fleste afrikanske sprog.

Metoden: styring uden genoptræning

Den nye metode, kaldet LSR-Anchoring, udtrækker nægtelsesretningen fra engelske prompts og påfører den på modellens interne repræsentationer under inferens. Den primære variant, Mean-Activation Steering (MAS), blev testet på fire arkitekturer: Llama-3-8B, Llama-3.1-70B, Mistral-7B-Instruct og Qwen2.5-7B. På Mistral og Qwen genoprettes sikkerheden med minimal nedgang i ydeevne (under 0.08 i benigndegradering). Men på Llama-3-8B overkorrigerer metoden, hvilket fører til en markant forringelse af legitime opgaver (DPL når 1.00).

For at løse dette introducerer forskerne SAE-Derived Steering (SDS), som bruger en enkelt feature fra en Sparse Autoencoder i stedet for den tætte gennemsnitsretning. Dette reducerer KL-divergensen med 3.5-7x uden at kollapse ydeevnen. Fire sprog overføres positivt, men arabisk fejler på alle arkitekturer og styringsniveauer, hvilket indikerer en geometrisk uoverensstemmelse snarere end en baseline-effekt. MMLU-akkuratheden forbliver under 0.35 procentpoint ved alle effektive styringsniveauer.

Forsvar mod abliteration

Den anden artikel adresserer abliteration, en teknik hvor angribere fjerner modellens nægtelsesevne ved at projicere vægtmatricer ortogonalt på en udtrukket nægtelsesretning. Eksisterende forsvar overser ofte, at problemet er, hvor let nægtelsesretningen kan udtrækkes. Den nye metode, AMRA, skjuler nægtelsessignalet ved at anvende rank-k opdateringer på residualstrømmens skrivermatricer, erstatte nægtelsesinducerende aktiveringer med tilfældige aliasser og korrigere downstream-læsermatricer for at bevare modellens oprindelige adfærd.

På Llama-3-8B forbedrer AMRA post-abliteration nægtelsesscore med 2.16 point over den ubeskyttede baseline, med mindre end 0.5 procentpoint MMLU-forringelse. På Gemma-2-9B forbedres nægtelsen med 14.70 point, men med en større utility-omkostning.

Konsekvenser for beslutningstagere

For virksomheder og organisationer, der implementerer sprogmodeller i flersprogede sammenhænge, er disse resultater vigtige. De viser, at sikkerhedshuller kan lukkes uden at genoptræne modeller, hvilket sparer tid og ressourcer. Men de understreger også, at løsninger ikke er universelle – hvad der virker på én model, kan overkorrigere på en anden. Det kræver grundig testning og tilpasning til den specifikke model og brugskontekst.