En ny træningsmetode gør det muligt for en lille sprogmodel at anonymisere personlige oplysninger i tekst direkte på enheden – uden at sende følsomme data til en tredjepart. Metoden, kaldet GRASP, er udviklet af forskere og præsenteret i et nyt paper på arXiv.
Store sprogmodeller kan i dag udlede følsomme oplysninger som alder, lokation og erhverv fra almindelig tekst, hvilket gør hverdagens skriverier til en privatlivsrisiko. Traditionel modstridende anonymisering bruger en kraftfuld model til at omskrive teksten, men kræver en stor model ved inferens og sender dermed privat tekst til en tredjepart – præcis den eksponering, som anonymisering skal forhindre.
Tidligere forsøg på at destillere denne adfærd til en lille on-device-model brugte supervised fine-tuning og direct preference optimization (DPO). Men DPO imiterer kun lærerens offline valg og optimerer aldrig direkte på det privatliv–nytte-mål, man reelt ønsker.
GRASP løser dette ved at forstærke den lokale anonymisator online med Group Relative Policy Optimization. En enkelt lille model fungerer både som anonymisator, modstander og nyttevurderer, trænet mod en selvgenereret belønning, der skjuler attributter, mens betydningen bevares – med et design, der beskytter mod belønningshacking.
Trænet på Llama-3.1-8B forbedrer GRASP privatliv–nytte-afvejningen sammenlignet med DPO-destilleret baseline, konsekvent på tværs af tre uafhængige LLM-dommere. Mod modstridende anonymisering drevet af frontlinjemodeller som Gemini 2.5 Flash og Claude opnår den en sammenlignelig eller bedre samlet afvejning, mens den fjerner væsentligt mere privat information – og den kører helt på enheden til cirka 1% af GPT-4o-lærerens omkostning.
For beslutningstagere betyder det, at privatlivsbeskyttelse nu kan ske lokalt uden at gå på kompromis med kvaliteten. Virksomheder, der håndterer følsomme data – fx sundhed, jura eller finans – kan implementere anonymisering direkte i deres produkter uden at sende data til eksterne AI-udbydere. Det reducerer både compliance-risici og driftsomkostninger markant.
