En ny undersøgelse fra arXiv viser, at multimodale AI-modeller (MLLM'er) kan manipuleres til at udvise vedvarende diskrimination, selv når de løbende opdateres med ny data. Forskningen, beskrevet i papiret 'Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning', introducerer en angrebsmetode kaldet PFBA, der injicerer skjulte triggers i modellen, som fastholder unfair behandling af bestemte grupper – uden at det opdages af standardforsvar.
For beslutningstagere, der overvejer at implementere eller købe AI-løsninger i højrisikoområder som sundhed, finans eller rekruttering, er dette en kritisk advarsel: Selv hvis modellen opdateres løbende for at forbedre ydeevne eller rette fejl, kan en bevidst eller utilsigtet bagdør forblive aktiv. PFBA opnår dette ved at omforme modellens interne repræsentationer, så privilegerede grupper bevares, mens andre systematisk undertrykkes, og ved at simulere fremtidige opdateringer for at sikre, at angrebet overlever.
Forskningen understreger, at fairness ikke blot er et statisk krav, men et dynamisk problem, der kræver løbende overvågning – også efter implementering. For virksomheder og organisationer betyder det, at due diligence bør omfatte test for sådanne skjulte skævheder, ikke kun ved lancering, men gennem hele modellens livscyklus. Data og kode er offentligt tilgængelige, hvilket giver mulighed for at evaluere og forberede sig mod lignende trusler.
