Forskning i AI-sikkerhed – oprindeligt udviklet for at forhindre skadelige udfald – risikerer at blive misbrugt til censur og manipulation. Det er hovedpointen i et nyt position paper på arXiv, som advarer om, at de samme teknikker, der skal gøre modeller 'uskyldige', også kan bruges af ondsindede aktører til at opnå informationsdominans.
Papiret, Position: The Alignment Community is Unintentionally Building a Censor's Toolkit, argumenterer for, at moderne alignment-metoder er 'dual-use' teknologier. Det vil sige, at de kan bruges både til gavn og skade. Forfatterne viser, hvordan man kan kortlægge eksisterende alignment-teknikker til konkrete misbrugsscenarier – og at der allerede er eksempler på, at det sker.
Risikoen forværres af tre samtidige tendenser: Den hastige udbredelse af AI som informationskilde, økonomiske magtforskelle og en politisk udvikling, der i stigende grad bevæger sig mod autoritære styreformer. Jo hurtigere brugerne tager AI til sig som deres primære kilde til information, jo større bliver potentialet for, at alignment-værktøjer bliver brugt til at kontrollere, hvad folk får at se.
For beslutningstagere – både i virksomheder og i det offentlige – rejser papiret et strategisk spørgsmål: Skal man investere i alignment-teknologi uden at tænke over, hvordan den kan misbruges? Forfatterne opfordrer til, at misbrugspotentialet diskuteres nu, og foreslår konkrete afværgestrategier.
