En ny undersøgelse fra arXiv udfordrer en udbredt antagelse i AI-sikkerhed: at skifte til et ikke-engelsk sprog gør et flersproget RAG-system lettere at angribe for personoplysninger. Auditten, som dækker fem queriesprog og et totrinsforsvar, finder tværtimod, at engelsk har den højeste observerede lækrate for ustruktureret PII under output-only filtrering. Kun engelsk versus swahili adskiller sig klart under bootstrap-intervaller.

Undersøgelsen bruger et engelsk-korpus med syntetisk PII og en pipeline hvor oversætter, dommer, bagoversætter og generator alle er Qwen2.5-7B. Når input-dommeren tilføjes, forbliver der residuale læk på arabisk og swahili, og bagoversættelse af queryen lukker ikke hullet. Forskerne understreger, at resultaterne er pipeline-betingede og ikke en kausal rangering af sprog-inherent risiko.

For beslutningstagere betyder det, at sikkerhedsstrategier ikke kan baseres på sprogvalg alene. Selv med et input-judge-lag er der stadig huller, og den nuværende tilgang med output-filtrering er utilstrækkelig. Undersøgelsen peger på behovet for mere nuancerede forsvar, der ikke antager, at ikke-engelsk automatisk er mere risikabelt.