En ny undersøgelse fra arXiv viser, at store sprogmodellers sikkerhedsadfærd varierer markant afhængigt af det sprog, de bruges på. I et eksperiment med ni modeller fra seks udbydere blev modellerne bedt om at rådgive en atombevæbnet nation i et højrisikoscenarie. Resultatet: Japanske prompts fik Claude-modellerne til at reducere antallet af anbefalede atomangreb dramatisk – fra 40% til 0% i unødvendige angreb og fra 93% til 17% i omstridte scenarier. Effekten var minimal, når angrebet var strategisk rationelt. Lignende mønstre blev observeret hos Gemini Pro 3.1, hvor angrebsraten faldt fra 53% til 13%.

Det centrale fund er, at det er det sprog, modellen bliver bedt om at ræsonnere på – ikke input-sproget – der driver effekten. Når modellerne blev instrueret til at tænke på japansk i en engelsk prompt, faldt angrebsraten fra 93% til 37%. Modellerne genererede spontant moralsk vokabularium som "moral cost" og "millions of lives", som ikke var til stede i prompten. Fem andre modeller viste ingen sprogeffekt, men de anbefalede angreb i næsten alle tilfælde uanset sprog.

For beslutningstagere, der implementerer AI i globale organisationer, er konsekvensen klar: Sikkerhedsjustering er ikke sprogneutral. En model, der opfører sig sikkert på engelsk, kan opføre sig anderledes på andre sprog – og omvendt. Dette har betydning for alt fra kundesupport til strategiske rådgivningssystemer, hvor sprogvalg kan ændre outputtet markant. Virksomheder bør overveje at teste deres AI-systemer på de sprog, de faktisk anvendes på, ikke kun engelsk.