En ny videnskabelig undersøgelse stiller skarpt på, hvordan flersprogede sprogmodeller egentlig løser matematiske problemer på tværs af sprog. Resultaterne, som er beskrevet i et nyt paper på arXiv, viser, at modellerne ikke nødvendigvis deler de samme interne repræsentationer, selvom de producerer samme korrekte svar.

Forskerne testede fem modeller fra fire forskellige model-familier på datasættet MGSM, hvor de samme matematiske problemer blev løst på engelsk, tysk, fransk, spansk, russisk og kinesisk. Ved at spille ræsonnement-sporene tilbage gennem modellerne og analysere aktiviteten i forskellige lag, fandt de, at graden af delte features varierer markant fra model til model og fra lag til lag.

For at undersøge fænomenet udviklede de en ny metode, Geometry-Invariant SAE (GI-SAE), som træner modellerne til at producere ens aktiviteter for samme problem uanset sprog. Selvom GI-SAE øgede den geometriske lighed mellem repræsentationerne, viste det sig, at højere geometrisk lighed ikke automatisk betyder, at features er funktionelt udskiftelige. I praksis betyder det, at modellerne kan regne ens uden at dele de samme interne ræsonnement-mekanismer.

Resultaterne er model- og arkitekturafhængige: Qwen-modellen fik styrket tværsproglig struktur, Gemma-modellen viste ingen funktionel fordel, og Llama og Phi viste blandede, lagafhængige effekter. Det understreger, at der ikke findes én universel mekanisme for flersproglig ræsonnement – i hvert fald ikke i det undersøgte udvalg.

For virksomheder og organisationer, der implementerer flersprogede AI-løsninger, har resultaterne konkret betydning. Hvis en model ikke deler ræsonnement på tværs af sprog, kan den være mindre robust, når den oversætter eller generaliserer viden fra ét sprog til et andet. Det kan påvirke alt fra kundesupport til juridisk og medicinsk beslutningsstøtte, hvor konsistens på tværs af sprog er kritisk.

Undersøgelsen peger også på et behov for mere nuancerede evalueringsmetoder, der ikke kun måler output-korrekthed, men også intern konsistens. For beslutningstagere, der vælger mellem forskellige modeller, kan det være værd at undersøge, hvordan modellen håndterer flersproglige opgaver internt – ikke kun hvad den svarer.