En ny undersøgelse fra Hugging Face viser, at store sprogmodeller ikke bare har sproglige forskelle i viden – de har også forskellige færdigheder afhængigt af, hvilket sprog de interagerer på. Forskerne bag studiet brugte en metode kaldet 'multilingual self-play', hvor to instanser af samme model konkurrerer mod hinanden i et tekstbaseret spil, men hver især kommunikerer på forskellige sprog. Da model, modstander, regler og tilgængelige handlinger er identiske, isolerer eksperimentet sprogets effekt på modellens adfærd.

Resultaterne er slående: Den samme model kan udvise markant forskellig spilstyrke afhængigt af sproget, med systematiske variationer i sejrsmargener, ugyldige handlinger og strategiske tendenser. Analysen afslørede sprogspecifikke fejl i rumlig ræsonnering, kortbetingede beslutninger og valg af optimale træk. I nogle tilfælde kunne en stor del af det tabte præstationsniveau genoprettes ved blot at ændre det sprog, som modellen bruger til mellemliggende ræsonnering.

For beslutningstagere, der overvejer at implementere AI i flersprogede sammenhænge – eksempelvis kundesupport, juridisk rådgivning eller globale analyseværktøjer – er dette en vigtig påmindelse: En model, der er trænet til at være 'multilingual', er ikke nødvendigvis lige kompetent på tværs af sprog. Det kan betyde, at kvaliteten af AI-assisterede beslutninger varierer afhængigt af, hvilket sprog brugeren anvender, hvilket kan have både forretningsmæssige og etiske konsekvenser.

Forskerne understreger, at disse færdighedsforskelle er en målbar og væsentlig hindring for udviklingen af ægte flersprogede modeller. For virksomheder, der planlægger at skalere AI-løsninger globalt, er det derfor afgørende at evaluere modellers præstation ikke kun på generelle benchmarks, men også på sprogspecifikke opgaver, der afspejler de faktiske anvendelsesscenarier.