En ny undersøgelse fra arXiv viser, at sprogmodeller præsterer markant dårligere, når samme indhold og spørgsmål præsenteres på andre sprog end engelsk. Fænomenet, kaldet Cross-Lingual Comprehension Gap (CLCG), måler forskellen i svar-kvalitet mellem engelsk og 18 andre sprog — og resultatet er et gennemsnitligt fald på cirka 17 % i forhold til engelsk. Det fremgår af undersøgelsen på arXiv.

Undersøgelsen, der bygger på det professionelt oversatte parallelkorpus ParallelQA-18, evaluerer fem modeller fra fem forskellige laboratorier på 150 artikler. Designet isolerer sproget som eneste variabel: samme indhold, samme spørgsmål, samme model. Det primære estimat viser en samlet CLCG på 0,078 (95 % CI 0,072–0,084), hvilket svarer til en reduktion på cirka 17 % relativt til engelsk. Selv når man sammenligner med portugisisk — et højressource-sprog — er der stadig et gennemsnitligt gab på 0,016.

For beslutningstagere er pointen klar: Antagelsen om, at AI-kapabiliteter overføres ligeligt til andre sprog, er forkert. Undersøgelsen finder en negativ sammenhæng mellem sprogets ressourceklasse og gabet (rho = -0,594), hvilket betyder, at jo lavere ressourcer et sprog har, desto større er kvalitetsfaldet. I blindede menneskelige evalueringer blev højressource-svar foretrukket i 61,6 % af de afgørende vurderinger.

Konsekvensen er strategisk: Virksomheder og organisationer, der implementerer AI på ikke-engelske markeder — især i Norden, hvor lokale sprog som dansk, svensk og norsk er i spil — bør ikke antage, at modellerne leverer samme kvalitet som i engelsksprogede tests. Evalueringer baseret udelukkende på engelsk kan overvurdere kvaliteten for brugere af lavressource-sprog, hvilket kan føre til fejlinvesteringer i AI-løsninger, der ikke lever op til forventningerne.