Forskere har fundet en metode, der markant forbedrer AI-oversættelse til et sjældent afrikansk sprog, som de fleste oversættelsesmodeller slet ikke understøtter. Resultatet kan få strategisk betydning for virksomheder og organisationer, der arbejder med oversættelse på underrepræsenterede sprog – fordi det gør processen mere forudsigelig og mindre afhængig af tilfældige valg.

Multilinguale oversættelsesmodeller som NLLB-200 dækker 200 sprog, men efterlader tusindvis af andre – herunder de fleste Grassfields Bantu-sprog i Cameroun. Når man vil finjustere sådan en model til et nyt sprog, skal man normalt vælge et såkaldt proxy-sprog, som modellen allerede kender. Men der har ikke været nogen systematisk måde at vælge det rigtige proxy-sprog på, hvilket kan give store udsving i kvaliteten.

Forskerne bag det nye studie testede en metode, hvor sprog-tokenet i stedet er et gennemsnit af embeddings fra flere beslægtede sprog, som modellen allerede kender. De sammenlignede resultaterne på oversættelse fra Limbum til engelsk – et sprog med kun 8.837 parallelle sætningspar til rådighed.

Resultaterne er bemærkelsesværdige: NLLB-200 finjusteret med den nye metode opnåede en chrF2++-score på 46,7, næsten på niveau med den bedste enkelt-proxy (Swahili, 47,3). Begge er over 32 point bedre end en model trænet fra bunden (14,5) og markant bedre end zero-shot-tilgangen (12,5). Det viser, at flersproget overførsel er den dominerende faktor, når man arbejder med ekstremt sparsomme data – og at man kan slippe for at gætte sig til et proxy-sprog.

For beslutningstagere betyder det, at man ikke længere behøver at stole på tilfældige valg af stedfortræder-sprog, når man skal udrulle oversættelsesløsninger til mindre sprog. Metoden kan gøre det lettere og mere forudsigeligt at bygge oversættelsesværktøjer til sprog, som ellers ville være overset – og dermed åbne markeder og kommunikationskanaler, der hidtil har været svære at nå.

Der er dog stadig udfordringer: Alle systemer fejler i at bevare tonale diakritiske tegn, hvilket er et åbent problem. Forskerne har gjort deres data og kode offentligt tilgængelige for at støtte videre forskning.