En ny undersøgelse fra arXiv viser, at dedikerede monolinguale AI-modeller kan overgå store flersprogede modeller, når det gælder lavressourcesprog som de dravidiske sprog (tamil, telugu, kannada og malayalam). Forskeren bag studiet trænede fem GPT-2-modeller fra bunden: fire monolinguale modeller (én per sprog) og én fælles flersproget model. Resultaterne viser, at de monolinguale modeller klarer sig bedre end mGPT på både sentimentanalyse og navnegenkendelse, og at deres tokenizers er mere effektive end den fælles flersprogede model.

For beslutningstagere, der overvejer at implementere AI til sprog med begrænsede data, er dette et vigtigt signal: At satse på en specialiseret model kan give bedre resultater end at stole på en generel flersproget løsning. Især i regioner som Indien, hvor disse sprog tales af hundredvis af millioner, kan valget af modelarkitektur have direkte konsekvenser for kvaliteten af AI-baserede tjenester – fra kundesupport til indholdsmoderering.

Undersøgelsen understreger også, at tokenizer-effektivitet spiller en afgørende rolle for ydeevnen. En mere effektiv tokenizer betyder færre beregningsressourcer og hurtigere inferens, hvilket kan reducere driftsomkostningerne for virksomheder, der implementerer sådanne modeller i produktion.

Selvom undersøgelsen er baseret på GPT-2-arkitekturen, som er ældre og mindre end nutidens store modeller, peger resultaterne på et generelt princip: For sprog med begrænset repræsentation i træningsdata kan specialisering være en fordel frem for at forsøge at dække alt med én stor model.