En ny sprogmodel, NE-BERT, er trænet på 8,3 millioner sætninger fra ni nordøstindiske sprog og to ankersprog (hindi og engelsk). Modellen overgår både IndicBERT-V2 og MuRIL på alle ni sprog med henholdsvis 15,97 og 7,64 gange lavere gennemsnitlig perplexity – et mål for, hvor godt modellen forudsiger sprog. Den opnår også 1,50 gange bedre tokeniseringseffektivitet end mBERT, hvilket betyder, at den håndterer orddeling mere effektivt. Det skriver forskerne bag i deres præsentation på arXiv.
Det centrale bidrag er håndteringen af ekstremt lavressourcesprog som Pnar (kun 1.002 sætninger) og Kokborok (2.463 sætninger). Her bruger forskerne aggressiv opsampling og en specialdesignet SentencePiece Unigram-tokenizer for at undgå, at ord fragmenteres i meningsløse bidder – et velkendt problem i store modeller, der ikke er trænet på sprogene. Downstream-evaluering på ordklasse-tagging (POS) på tre af sprogene bekræfter, at modellen også er praktisk anvendelig, ikke bare teoretisk bedre.
For beslutningstagere er det vigtigste signal ikke tallene i sig selv, men det faktum, at modellen, testdata og træningskorpus frigives under CC-BY-4.0-licensen. Det betyder, at virksomheder, organisationer og forskere kan bygge videre på arbejdet uden juridiske hindringer. I en region med minimal repræsentation i eksisterende flersprogede modeller åbner det for konkrete anvendelser inden for offentlig service, uddannelse og lokalt erhvervsliv – områder hvor sprogbarrierer ofte er en reel forhindring.
Set i et større perspektiv illustrerer NE-BERT en voksende tendens: i stedet for at satse på stadig større modeller, der dækker mange sprog overfladisk, viser forskningen værdien i specialiserede modeller, der er målrettet sprogligt mangfoldige regioner. For den, der skal vælge en sprogmodel til et marked med lavressourcesprog, er pointen klar: en specialiseret model kan levere markant bedre resultater end de generelle alternativer – og med åben licens er der ingen grund til at vente.
