En ny undersøgelse fra arXiv viser, at AI-sprogmodeller som UrduBERT og multilingual BERT er i stand til at skelne mellem to forskellige betydninger af samme verbum på urdu – de såkaldte 'lette' og 'tunge' verber. Dette er ikke bare en akademisk detalje; det har direkte konsekvenser for kvaliteten af sprogteknologier som maskinoversættelse og tekstanalyse i lavressourcesprog.
Forskerne bag undersøgelsen analyserede 1.126 naturlige sætninger med syv urdu-verber. De fandt, at modellerne konsekvent adskiller de to betydninger i alle 21 verbum-model-kombinationer. Samtidig forbliver verberne med samme lemma (grundform) tættere på hinanden end forskellige verber, hvilket understøtter, at der stadig er en sproglig sammenhæng.
I en syv-vejs klassifikationsopgave, hvor modellen skulle forudsige hvilket let verbum der blev brugt, opnåede UrduBERT en nøjagtighed på 0,866 og en macro-F1-score på 0,852. Selv når modellen blev testet på sætninger uden gentagne lokale kombinationer, bevarede den en nøjagtighed på 0,782. Dette tyder på, at modellen ikke bare husker mønstre, men faktisk har lært en abstrakt repræsentation af verbbetydning.
For beslutningstagere i sprogteknologi og AI betyder dette, at sprogmodeller kan håndtere nuancerede sprogfænomener bedre end tidligere antaget. Det åbner for mere præcise oversættelsesværktøjer og bedre tekstforståelse i sprog som urdu, der ofte er underrepræsenteret i AI-forskning. Virksomheder og organisationer, der arbejder med flersprogede løsninger, bør holde øje med denne udvikling – den kan forbedre kvaliteten af deres produkter markant.
