Forskere har præsenteret PERCEPT, det første offentligt tilgængelige store korpus med persisk-engelsk kodeveksling – hvor brugere blander sprog i samme sætning – annoteret med Universal Dependencies (UD) ordklassetags. Datasættet indeholder 6.800 opslag fra X, Instagram og Digikala og er resultatet af et LLM-assisteret annoteringsframework, der automatisk tildeler ordklasser og emner. Ifølge forskerne viser en humanevaluering høj overensstemmelse mellem de automatiske og de manuelle annotationer, hvilket bekræfter datasættets pålidelighed.

For beslutningstagere i tech- og sprogindustrien er dette ikke blot en akademisk detalje. Kodeveksling er udbredt i sociale medier, men manglen på annoterede data har hidtil begrænset udviklingen af sprogmodeller, der kan håndtere flersprogede samtaler – især på persisk, der tales af titusinder af mennesker. Med PERCEPT kan virksomheder, der bygger chatbots, oversættelsesværktøjer eller sentimentanalyse til regionen, nu træne og evaluere deres modeller på data, der afspejler virkeligheden.

Forskernes analyser afslører desuden, at navneord er den dominerende kategori blandt kodevekslede ord, og at fordelingen af andre ordklasser varierer på tværs af platforme. Den positionelle fordeling af kodevekslede ord er bemærkelsesværdig konsistent, mens den såkaldte 'triggering effect' er markant mere udtalt på Digikala. Disse indsigter kan hjælpe udviklere med at designe modeller, der er robuste over for platformspecifikke sprogmønstre.

Korpuset er offentligt tilgængeligt på GitHub, hvilket gør det muligt for både forskere og virksomheder at bygge videre på arbejdet uden at skulle starte fra bunden.