En ny tokenizer, SuTRA, adresserer et grundlæggende problem i AI-systemers håndtering af morfologisk rige indiske sprog som hindi, marathi og gujarati. Traditionelle metoder som BPE optimerer statistisk kompression, men ignorerer sprogenes struktur, hvilket fører til det, forskerne kalder "Morphological Shattering" — hvor ords rødder og affikser splittes vilkårligt. SuTRA bevarer akshara (komplekse ortografiske stavelser) som udelelige enheder og straffer sammenlægninger på tværs af morfologiske grænser. Resultaterne er markante: op til +14,7% forbedring i morfologisk alignment (Boundary F1) og +34% i semantisk genfindelighed for hindi sammenlignet med BPE, hvilket giver en gennemsnitlig forbedring på +8,08 chrF2 i maskinoversættelse. Læs mere i det originale paper.
For beslutningstagere er dette ikke kun en teknisk detalje. Indien er et af verdens største markeder for digitale tjenester, og AI-produkter, der skal betjene lokale sprog, har hidtil kæmpet med dårlig forståelse af komplekse sprogstrukturer. SuTRA tilbyder en mere robust tilgang, der kan forbedre alt fra chatbots til oversættelsestjenester og taleassistenter på indiske sprog. Virksomheder, der bygger eller køber AI-løsninger til dette marked, bør overveje, om deres tokeniseringsstrategi understøtter morfologisk bevidsthed — ellers risikerer de at levere ringere brugeroplevelser.
Forskerne har også udgivet et nyt morfologisk segmenteringsdataset for hindi, marathi og gujarati, hvilket giver andre mulighed for at bygge videre på arbejdet. Dette kan accelerere udviklingen af sprogmodeller, der er bedre tilpasset indiske sprog.
