Forskere bag Alipay, Kinas største betalingsplatform, har præsenteret en ny skaleringslov, der kan ændre, hvordan virksomheder behandler enorme mængder brugerdata i AI-modeller. Loven, kaldet User Behavioral Densing Law, beskriver den optimale balance mellem datamængde og den såkaldte tokenisering – processen hvor rå tekstdata omdannes til kompakte enheder, som modellerne kan arbejde med.

Problemet er velkendt for dem, der bygger store anbefalingssystemer: Jo flere data, desto bedre – indtil et punkt, hvor ydeevnen stagnerer. Forskerne viser, at dette sker, fordi rå tekstdata i billion-skala bliver en flaskehals. Løsningen er tokenisering, men hidtil har der manglet en systematisk måde at bestemme, hvor meget tokenisering der er nødvendig for en given datamængde.

Ved at analysere Alipays gigantiske datasæt har forskerne fundet en næsten lineær sammenhæng mellem logaritmen af den minimale tilstrækkelige tokeniseringskapacitet og datastørrelsen målt i tokens. Denne sammenhæng varierer dog afhængigt af tokeniseringsmetode og datakilde, hvilket afspejler forskelle i redundans og unikhed i repræsentationsrummet.

På baggrund af loven har forskerne udviklet ALGN, en adaptiv tokeniseringsmetode, der dynamisk tilpasser længden af tokens til dataene. Ifølge papiret overgår ALGN eksisterende metoder på tværs af flere datakilder og opgaver.

For virksomheder, der investerer i store anbefalingssystemer eller personalisering, betyder dette lavere beregningsomkostninger og bedre ydeevne uden at skulle øge datamængden. Det er en konkret vej til at skalere brugerforståelse uden at løbe ind i de klassiske flaskehalse.