Forskere har præsenteret en ny metode, MASS, der kan udvælge de mest værdifulde træningsdata til finjustering af store sprogmodeller. Metoden, beskrevet i et nyt paper på arXiv, adresserer et centralt problem: Når mængden af data vokser, bliver det både dyrt og tidskrævende at træne på alt. MASS formulerer dataudvælgelse som et hierarkisk dækningsproblem, der først grupperer data groft efter semantisk indhold og derefter sikrer dækning af sjældne, men vigtige detaljer inden for hver gruppe.
Eksperimenter på Vision Flan og LLaVA-CoT viser, at MASS konsekvent overgår stærke baseline-metoder på tværs af flere budgetter. I flere tilfælde matcher eller overgår træning på en lille delmængde af data resultaterne fra træning på hele datasættet. Det betyder, at virksomheder og organisationer, der finjusterer modeller til specifikke opgaver, potentielt kan reducere træningsomkostningerne markant uden at gå på kompromis med kvaliteten.
For beslutningstagere er implikationen klar: Dataudvælgelse bliver en strategisk konkurrenceparameter. Jo bedre man kan udvælge de rigtige data, jo hurtigere og billigere kan man tilpasse modeller til egne behov – og jo mindre afhængig bliver man af enorme, kostbare datasæt. Metoden er dog stadig på forskningsstadiet, og det er uvist, hvor stor effekten er i bredere produktionssammenhænge.
