En ny forskningsartikel fra arXiv beskriver en metode, der kan overføre egenskaber fra en stor sprogmodel til en mindre – uden at skulle genoptræne modellen. Metoden, kaldet Activation-Prune-Merge (APM), bygger på en simpel, men potent idé: I stedet for at fusionere to modeller ved at matche deres neuroner en-til-en, udvælger APM de mest relevante dele af den store model og injicerer dem i den lille med en mikroskopisk vægtning. Læs artiklen på arXiv.
Resultaterne er markante. På tværs af 16 benchmarks – der dækker ræsonnement, matematik, kodegenerering, instruktionsfølge og klassifikation – løfter APM den gennemsnitlige præcision for en 3B-parameter model fra 55,5% til 60,6%. Særligt imponerende er forbedringerne på specifikke opgaver: RTE stiger fra 64,3% til 82,3%, QNLI fra 52,3% til 65,7%, og BoolQ fra 70,8% til 79,2%.
For beslutningstagere er pointen ikke de tekniske detaljer, men hvad det betyder strategisk. Hvis mindre modeller kan opgraderes med viden fra større modeller uden genoptræning, åbner det for markant billigere og hurtigere modeludvikling – især i miljøer, hvor ressourcer eller data er begrænsede. Metoden er træningsfri, hvilket betyder, at den kan anvendes på eksisterende modeller uden at skulle investere i store træningsopsætninger.
Samtidig peger forskningen på et bredere skift: I stedet for altid at bygge større modeller, kan vi blive bedre til at genbruge og forfine det, vi allerede har. Det er en udvikling, der kan få betydning for både omkostninger og tid-til-marked for virksomheder, der bygger på open source-modeller. Se relateret forskning om effektiv modeloptimering.
