Forskere har præsenteret en ny arkitektur for store sprogmodeller, der hævder at konvergere 1,33 gange hurtigere under præ-træning end eksisterende modeller. Arkitekturen, kaldet LoKiFormer, adresserer to centrale ineffektiviteter i nuværende designs: manglen på eksplicit lokal bias i selv-opmærksomhed og den tætte kobling mellem videnslagring og beregning i mixture-of-experts (MoE) systemer. Det skriver forskerne i et paper på arXiv.
LoKiFormer tilføjer to moduler til standard-dekoderen: Local Fusion Attention (LFA), der integrerer konvolutionel fusion i opmærksomhedsmekanismen for bedre at fange lokale mønstre, og Knowledge Memory Module (KMM), som lagrer global viden i adresserbare hukommelsespladser, så viden kan hentes direkte uden at blande sig med beregningsstierne. Ifølge forfatterne muliggør dette en mere effektiv integration af information på både lokalt og globalt niveau.
For beslutningstagere er den interessante pointe ikke de tekniske detaljer, men konsekvensen: Hvis resultaterne kan reproduceres i stor skala, betyder en 1,33x hurtigere konvergens markant lavere træningsomkostninger og kortere tid til markedet for nye modeller. Det kan ændre økonomien i at bygge egne modeller frem for at købe adgang til eksisterende. Samtidig peger KMM-modulet på en retning, hvor viden og beregning adskilles – en tendens, der kan gøre modeller lettere at opdatere og tilpasse uden fuld genoptræning.
Det er dog værd at bemærke, at resultaterne er fra et enkelt paper og endnu ikke valideret i bredere sammenhænge. Som med al forskning bør man afvente uafhængige reproduktioner, før man træffer strategiske beslutninger baseret på tallene.
