En ny teknik fra arXiv kan gøre finetuning af store sprogmodeller markant hurtigere – uden at gå på kompromis med kvaliteten. Metoden, kaldet AQLoRA, løser et kendt problem i QLoRA, en populær teknik til at finetune modeller med lavt hukommelsesforbrug. QLoRA sparer hukommelse, men er langsommere end traditionel fp16 LoRA, fordi den dequantiserer hver 4-bit vægt under træning. AQLoRA identificerer automatisk, hvilke lag der skal beskyttes i højere præcision (fp16), så de slipper for dequantisering – og det giver en markant hastighedsforøgelse.
Det centrale i AQLoRA er, at opsætningen sker med én enkelt CPU-pass over vægtene – uden søgning og uden kalibreringsdata. Metoden rangerer lagene efter deres rekonstruktionsfejl og vælger de øverste K lag til fp16 under en hukommelsesbudget. Det gør den i stand til at reproducere Unsloth's håndlavede dynamiske 4-bit udvælgelse på få sekunder, hvor søgningsbaserede metoder kræver gentagne kalibreringsrunder.
På tværs af seks modeller og fire arkitekturfamilier (fra 1,4B til 14B parametre) viser evalueringen på Commonsense-170K, at AQLoRA's 'speed setting' træner 11,1 % hurtigere end velindstillet QLoRA, med et tab på omkring ét accuracy-point. I alle ni uafhængige timing-sessioner var det hurtigere – mindst 7 %. 'Quality setting' træner 4,8 % hurtigere og matcher QLoRA's nøjagtighed på alle modeller, inden for ét point af fp16 LoRA, for kun 0,2 GiB ekstra hukommelse.
For beslutningstagere betyder det, at finetuning af store sprogmodeller kan blive billigere og hurtigere internt. Hvis man kører mange finetuning-opgaver, kan en 10 % hastighedsforøgelse oversættes til lavere cloud-regninger eller hurtigere iteration. Metoden kræver ingen ekstra kalibreringsdata, hvilket gør den let at implementere i eksisterende pipelines.
Forskerne bag AQLoRA understreger også vigtigheden af at måle præcist på delt hardware. De fandt, at usikkerheden mellem uafhængige sessioner er flere gange større end den, der beregnes inden for en enkelt kørsel. Det er en påmindelse om, at hastighedsforbedringer skal valideres grundigt, før man stoler på dem i produktionsmiljøer.
