Store sprogmodeller (LLM'er) er blevet uundværlige, men deres enorme ressourcebehov gør dem svære at køre på almindelige enheder. En ny metode fra arXiv, kaldet FAMPWQ, adresserer dette ved at kvantisere modellerne – altså reducere præcisionen af vægtene – på en måde, der er langt mere intelligent end tidligere tilgange.

Traditionel kvantisering bruger ensartet bit-bredde eller simple heuristikker, hvilket ofte fører til markant forringelse af modellens ydeevne. FAMPWQ introducerer i stedet et system, der måler følsomheden af hvert lag i modellen over for kvantisering ved hjælp af Fisher-information. Baseret på denne måling bruger metoden en reinforcement learning-baseret allokator til at fordele bit-bredder adaptivt – så de mest følsomme lag får flere bits, og de mindre følsomme får færre.

Resultaterne er imponerende: På tværs af 7 modeller og 5 benchmarks overgår FAMPWQ 7 baseline-metoder med op til 3,39 lavere perplexity (PPL), op til 6,87% højere nøjagtighed og op til 76% win rate i LLM-as-a-judge-sammenligninger. Det betyder, at modeller kan køres på commodity GPU'er med langt mindre hukommelse og beregningskraft, uden at kvaliteten lider.

For beslutningstagere er dette en game-changer: Det åbner for at køre avancerede sprogmodeller på edge-enheder, i bilindustrien, på hospitaler eller i andre miljøer, hvor cloud-afhængighed er problematisk. Virksomheder, der overvejer at implementere LLM'er lokalt, bør holde øje med denne udvikling – den kan reducere omkostninger og latens markant.