To nye forskningsresultater udfordrer den gængse opfattelse af, hvordan man effektivt kan komprimere og accelerere store sprog- og videomodeller. Fælles for dem er, at de viser, at sparsom attention – en teknik, der springer over unødvendige beregninger – kan gøres langt mere præcist og effektivt, uden at modellen skal genoptrænes. Det betyder, at eksisterende modeller kan opnå markante hastigheds- og omkostningsgevinster i produktion, hvilket er særligt relevant for lange kontekster og videogenerering.
Det første papir, Beyond Sparse Weights: When Is Attention Compressible?, adresserer en grundlæggende misforståelse: At attention-kort med få store vægte nødvendigvis er nemme at komprimere. Forskerne viser, at dette er ufuldstændigt – store vægte indeholder ikke nødvendigvis størstedelen af massen, udeladte værdier kan ophæve hinanden, og at bevare attention-outputtet ikke nødvendigvis bevarer selve opgaven. De introducerer CertKV, en kompressor der ikke kræver genoptræning, og som allokerer en 'tail-summary' slot per head og fordeler resten efter værdidispersion. Under sammenlignelige budgetter klarer CertKV sig i top-to på syv af ni LongBench-v2-indstillinger og opnår en ti-fold cache-budget-reduktion i en Llama-prototype.
Det andet papir, Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models, tager fat på et lignende problem i videogenerering og verdensmodeller. Her introduceres SparsePR, som kombinerer respons-koblet partitionering med residual-rekonstruktion. Metoden opnår 1,48x-2,61x end-to-end hastighedsforøgelser ved en tæthed på 22-26% af de udførte par, uden at gå på kompromis med generationskvaliteten.
For beslutningstagere betyder dette, at sparsom attention ikke længere er et akademisk niche-emne, men en praktisk vej til at reducere inferensomkostninger og latenstid i produktion – især for lange kontekster og videogenerering. Teknikkerne kræver ingen genoptræning, hvilket gør dem attraktive til eksisterende modeller.
