Lang kontekst i store sprogmodeller (LLM'er) er begrænset af den hukommelse, der kræves til key-value (KV) cachen. PuzzleKV, en ny metode fra arXiv, løser dette ved at komprimere KV-cachen uden træning eller kalibrering. Metoden opdeler hver per-head KV-cache i faste logiske sider og udnytter lav-rank struktur inden for hver side, hvilket muliggør effektiv kompression. Læs mere på arXiv.
PuzzleKV er trænings- og kalibreringsfri, hvilket betyder, at den kan anvendes direkte på eksisterende modeller uden ekstra omkostninger. Den behandler hver fuldført side som en uafhængig kompressionsenhed, beregner opmærksomhed direkte over tætte og faktoriserede sider og komprimerer inkrementelt nye sider under autoregressiv dekodning. Dette gør den særligt attraktiv for virksomheder, der ønsker at reducere inferensomkostninger uden at gå på kompromis med kvaliteten.
Eksperimenter viser, at PuzzleKV ved cirka 60% af den oprindelige KV-cache-lagring opnår mere end 96% af Full KV-ydeevnen på tværs af modeller og benchmarks. Ved at kombinere med kvantisering kan den opnå mere aggressiv kompression, idet den bevarer mere end 93% af ydeevnen med kun 18,7% af den oprindelige lagring. Dette er en betydelig forbedring i forhold til tidligere metoder som Global SVD, især på RULER-benchmarket.
For beslutningstagere betyder dette, at lang kontekst-inferens kan blive markant billigere og hurtigere, hvilket åbner for nye anvendelser som analyse af lange dokumenter, koderepositories eller samtaler. PuzzleKV kræver ingen ændringer i modelarkitekturen, hvilket gør den let at integrere i eksisterende systemer. Se detaljerne i det fulde paper.
