Kinesiske Moonshot AI har præsenteret en ny attention-mekanisme, Kimi Delta Attention, der kan reducere beregningsomkostningerne ved lange kontekster markant. I stedet for at genberegne hele attention-matricen for hvert nyt token, fokuserer metoden kun på ændringerne – deltaet – mellem successive attention-mønstre. Det gør den særlig relevant for modeller, der skal håndtere meget lange sekvenser, som f.eks. Kimi-modellens 1 million tokens kontekstvindue.

Ifølge blogindlægget bygger ideen på en simpel observation: når et nyt token tilføjes, ændrer attention-mønsteret sig kun lidt for de fleste positioner. Ved kun at beregne deltaet sparer man betydeligt på både hukommelse og regnekraft – en gevinst, der vokser med kontekstlængden.

Hvorfor det betyder noget: Lange kontekster er essentielle for opgaver som juridisk dokumentanalyse, kodegennemgang og videnskabelig forskning, men har hidtil været dyre at beregne. Kimi Delta Attention gør dem økonomisk bæredygtige, hvilket kan accelerere adoptionen af modeller med meget store kontekstvinduer. Teknikken er allerede implementeret i Moonshots produkt og kan potentielt sætte en ny standard for, hvordan attention beregnes i fremtidens sprogmodeller.