Kinesiske MoonshotAI har open source-udgivet FlashKDA, en højtydende CUDA-implementering af deres Kimi Delta Attention-mekanisme. Kernelbiblioteket, der på to dage har samlet over 1.000 stjerner på GitHub, adresserer en af de centrale flaskehalse i store sprogmodeller: den kvadratisk voksende beregningsomkostning ved standard attention over lange sekvenser.
FlashKDA bygger på en hybrid tilgang, hvor en lineær attention-mekanisme håndterer den globale kontekst, mens en standard (softmax) attention anvendes lokalt. Det reducerer den samlede beregningskompleksitet uden at ofre evnen til at fange detaljerede lokale mønstre. For praktikere betyder det, at modeller kan håndtere markant længere kontekster – eller opnå højere tokens per sekund på eksisterende hardware – uden at skulle skifte til dyrere infrastruktur.
Hvorfor det betyder noget: Udgivelsen signalerer, at konkurrencen om at optimere attention-mekanismer intensiveres. Hvor FlashAttention fra Stanford og tidligere arbejde fra blandt andet Together Computer har sat standarden for effektiv standard attention, åbner FlashKDA for en ny klasse af modeller, der balancerer lineær og standard attention. For teams, der bygger eller finetuner store sprogmodeller, kan adoption af FlashKDA betyde en direkte reduktion i inferensomkostninger – især i applikationer med lange dokumenter, samtaler eller kodegenerering.
