Et nyt forskningspapir fra Moonshot AI introducerer Kimi Linear, en attention-arkitektur der kombinerer lineær kompleksitet med høj udtrykskraft – et område hvor tidligere lineære attention-modeller ofte har måttet give køb på kvalitet. Arkitekturen er beskrevet i et arXiv-paper.
Hvor traditionel attention (som i Transformers) skalerer kvadratisk med sekvenslængden, skalerer Kimi Linear lineært. Det betyder, at modellen kan håndtere langt længere kontekster – fx hele dokumenter eller lange samtaler – uden eksplosivt stigende beregningsomkostninger. Ifølge papiret opnås dette uden at ofre modellens evne til at fange komplekse afhængigheder i data, hvilket ellers har været den klassiske afvejning.
Dette er vigtigt, fordi omkostningerne ved lange kontekstvinduer i dag er en af de største barrierer for at bruge sprogmodeller i praksis. For virksomheder og udviklere, der bygger applikationer med store sprogmodeller, er implikationen klar: Hvis Kimi Linear lever op til sine løfter, kan det reducere omkostningerne ved at køre modeller med lange kontekstvinduer markant – og samtidig gøre dem mere anvendelige i realtidsscenarier som chatbots, analyse af lange dokumenter eller kodegenerering på tværs af store kodebaser.
Papiret giver tekniske detaljer om arkitekturen, men understreger også, at der er tale om et forskningsbidrag – ikke en produktionsklar implementering. Det er dog et signal om, at feltet aktivt arbejder på at løse en af de største flaskehalse for nuværende sprogmodeller.
