En ny version af FlashPrefill, en teknik til at fremskynde den indledende behandling af lange kontekster i sprogmodeller, er nu modnet fra et forskningsprototype til noget, der kan bruges i produktion. FlashPrefill V2 reducerer den kvadratiske kompleksitet i attention-mekanismen – den flaskehals, der gør behandling af lange dokumenter dyr og langsom.

Hvor den oprindelige FlashPrefill var et algoritmisk udkast, adresserer V2 tre centrale udfordringer for praktisk brug: den undertrykker approximationsfejl selv ved ekstrem sparsitet, er optimeret til de nyeste hardware- og præcisionsstandarder (FP8), og understøtter paged KV cache og continuous batching. Det betyder, at den kan integreres som en attention-backend i moderne inferens-frameworks som SGLang.

Målingerne er markante: På NVIDIA H20 GPU'er – blandt de mest udbredte inferens-acceleratorer – opnår FlashPrefill V2 op til 47,26x og 27,19x speedup over FlashAttention-2 ved 128K kontekstlængde under henholdsvis FP8 og BF16 præcision. Selv mod en tæt baseline, der er justeret til FlashAttention-3/4, er der stadig en 30,49x speedup i FP8.

For beslutningstagere betyder det, at lange kontekster – fx juridisk dokumentanalyse, videnskabelige papers eller store kodebaser – ikke længere behøver at være en luksus, der koster uforholdsmæssigt meget i tid og compute. Teknikken er designet til at passe ind i eksisterende inferens-stakke, hvilket sænker barrieren for at tilbyde lange kontekster som en standardfunktion.