En ny forskningsartikel fra arXiv introducerer ExFold, en metode der kan accelerere inference i Mixture-of-Experts (MoE) modeller markant – op til 1,41x hurtigere time-to-first-token (TTFT) og 2,45x hurtigere time-per-output-token (TPOT) – mens den bevarer omkring 99% af den oprindelige kvalitet. Metoden er implementeret som et plug-and-play plugin i vLLM, en populær open-source inferencing-engine, og kræver ingen modeltræning.

MoE-modeller er kendt for at skaleres godt i kapacitet, men deres to inferensfaser, prefill og decode, har forskellige flaskehalse. Eksisterende accelerationsmetoder optimerer typisk kun én af disse faser, og de ignorerer ofte bidraget fra de eksperter, der springes over. ExFold adresserer begge faser samtidigt ved at projicere bidraget fra de ekskluderede eksperter over på de bevarede eksperter, hvilket giver en mere præcis tilnærmelse uden at øge beregningsbyrden væsentligt.

For beslutningstagere betyder dette, at MoE-modeller kan serveres med lavere latenstid, hvilket er kritisk for realtidsapplikationer som chatbots, oversættelse og andre interaktive AI-tjenester. Da ExFold er træningsfrit og let at integrere i eksisterende systemer via vLLM, kan virksomheder hurtigt drage fordel af hurtigere inference uden at skulle genoptræne modeller eller investere i ny hardware. Dette kan reducere driftsomkostninger og forbedre brugeroplevelsen.

Metoden er detaljeret beskrevet i arXiv-papiret, og den tekniske implementering kan undersøges nærmere der. For dem, der ønsker at forstå de underliggende mekanismer, er der også information om den kalibrerede scalar-projektor-matrix og CUDA-kernen i papiret.