Meta har præsenteret MoE-ViE, en ny vision-encoder baseret på Mixture-of-Experts (MoE) arkitektur, der leverer state-of-the-art billed- og videoforståelse med markant lavere beregningsomkostninger. Ifølge den tekniske rapport matcher deres største model zero-shot ydeevnen fra en encoder, der er 1,7 gange større, mens den kører på 76% af latensen. Det betyder, at virksomheder kan opnå samme kvalitet med mindre hardware og hurtigere inferens — en direkte fordel for applikationer, der kræver realtidsanalyse af video eller billeder.
MoE-designet, der hidtil primært er brugt i sprogmodeller, viser sig her at være særdeles effektivt til vision-encodere. Forskerne fandt, at finkornede MoE-topologier giver betydelige forbedringer sammenlignet med både tætte og standard MoE-modeller. De introducerede desuden en variant uden hjælpetab, der forbedrer ekspertudnyttelsen, samt en specialiseret MoE-kernel, der reducerer latency-overhead. For at styrke videoegenskaberne uden at miste billedviden anvendes frame-level distillation kombineret med en ny fryse-mekanisme.
Når MoE-ViE kobles sammen med en sprogmodel, overgår den alle sammenlignede encoders på billed- og videobenchmarks — inklusive dem med op til 5 gange flere aktiverede parametre. Det er en markant præstation, der kan ændre, hvordan virksomheder vælger deres vision-infrastruktur.
For beslutningstagere betyder det, at man kan opnå topkvalitet med mindre beregningsressourcer, hvilket sænker omkostningerne og muliggør nye anvendelser, hvor latency tidligere var en barriere. Koden er offentligt tilgængelig, så organisationer kan begynde at eksperimentere med det med det samme.
