Multimodale sprogmodeller (MLLMs) er kraftfulde, men dyre at køre, fordi de skal behandle tusindvis af visuelle tokens. Et nyt forskningspapir fra arXiv introducerer en metode, der reducerer antallet af visuelle tokens markant – uden at det koster nævneværdig nøjagtighed.

Metoden, kaldet Middle-layer Attention Prediction (MAP), løser to centrale problemer ved eksisterende token-pruning: For det første varierer det fra input til input, hvilket sproglag der har den mest responsive opmærksomhed – et fast valgt lag er derfor suboptimalt. For det andet kræver traditionel pruning, at man først sender alle tokens gennem flere sproglag, hvilket allerede har brugt en stor del af beregningen.

MAP bruger en såkaldt Question Contrastive Teacher Selection til at vælge et sample-specifikt lærerlag ved at sammenligne opmærksomhed under originale og reference-spørgsmål. Herefter destilleres opmærksomheden fra det valgte lag ned i en letvægts-predictor, der estimerer token-vigtighed direkte fra multimodale input-features. Under inferens kombinerer MAP de forudsagte vigtighedsscores med et diversitetskriterium og beskærer tokens allerede før det første sproglag – uden at skulle generere opmærksomhedskort.

På ti benchmarks med LLaVA-NeXT-7B bevarer MAP 97,5% af den ubeskårede models ydeevne, mens den kun bruger 5,56% af de visuelle tokens. Det giver en 3,09x end-to-end speedup, og metoden er kompatibel med eksisterende accelerations-teknikker.

For beslutningstagere betyder det, at multimodale AI-systemer kan blive markant billigere og hurtigere at drive – særligt i applikationer med store mængder billed- og videodata. Teknikken kan gøre det mere attraktivt at skalere visuelle AI-løsninger i produktion, hvor inferensomkostninger ofte er en flaskehals.