En ny AI-arkitektur til videoanalyse kan gøre det billigere og mere overskueligt at bygge systemer, der skal forstå komplekse videoforløb – fra produktionsovervågning til medicinsk billedanalyse. Forskere bag MoTE (Mixture of Task Experts) foreslår at opdele en stor sprogmodels interne netværk i specialiserede 'opgave-eksperter', så hver type analyse – fx genkendelse af handlinger eller forudsigelse af næste trin – får sin egen dedikerede behandlingsvej, mens den fælles videoforståelse deles.

Det centrale trick er, at hver video kun følger én ekspert-route af gangen, hvilket betyder, at beregningsbyrden ikke vokser, selvom man tilføjer flere opgavetyper. I test på fem COIN-benchmarks opnår modellen VideoLLM-MoTE højere gennemsnitlig top-1-nøjagtighed end nyere VideoLLM-baselinjer, samtidig med at den kun aktiverer omkring 2 milliarder parametre per stikprøve – et markant spring mod mere effektiv multimodal AI.

For beslutningstagere betyder det, at man kan overveje at bygge videoanalyse-løsninger, der er både billigere i drift og lettere at fejlfinde, fordi man kan se præcis hvilken ekspert der tog hvilken beslutning. Arkitekturen er dog stadig på forskningsstadiet og ikke klar til kommerciel udrulning, men den peger på en retning, hvor specialisering og fortolkelighed kan gå hånd i hånd med lavere ressourceforbrug.