Forskere har introduceret en ny post-training metode, der kan gøre multimodale AI-modeller markant hurtigere og mere præcise til videoanalyse. Metoden, kaldet Internalized Visual Thinking (IVT), flytter den visuelle ræsonnering fra inferens-tidspunktet til træningsfasen — og resultatet er op til fem gange lavere latens uden tab af kvalitet.
Traditionelt bruger multimodale sprogmodeller såkaldt visual chain-of-thought (Visual CoT), hvor modellen genererer mellemliggende billeder for at ræsonnere om rum, tid og interaktioner i videoer. Selvom dette giver god indsigt, er det beregningstungt og skaber forsinkelser, der er problematiske i realtidsapplikationer.
IVT løser dette ved at lade modellen lære at forudsige latente repræsentationer af fremtidige frames under træning, samtidig med at den optimerer tekstprediktion. Ved inferens genererer modellen svaret direkte uden at skulle syntetisere eller genkode fremtidige frames. Ifølge forskerne forbedrer IVT resultaterne i alle seks evalueringsscenarier sammenlignet med direkte svar-finetuning, og det opnår sammenlignelig eller bedre ydeevne end eksplicit Visual CoT — men med over fem gange lavere end-to-end latens.
For beslutningstagere betyder det, at realtidsvideoanalyse — eksempelvis i overvågning, autonome systemer eller interaktive assistenter — kan blive langt mere praktisk og økonomisk overkommelig. Metoden peger på, at eksplicit pixel-generering ved inferens måske ikke er nødvendig for effektiv proaktiv video-ræsonnering; i stedet kan prædiktiv verdensmodellering internaliseres under træning.
