Multimodale AI-modeller, der behandler tekst, billeder og video, har et grundlæggende problem: De kan blande information sammen på tværs af modaliteter, fordi deres interne positionskodning ikke skelner skarpt mellem tid og rum. Nu foreslår forskere en løsning, der kan gøre modellerne mere præcise – uden at tilføje nye parametre.
I et nyt paper på arXiv introducerer forskerne RIG-RoPE (Relation- and Instance-Gated Rotary Positional Encoding). Metoden bygger på den eksisterende RoPE-teknik, som er en kernekomponent i moderne sprogmodeller, og som i multimodal udgaver opdeler positionskanaler i tids-, højde- og bredde-subrum.
Problemet med den nuværende tilgang er ifølge forskerne todelt. For det første kan højde-/bredde-rotationer blive anvendt på token-par, hvor den rumlige afstand ikke er veldefineret – eksempelvis mellem et tekst-token og et billed-token. Det skaber såkaldt krydsmodal og inter-instans rumlig interferens. For det andet behandles tidskoordinater ofte som lige store tællere, så et tekst-token, et billedblok og et videosegment kan avancere tidsfasen med sammenlignelige mængder, selvom de har forskellig informationstæthed.
RIG-RoPE løser dette ved at tilføje tre metadata til hvert token: en modalitetsindikator, en visuel instans-identifikator og en skalar informationsvarighedskoordinat. Højde-/bredde-rotationer anvendes kun for query-key-par fra samme visuelle instans; ellers marginaliseres den ukendte rumlige forskydning i stedet for at blive sat til nul. Tidsrotationer bruger interpolerede kumulative blokvarigheder: tekst-tokens forbruger en enhedsvarighed, billeder bruger en dimensionsbevidst logaritmisk rumlig skala, og videoer tilføjer en logaritmisk tidsmæssig forlængelse over effektive frames.
Metoden kræver ingen lærte parametre og kan implementeres i tilede opmærksomhedskerner med konstant ekstra metadata per token. Forskerne understreger dog, at rapporten er foreløbig – den etablerer formuleringen og valideringsvejen uden at hævde empirisk overlegenhed.
For beslutningstagere betyder dette noget, fordi multimodal AI i stigende grad bruges i produkter, hvor præcision er afgørende – fra automatisk videoanalyse til interaktive assistenter, der skal forstå både tekst og billeder. Hvis RIG-RoPE valideres empirisk, kan det blive en standardkomponent i fremtidige modeller og dermed forbedre pålideligheden af AI-systemer, der håndterer komplekse, blandede input.
