En ny interaktiv verdensmodel, ReWorld, løser en grundlæggende konflikt i AI-genereret video: at følge brugerens handlinger kræver kort tidshorisont, mens hukommelse kræver ubegrænset. Ved at adskille de to under træning og begrænse dem ved inferens opnår modellen både præcis kontrol og langtidshukommelse i realtid.

ReWorld bruger blandede opmærksomhedsvinduer, hvor de fleste hoveder fokuserer på nylig fortid, mens et lille sæt globale hoveder ser på hele historien. Tilfældig hovedrouting og chunk-dropping sikrer, at både kontrol og hukommelse fungerer under varierende forhold. Ved inferens holdes hele fortiden under et fast budget via en pose-indekseret landmark-bank, der henter de nærmeste landmarks til den aktuelle position.

Modellen er trænet på en datasæt, der placerer otte kilder – fra Unreal-renderede fly-throughs til virkelige optagelser – på samme fysiske actionskala, så samme tastetryk flytter kameraet samme distance i alle kilder. Palindrome-trajektorier giver genbesøgsbevis for hukommelsestræning. En distributions-matching destillation komprimerer sampling til fire trin, så én backbone serverer både høj-kvalitets multi-step og realtids interaktiv mode, der streamer 704x1280 video.

I test mod seks nyere interaktive verdensmodeller opnår ReWorld bedst kontrolpræcision (11,95° rotationsfejl) og bedst generationskvalitet. På minutlange ud-og-tilbage-rulninger (64 sekunder, 384 latenter) regenererer dens faste 12-chunk cache startvisningen – hvor et glidende vindue længe har evicted beviset, og fuld KV-opmærksomhed løber tør for hukommelse.

For beslutningstagere betyder dette, at interaktive verdensmodeller nu kan bruges i applikationer, der kræver langtidshukommelse, som virtuelle miljøer, simulationer og AI-agenter, uden at gå på kompromis med realtidsydelse. Teknisk detalje findes i paperet.