En ny forskningsmodel fra Hugging Face, EchoWM, præsenterer en såkaldt 'omnimodal verdensmodel', der kan generere 720p-video, miljølyd, musik og tale samtidig – og som reagerer på kontinuerlig navigation fra brugeren. Det betyder, at man ikke længere kun ser en passiv video, men kan bevæge sig rundt i et AI-genereret miljø, hvor både billede og lyd opdateres i takt med ens bevægelser.
Modellen organiserer interaktionen omkring 'kamera-intention': I førstepersonsscener styrer brugeren observatørens bevægelse, mens tredjepersonsscener lærer kamera-karakter-dynamikken fra data uden at kræve viewspecifikke controllere. Diskrete kommandoer og kontinuerlige positurer oversættes til en fælles metrisk skala med relativ 6-DoF-bane, hvilket sikrer ensartet bevægelsesstørrelse på tværs af forskellige datasæt.
For at træne modellen i både audiovisuel generering og bevægelseskontrol har forskerne bygget en komplementær data-motor og brugt progressiv træning efterfulgt af autoregressiv post-træning til langtidshorisonter. Evalueringer viser stærk banefølgning og høj visuel kvalitet på offentlige verdensmodel-benchmarks, med understøttelse af både første- og tredjepersonsinteraktion og synkroniseret miljølyd og tale over lange generationer.
For beslutningstagere er det væsentlige ikke de tekniske detaljer, men at EchoWM peger mod en fremtid, hvor AI-genereret indhold ikke er statisk, men interaktivt – et skridt mod 'enterable generative media', hvor man kan navigere i simulerede verdener i realtid. Det kan få betydning for spil, virtual reality, filmproduktion og træningssimuleringer, hvor både visuel og auditiv feedback er afgørende. Virksomheder, der investerer i AI-drevet indhold, bør derfor holde øje med udviklingen mod beboelige, generative miljøer.
