En ny forskningsmetode, 4DAnyone, gør det muligt at rekonstruere en 4D-model af et menneske – altså en tredimensionel model der også ændrer sig over tid – ud fra en enkelt, ubevæbnet video optaget med et almindeligt kamera. Det skriver forskerne bag projektet på Hugging Face.

Metoden adresserer et centralt problem i eksisterende video-diffusionsmodeller: Når man skal generere mange forskellige kameravinkler af samme person, mister modellerne konsistens – personen kan ændre udseende eller form mellem vinklerne. 4DAnyone løser dette med to nye teknikker, Reference Context Packing og Target Context Routing, som komprimerer referencebilleder og deler kontekst mellem grupper af vinkler under genereringen.

For beslutningstagere betyder det, at teknologien kan bringe fotorealistisk 4D-rekonstruktion ud af laboratoriet og ind i produktionsmiljøer. Potentielle anvendelser inkluderer film- og spilproduktion, hvor man kan skabe digitale tvillinger af skuespillere uden dyre kamerarigge, samt sundheds- og sportsanalyse, hvor bevægelse kan studeres i 3D fra en simpel video.

Forskerne har også bygget et nyt datasæt, MVGameHuman, ved hjælp af en spilmotor, og trænet modellen på både lysstudie- og naturlige videoer. Resultaterne viser, at 4DAnyone overgår tidligere metoder i både videokvalitet og 3D-rekonstruktion, og at den fungerer robust på videoer optaget i virkelige omgivelser.