En ny data-motor, WorldRover, er blevet præsenteret på Hugging Face. Den er designet til at generere store mængder syntetisk video med detaljerede annotationer, hvilket kan være afgørende for udviklingen af såkaldte verdensmodeller – AI-systemer, der skal kunne forstå og interagere med komplekse, udforskbare miljøer.

Traditionelt kræver træning af sådanne modeller video med mere end blot RGB-farver: data om kamerabevægelse, scenens geometri og tidsmæssig korrespondance. Reelle optagelser kan give nogle af disse signaler, men tæt geometri og langtrækkende korrespondance kræver ofte estimering eller specialiseret udstyr. Rendering kan levere disse data direkte, men eksisterende syntetiske ressourcer kombinerer dem sjældent på samme frames og understøtter ikke kontrollerede ændringer af synsvinkel og udseende.

WorldRover løser dette ved at bruge en Unreal Engine-pipeline, der kan udføre og offline-rendere minutlange ruter, mens den bevarer fulde baner og scenens geometri. Den samme udforskning kan afspilles fra første-person, tredje-person og 360-graders panoramiske kameraer under forskellige miljøforhold. Dette gør det muligt at generere WorldRover-10M, et datasæt, hvor sekvenser parrer RGB med metrisk dybde, kamerabevægelser og handlingssignaler. Tredje-person-datasæt inkluderer desuden tæt optisk flow, langtrækkende 2D/3D-punktspor med synlighed og en karakterbevægelse, der er adskilt fra kamerabevægelsen.

For beslutningstagere, der investerer i eller bygger AI-systemer til robotik, autonome køretøjer eller virtuelle miljøer, betyder dette en mere skalerbar og kontrollerbar måde at træne modeller på. I stedet for at være afhængig af dyre og komplekse fysiske optagelser kan man nu generere præcise, annoterede data i stor skala. Dette kan reducere udviklingstiden og omkostningerne betydeligt og samtidig forbedre modellernes evne til at håndtere komplekse, dynamiske scenarier.

Læs mere om WorldRover på Hugging Face for tekniske detaljer og datasættets struktur.