Forskere bag en ny metode til AI-videogenerering adresserer et af de største problemer for praktisk brug: at få modeller til at reagere præcist og hurtigt på brugerinput i realtid. Metoden, kaldet Context-Matched Distillation (CMD), er beskrevet i et nyt paper og kan gøre teknologien markant mere anvendelig til opgaver som filmproduktion, spil og interaktive medier.
Kernen i problemet er, at eksisterende systemer til videogenerering ofte trænes med information fra hele videoklippet, også fremtidige billeder, når de skal lære at forudsige det næste. Det giver en uoverensstemmelse, når modellen i praksis skal generere video sekventielt og kun kan se fortiden. CMD løser dette ved at sikre, at træningen matcher den information, modellen faktisk har til rådighed under generering. Det betyder, at modellen kan styres mere præcist, for eksempel med kamerabevægelser, og samtidig generere video hurtigere.
For beslutningstagere betyder det, at AI-videogenerering rykker tættere på at kunne bruges i professionelle arbejdsgange, hvor både hastighed og kontrol er afgørende. Metoden viser ifølge forskerne state-of-the-art resultater på både korte og lange videoer og forbedrer markant evnen til at følge tidsvarierende kamerakontrol. Det er et skridt i retning af, at AI-værktøjer kan integreres i kreative og tekniske produktionsmiljøer, hvor man ikke vil gå på kompromis med kvalitet eller fleksibilitet.
