En ny metode, AnyTalk, gør det muligt at generere 3D-taleanimationer for vilkårlige figurer uden at skulle bruge animationsdata. Det skriver forskerne bag projektet i en ny artikel på Hugging Face.

Traditionelt kræver audio-drevne 3D-taleanimationer enten træningsdata specifikt for hver karakter eller omfattende manuel opsætning af rigging og re-meshing. AnyTalk omgår dette ved at udnytte eksisterende video-diffusionsmodeller, der er trænet på store videodatasæt. Metoden finjusterer en præ-trænet video-diffusionsmodel til den ønskede karakter ved hjælp af en teknik kaldet Character-specific Fine-tuning (CsF). Ved at finjustere på renderede billeder af 3D-karakteren parret med nulstillede audio-embeddings (der repræsenterer "ingen bevægelse"), bevares bevægelsesprioriteten fra den store video-diffusionsmodel, mens behovet for animationsdata elimineres.

Resultatet er en talende-hoved-video, der løftes op til 3D-taleanimation ved at estimere blendshape-parametre gennem en optimeringsproces. AnyTalk muliggør lip-synced animationer på tværs af forskellige ansigtsmasker og blendshape-konfigurationer, hvilket markant reducerer manuelt arbejde og datakrav. Forskerne har også udviklet en strømlinet version, AnyTalk_RT, der muliggør realtidsydelse.

Koden er offentligt tilgængelig på projektets hjemmeside.