Forskere har præsenteret UniSwap, et nyt framework, der for første gang kan udskifte både udseende og stemme i talende videoer i ét samlet system – og det kan køre som streaming i realtid. Tidligere løsninger har behandlet billede og lyd separat med hver deres optimerede model, hvilket gjorde det svært at opnå synkron audiovisuel konsistens. UniSwap bruger i stedet én fælles audiovisuel diffusion-transformer, der overfører både referencepersonens udseende og stemmeklang, mens den bevarer kildens indhold, bevægelser og timing.
For beslutningstagere, der overvejer at bygge eller købe løsninger til videoproduktion, indholdsgenerering eller kommunikation, er den centrale nyskabelse, at systemet er designet til streaming – det kan behandle video løbende, ikke kun i batch. Det åbner for brug i live-sammenhænge som videomøder, udsendelser eller interaktive applikationer, hvor lav latenstid er afgørende.
Teknisk set løser UniSwap flere velkendte problemer: træningsdata med parrede identiteter er sjældne, så forskerne har udviklet en swap-and-reconstruct-pipeline, der fjerner visuel og vokal identitet fra rigtige klip og bruger de originale klip som rekonstruktionsmål. Derudover reducerer metoden antallet af denoising-trin fra 30 til 3 pr. blok, hvilket gør inferens markant hurtigere – en forudsætning for streaming. En teknik kaldet Feature-RoPE Decomposition holder cachede positioner inden for træningsområdet, hvilket understøtter stabil lang-form-generering.
For dem, der skal vurdere teknologien, er det værd at bemærke, at UniSwap er et forskningsresultat, ikke et kommercielt produkt. Men det peger på en retning, hvor audiovisuel identitetsudskiftning bliver både hurtigere og mere sammenhængende – og dermed mere anvendelig i produkter, der kræver realtidsbehandling.
