Forskere bag Ex-Omni-2D har præsenteret en ny ramme, der gør det muligt for AI-dialogmodeller at svare med både tekst, personlig tale og reference-styret video – alt sammen i én koordineret sekvens. Modellen, beskrevet i et nyt paper på Hugging Face, adresserer et grundlæggende problem i eksisterende omni-modale systemer: de kan forstå og tale, men deres svar er visuelt 'kropsløse'. Med Ex-Omni-2D får assistenten en visuel tilstedeværelse, der kan matche indholdet i samtalen.

Det tekniske gennembrud ligger i en såkaldt 'Visual Thought Plan' (VTP), der forudsiger scene, følelse og bevægelse, før selve svaret genereres. Dette gør det muligt at lære fra heterogene data – tale, dialog og avatar-video – uden at kræve massive mængder af synkroniserede query-tekst-tale-video-eksempler. For praktiske anvendelser betyder det, at systemet kan køre i realtid: Med fire-trins inferens opnår hele pipeline'en en ende-til-ende RTF på 1.293 ved 400×720 opløsning, hvilket giver en brugbar balance mellem kvalitet og effektivitet.

For beslutningstagere er implikationen klar: Denne teknologi kan gøre digitale assistenter markant mere engagerende og menneskelige i kundeservice, træning og underholdning. Virksomheder, der overvejer at investere i AI-drevne avatarer eller virtuelle repræsentanter, bør holde øje med denne udvikling, da den kan sænke barrieren for at skabe naturlige, visuelle interaktioner uden enorme infrastrukturinvesteringer.