Forskere har præsenteret LiveAnimate, et system der for første gang kombinerer real-time streaming med stabil langtidsgenerering af menneskeanimation i milliard-skala. Modellen, bygget på en 14B-parameter video Diffusion Transformer (DiT), opnår 19,63 FPS streaming-inferens på to NVIDIA H100 GPU'er — et markant skridt væk fra de minutter eller timer, som tidligere diffusionsbaserede systemer krævede per klip.
Kernen er en to-trins træningspipeline, der først adapterer en prætrænet bidirektional DiT til en block-causal autoregressiv generator via Reference-Anchored Teacher-Forcing Adaptation, og derefter reducerer sampling-budgettet til tre trin gennem Block-wise Self-Forcing Distillation. For at bevare udseendet over lange streams introducerer systemet Pose-Retrieval Sink Attention (PR-Sink), en begrænset KV-cache-mekanisme, der kombinerer en statisk og en dynamisk 'sink' med et rullende vindue. Når en positur gentages, gendannes relevant kontekst uden at gemme hele sekvensen, hvilket holder hukommelse og latenstid konstant uanset streamlængde.
På en tre-minutters benchmark opretholder LiveAnimate næsten konstant perceptuel kvalitet og identitet fra de første 30 sekunder til det sidste minut, mens tidligere systemer forringes markant eller kræver timer af offline-beregning for samme rulning. Dette etablerer et nyt operationelt punkt i kvalitet, latenstid og varighed for interaktiv full-body animation.
For beslutningstagere betyder det, at applikationer som live-streaming, telepresence og virtuelle avatarer nu kan blive responsive og stabile i realtid — uden at gå på kompromis med kvaliteten over tid. Virksomheder, der bygger interaktive oplevelser, bør overveje at udforske LiveAnimate som grundlag for nye produkter.
