Videoredigering med tekstinstruktioner har hidtil været begrænset til enkelte operationer ad gangen. Nu introducerer forskere CoinVE-200K, et stort datasæt med 1080p-videoredigeringspar på op til 201 frames, der hver indeholder 2 til 5 atomare redigeringsoperationer. Det muliggør træning af modeller, der kan forstå og udføre flere redigeringsintentioner samtidigt i samme video, eksempelvis at tilføje et objekt, fjerne en baggrund og ændre stil på én gang. Datasættet er bygget gennem en nøje designet generations- og filtreringspipeline for at sikre instruktionsnøjagtighed, visuel kvalitet, tidsmæssig konsistens og kompositionel diversitet, ifølge paperet.

Forskerne præsenterer også CoinVE-Bench, en benchmark til evaluering af kompositionel videoredigering på tværs af forskellige emner, operationstyper og instruktionskompleksiteter. Derudover introduceres CoinVE-Edit, en 22B parametre stor model bygget på Wan2.1-T2V-14B og Qwen3-VL-8B-Instruct. Modellen anvender region-aware attention, der adskiller opmærksomhed for forskellige redigeringsinstruktioner, hvilket muliggør præcis multi-region redigering, mens irrelevant indhold og tidsmæssig sammenhæng bevares.

For beslutningstagere i medie-, reklame- og indholdsproduktionsbranchen er dette et skridt mod mere fleksible og effektive videoredigeringsværktøjer. Evnen til at håndtere flere redigeringsoperationer i én instruktion kan reducere manuelt arbejde betydeligt og åbne for mere komplekse kreative workflows. Selvom modellen stadig er forskningsbaseret, indikerer resultaterne på CoinVE-Bench stærk præstation i instruktionsfølgelse, kompositionel redigeringsnøjagtighed, visuel kvalitet og tidsmæssig konsistens.