Forskere har præsenteret GRNEdit, en ny tilgang til instruktionsbaseret videoredigering, der markant reducerer de tekniske krav sammenlignet med eksisterende systemer. Modellen, beskrevet i et nyt paper på Hugging Face, opnår resultater på niveau med langt større konkurrenter – og gør det med under 3 % af konditioneringsparametrene og træning på kun 0,6 millioner par.
Hvor traditionelle videoredigeringsmodeller ofte afhænger af tunge ekstra komponenter eller dyr sammenkædning af kilder, introducerer GRNEdit en to-trins arkitektur, der fortolker redigeringsinstruktioner som simple binære beslutninger – beholde eller ændre – over visuelle elementer. Denne tilgang gør det muligt at modellere redigeringsintentionen effektivt uden at skulle behandle store mængder ekstra data.
Resultaterne er bemærkelsesværdige: GRNEdit-2B opnår en score på 4,03 på OpenVE-Bench, hvilket overgår flere 14B open-source redigeringsværktøjer. Den større GRNEdit-8B-model scorer 4,18 og matcher de førende open-source-systemer. For beslutningstagere betyder det, at høj kvalitet i videoredigering ikke længere nødvendigvis kræver massive beregningsressourcer – en faktor, der kan gøre teknologien langt mere tilgængelig for mindre virksomheder og organisationer.
Den tekniske innovation ligger i, hvordan modellen håndterer 'tomme' instruktioner. Ved at lade en tom instruktion betyde 'ingen redigering' og træne modellen til at rekonstruere kilden, skaber GRNEdit en reference-tilstand, som den kan sammenligne redigerede resultater med. Dette forbedrer både indholdets bevarelse og evnen til at rette fejl i beslutningerne.
For virksomheder, der overvejer at implementere videoredigering i deres produkter eller arbejdsgange, kan GRNEdit repræsentere et skift mod mere ressourcevenlige løsninger. Det kan sænke adgangsbarrieren for AI-drevet videoredigering og gøre det muligt at køre avancerede funktioner på eksisterende hardware.
