Forskere har udviklet en ny metode til at forbedre kvaliteten af AI-genereret video med lyd. Problemet med eksisterende systemer er, at de optimerer på separate tekniske målinger for lydkvalitet, visuel troværdighed og synkronisering – hvilket kan føre til resultater, der scorer højt på papiret, men som opleves som usammenhængende eller utro mod teksten, der styrede genereringen. Det skriver forskerne i et nyt paper.

Løsningen er en belønningsmodel kaldet VA-Judger, der i stedet lærer at vurdere kvalitet ud fra menneskelige præferencer. Modellen er trænet på et stort datasæt med 9.000 prompts og 10.300 sammenligninger fra åbne generationsmodeller. Den bruger en kæde af tanker til først at skelne mellem klare kvalitetsforskelle og derefter lære at vurdere de sværere, tætte sammenligninger – hvor forskellen er mindre åbenlys.

Ifølge forskerne overgår VA-Judger traditionelle metoder, når det gælder at forudsige menneskelige præferencer, både på opgaver, den er trænet på, og på nye, ukendte opgaver. Og når belønningsmodellen bruges til at eftertræne en video-audio-genereringsmodel, forbedres kvaliteten markant.

For virksomheder, der bygger eller køber AI-værktøjer til video- og lydproduktion, betyder det, at output kan blive mere pålideligt og brugbart i praksis – ikke bare teknisk korrekt, men også meningsfuldt for seeren. Det er et skridt mod at gøre AI-genereret indhold til en reel produktionsressource frem for et teknisk eksperiment.