Forskere har udviklet en ny metode, DiffusionOPSD, der gør det markant billigere og mere effektivt at tilpasse AI-billedgenereringsmodeller til specifikke præferencer og opgaver. Metoden, beskrevet i et nyt paper, adresserer et centralt problem: traditionel reinforcement learning kan justere modeller baseret på belønninger, men giver ikke klare retningslinjer for, hvordan de mellemliggende trin i billedgenereringen skal ændres.
DiffusionOPSD løser dette ved at konvertere belønningssignaler fra hele billeder til eksplicitte mål for de enkelte forudsigelser under genereringsprocessen. Dette sker gennem en såkaldt on-policy self-distillation, hvor en fastfrossen reference-model genererer træningsdata, og en aktiv model løbende opdateres mod disse mål.
Resultaterne er markante: I test på to forskellige modeller, SD 3.5-M og Z-Image-Turbo, opnåede DiffusionOPSD de bedste resultater i 19 ud af 20 sammenlignelige opsætninger. Metoden overgik den stærkeste konkurrerende metode med op til 44,0% og reducerede træningstiden markant – med 40% på SD 3.5-M og 63% på Z-Image-Turbo sammenlignet med en eksisterende tilgang kaldet DiffusionNFT.
For virksomheder og udviklere, der bygger eller køber AI-billedgenereringsløsninger, betyder dette lavere omkostninger til tilpasning og hurtigere iteration. Metoden gør det også lettere at diagnosticere, hvorfor en model opfører sig på en bestemt måde, hvilket er værdifuldt, når man skal finjustere modeller til specifikke forretningsbehov.
