En ny undersøgelse fra Hugging Face viser, at tekst-til-billede diffusionsmodeller skalerer lige så forudsigeligt som sprogmodeller – men med en afgørende forskel: de kræver markant mere data for at opnå optimal træningseffektivitet. Abra-studiet, som er offentliggjort som preprint, har systematisk kortlagt scaling laws for flow-matching transformere trænet over tre størrelsesordener af compute (10^19 til 10^22 FLOPs).

Hovedfundet er, at compute-optimalitet opnås ved cirka 200 billed-tokens per parameter – ti gange mere end Chinchilla-prescriptionen for sprogmodeller. Det betyder, at praktikere bør prioritere mere data frem for større modeller, når de træner diffusionsmodeller. Overraskende nok viser undersøgelsen også, at diffusionsmodeller er robuste over for overtræning, hvilket står i kontrast til sprogmodeller.

For beslutningstagere, der investerer i eller bygger billedgenereringssystemer, har dette direkte konsekvenser for ressourceallokering: At skalere data er vigtigere end at skalere modelstørrelse, og man kan presse træningen længere uden at frygte overfitting. Studiet viser desuden, at forudsigeligheden strækker sig ud over træningstab til generative kvalitetsmålinger, optimale CFG-indstillinger og repræsentationskvalitet – hvilket gør det lettere at planlægge træningsbudgetter på forhånd.