At generere billeder, hvor flere bestemte personer skal genkendes, er en af de sværeste opgaver for billedgenereringsmodeller. Hidtil er kvaliteten faldet drastisk, jo flere personer der skal med. Nu præsenterer forskere bag WithEveryone en samlet ramme, der kan håndtere op til ti reference-identiteter i samme billede.
Metoden adskiller sig ved at behandle hver identitet som et adresseret token og først forudsige en struktureret layout-plan, før billedet genereres. Den centrale nyskabelse er en såkaldt Layout-Grounded ID Loss, som bruger annoterede ansigtsregioner til at styre de ønskede identiteter direkte – i stedet for at stole på ustabil embedding-baseret ansigtsmatchning.
Resultaterne på en benchmark, hvor identiteterne ikke var set i træningen, viser en forbedring af ansigtssimilaritet fra 0.462 (GPT-Image-2) til 0.499, og en reduktion af copy-paste-artefakter fra 0.169 til 0.055. Metoden dækker 97,3 % af de ønskede identiteter med en duplikatrate på kun 2,8 %.
For virksomheder, der bygger produkter til personlig billedgenerering – fx marketing, underholdning eller sociale medier – betyder det, at man kan skalere til større grupper uden at gå på kompromis med genkendeligheden. Det er en konkret forbedring af en teknisk flaskehals, der hidtil har begrænset kommercielle anvendelser.
