Forskere har præsenteret en ny metode, der markant reducerer social bias i store vision-sprogmodeller (LVLMs) – de AI-systemer, der både forstår billeder og tekst. Metoden, kaldet Counterfactual Ensemble Decoding (CED), er beskrevet i et nyt paper på arXiv og viser reduktion af bias på op til 47,97 procent på tværs af tre evalueringsbenchmarks.
LVLMs – teknologien bag mange kommercielle billedforståelsesprodukter – arver ofte sociale skævheder fra deres træningsdata. Det betyder, at de kan opføre sig forudindtaget, når de behandler portrætter af forskellige sociale grupper. Tidligere afbiasningsmetoder sammenligner typisk token-sandsynligheder mellem originale og forudindtagne generationer under dekodning, men de er fundamentalt begrænset af at stole på et enkelt, stereotypisk synspunkt og tager ikke højde for mangfoldigheden af sociale perspektiver.
CED tilgår problemet anderledes: Inspireret af samfundsvidenskabelig forskning, der viser, at mangfoldighed fremmer retfærdighed, konstruerer metoden multi-gruppe kontrafaktiske perspektiver i det visuelle repræsentationsrum og integrerer dem under dekodning. Konkret udfører CED først kontrafaktisk styring i det visuelle rum ved at identificere semantiske retninger forbundet med hver social gruppe og generere kontrafaktiske repræsentationer langs disse retninger. Dette giver forskellige perspektiver, der bryder med stereotype narrativer.
Under dekodning finder CED det dekoderlag, hvor perspektiverne divergerer mest, og ensembler deres token-fordelinger med usikkerhedsbevidste vægte. Det prioriterer højtillids-tokens fra forskellige grupper og skaber en mere balanceret sandsynlighedsfordeling, der styrer mere retfærdig generering.
For beslutningstagere, der bygger eller køber AI-systemer med billedforståelse, er det centrale resultat, at CED ikke kun reducerer bias – det bevarer også modellens kerneevner med minimal forringelse. Det betyder, at virksomheder kan adressere et af de mest omdiskuterede problemer i AI uden at gå på kompromis med ydeevnen.
