Store sprogmodeller med billedforståelse (vision-language-modeller) kan lære af eksempler i konteksten – men de ignorerer ofte billederne helt. Et nyt forskningspapir fra arXiv præsenterer en metode, der både forklarer hvorfor, og hvordan man får modellerne til at bruge billederne mere effektivt.
Forskerne bag VIB-ICL-rammen introducerer et mål kaldet Cross-Modal Information Gain (CMIG), der kvantificerer hvor meget ekstra information et billede bidrager med i forhold til teksten alene. På den baggrund viser de, at multimodal in-context learning overgår tekst-only, når billedet tilføjer unik information – men at det er optimalt at ignorere billedet, hvis det er redundant.
Det er et vigtigt skridt: I stedet for at behandle visuel neglect som en fejl, viser forskerne at det kan være den rigtige beslutning – og de leverer en algoritme, der dynamisk justerer opmærksomheden. På fem benchmarks opnår de op til 4,7% højere nøjagtighed og reducerer antallet af nødvendige eksempler med 35%.
For virksomheder, der bygger eller køber AI-løsninger med billedforståelse, betyder det to ting: For det første kan man nu få modeller til at lære hurtigere med færre eksempler – hvilket sparer både tid og token-omkostninger. For det andet giver rammen en teoretisk begrundelse for, hvornår man skal investere i multimodale modeller frem for tekstbaserede – og hvornår det er spild af penge.
