AI-assistenter, der søger på nettet for at give forbrugeranbefalinger, kan i høj grad narres af manipuleret webindhold. Det viser en ny undersøgelse fra Hugging Face, hvor forskere introducerer benchmarken FORGE (Fake Online Recommendations in Generative Environments).
Forskerne omskrev lokalt rigtige produkter i en fast mængde hentede websider til falske produkter og målte, hvor ofte LLM'en anbefalede det falske produkt. På tværs af 12 kommercielle og open-weights LLM'er var alle modeller sårbare: én enkelt forurenet side gav narrede rater på op til 27 %, mens fuld top-3-udskiftning hævede det til 73,8 %.
Sårbarheden varierer på tværs af kategorier og øges, når modellerne mangler stabil forhåndsviden om produkterne. Bekymrende er det, at ræsonnement ikke afhjælper problemet – tværtimod genererer det ofte falsk social proof for at retfærdiggøre forkerte anbefalinger.
Ingen af de fire testede forsvarsmekanismer er tilstrækkelige: skepticismeprompten kan forværre sårbarheden, de to konsensusfiltre risikerer at undertrykke legitime produkter, og troværdigheds-reranking hjælper alle modeller, men fjerner kun en sjettedel af de falske anbefalinger.
For beslutningstagere, der bygger eller køber AI-drevne anbefalingssystemer – eksempelvis inden for e-handel eller indholdsplatforme – betyder det, at man ikke kan stole blindt på søge-augmenterede LLM'er uden at tage højde for risikoen for manipuleret webindhold. Det er en strategisk udfordring, der kræver investering i robuste valideringsmekanismer, før systemerne rulles ud i forbrugerrettede sammenhænge.
