Store sprogmodeller er trænet på en overvægt af engelsksproget internettekst, der overrepræsenterer bestemte kulturelle fortællinger. Det rejser bekymring for, at modellerne flader mangfoldigheden af ikke-vestlige fortælletraditioner ud til en enkelt homogen arketype. En ny pilotundersøgelse fra arXiv sætter nu tal på problemet på tværs af tre markant forskellige indiske mundtlige og litterære traditioner: Rajasthani Pabuji-eposet, klassisk tamilsk Sangam-poesi og bengalske folkeeventyr.

Forskerne indsamlede autentiske referencekorpus for hver tradition (henholdsvis 11, 21 og 10 passager) og bad to sprogmodeller (Claude Sonnet og Gemini) om i alt 54 generationer fordelt på tre prompttyper per tradition: generiske, kulturelt specifikke og regionalsproglige. Ved hjælp af Sentence-BERT-embeddings og cosinus-lighed målte de, hvor tæt modellernes output lå på den autentiske tradition i forhold til de andre (reference drift) og hvor ens output var på tværs af traditioner (cross-tradition convergence).

Resultaterne viser, at output forbliver tættere på deres egen traditions reference end på de andres, men at ligheden på tværs af traditioner er høj (0,52-0,66) i forhold til, hvad traditionernes faktiske afstand ville tilsige. Det indikerer en delvis homogenisering. Overraskende nok reducerede prompting på regionalsprog (hindi, tamil eller bengali) konsekvent troskaben til den autentiske tradition sammenlignet med engelsk prompting – med op til 27 procentpoint for Rajasthani- og bengalske traditioner.

For beslutningstagere, der bygger eller køber AI-løsninger til ikke-engelsksprogede markeder, er dette et vigtigt signal: Selv når man forsøger at nå lokale brugere på deres eget sprog, kan modellen levere kulturelt udvandede svar. Undersøgelsen diskuterer dette mod tidligere modstridende resultater om flersproget prompting og argumenterer for, at det afspejler en forskel mellem at fremkalde generel kulturel diversitet og at simulere en snæver, mindre dokumenteret mundtlig tradition. Piloten positioneres som et letvægts-, skalerbart supplement til nyere storstilede human-annotationsstudier af indisk kulturel misrepræsentation i LLM-genererede historier.