En ny undersøgelse fra arXiv sammenligner metoder til at klassificere hadetale i Roman Urdu, et lavressourcesprog talt i Pakistan og blandt urdu-talende samfund globalt. Roman Urdu er udfordrende på grund af uformel grammatik, inkonsistente sætningsstrukturer og mange variationer i stavning. Forskningen tester tre tilgange: parameter-effektiv finetuning (PEFT) med LoRA, prompt tuning og prompt engineering – både med og uden finetuning.
Undersøgelsen viser, at der er flere veje til effektiv hadetale-detektion i sprog med begrænset data. Første eksperiment brugte direkte inferens med store sprogmodeller (LLM'er) uden finetuning for at se, hvor godt de forstår Roman Urdu i en zero-shot-setting. Andet eksperiment anvendte PEFT med LoRA, som kun opdaterer en lille del af parametrene og dermed reducerer beregningsomkostningerne. Tredje eksperiment undersøgte prompt tuning med både blandede og manuelt designede prompter, mens fjerde eksperiment fokuserede på prompt engineering med zero-shot og few-shot learning.
For beslutningstagere og udviklere, der arbejder med indholdsmoderation i flersprogede eller underrepræsenterede markeder, er dette relevant: Det viser, at selv med begrænsede data kan man opnå resultater ved at vælge den rette teknik. PEFT og prompt tuning er beregningsmæssigt effektive, hvilket gør dem attraktive for organisationer med begrænsede ressourcer. Prompt engineering kræver ingen yderligere træning og kan implementeres hurtigt.
Forskningen understreger vigtigheden af at tilpasse AI-løsninger til sproglig diversitet. For virksomheder, der opererer i Pakistan eller med urdu-talende brugere, kan disse metoder være nøglen til bedre og mere retfærdig indholdsmoderation. Læs mere i den fulde undersøgelse på arXiv.
