Forskere har vist, at OpenAIs Whisper-model kan tilpasses til følelsesgenkendelse i tale (SER) på persisk – et lavressourcesprog – uden at skulle træne store, tunge modeller. Ved at reducere dimensionaliteten af de embeddings, som Whisper-encoderet producerer, med PCA (Principal Component Analysis), kan man opnå bedre resultater end med traditionelle metoder, samtidig med at træningstid og hukommelsesforbrug falder markant. Det fremgår af et nyt studie på arXiv.

Studiet er relevant for beslutningstagere, der overvejer at implementere følelsesanalyse i tale – for eksempel i kundeservice, sundhedspleje eller markedsanalyse – især i sprog, hvor der er begrænset data. Resultaterne viser, at man kan bruge en eksisterende, stor prætrænet model som Whisper og kun tilføje en letvægts-klassifikationskomponent, hvilket gør løsningen langt mere overkommelig i praksis.

Forskerne testede deres tilgang på ShEMO-datasættet med en højttaler-uafhængig evaluering. PCA-reduktion forbedrede konsekvent følelsesgenkendelsespræstationen, samtidig med at antallet af trænbare parametre blev væsentligt reduceret. Derudover undersøgte de, om yderligere finjustering af Whisper på en persisk talegenkendelsesopgave (ASR) kunne forbedre SER-resultaterne – men gevinsten var beskeden, hvilket tyder på, at sprogtilpasning ikke nødvendigvis overføres til følelsesrelaterede repræsentationer.

For virksomheder og organisationer, der ønsker at bygge følelsesgenkendelsessystemer i andre lavressourcesprog, er implikationen klar: Man kan starte med en eksisterende prætrænet model og opnå gode resultater med en letvægts-tilføjelse, uden at skulle investere i store, specialiserede modeller. Det sænker både de tekniske og økonomiske barrierer for at komme i gang.