En ny videnskabelig undersøgelse sår tvivl om en udbredt antagelse i AI-forskningen: at man kan styre en AI-model til at være mere empatisk ved at justere dens interne repræsentationer. Forskningen, som er offentliggjort på arXiv, viser, at selvom man kan 'afkode' en retning i modellen, der forbindes med empati, betyder det ikke nødvendigvis, at man pålideligt kan kontrollere modellens faktiske adfærd.

Studiet testede to facetter af empati — kognitiv genkendelse og affektiv resonans — i tre forskellige sprogmodeller. Resultaterne er blandede: For affektiv empati gav styring kun en delvis ændring i scoringsmodellerne, mens kognitiv styring slet ikke gav nogen målbar ændring. Forskerne understreger, at dette ikke nødvendigvis betyder, at styringen er uden effekt, men at de nuværende måleinstrumenter er for upræcise til at fange forskellene.

For beslutningstagere, der overvejer at implementere AI i roller, hvor empati er kritisk — for eksempel i kundeservice eller terapeutiske sammenhænge — er implikationen klar: Man kan ikke stole på, at en model, der er 'justeret' til at være mere empatisk, faktisk opfattes sådan af mennesker. Forskningen viser, at selvom teksten ændres markant, er det ikke sikkert, at den menneskelige oplevelse følger med.