Forskere har udviklet en ramme, der gør AI-moderation af hadefuld tale mere forklarlig ved at justere modellens ræsonnement med menneskelige rationaler. Metoden, som er præsenteret på arXiv, forbedrer både klassifikationspræstation og fortolkbarhed og adresserer et centralt problem: at AI-systemer ofte er præcise, men uigennemsigtige og risikerer bias, overmoderation eller undermoderation, især når de mangler sociokulturel kontekst.

Tilgangen er evalueret på datasættene HateXplain (engelsk) og BullySent (Hinglish), hvilket afspejler forekomsten af anti-muslimsk had på tværs af begge sprog. Ved at bruge teknikker som LIME, Integrated Gradients og attention opnår modellen forbedrede F-scores, højere plausibilitet og trofasthed samt evnen til at fange kulturelt specifikke signaler i implicit anti-muslimsk had.

For beslutningstagere i tech- og content-moderation betyder dette en vej mod mere kulturelt bevidst og gennemsigtig moderation, der kan reducere risikoen for fejl og styrke tilliden til automatiske systemer. Metoden understøtter flersprogethed og kan implementeres i eksisterende pipelines uden at gå på kompromis med ydeevnen.