Forskere har præsenteret CONFER, et nyt framework til multimodal følelsesgenkendelse, der adresserer et grundlæggende problem: selvrapporterede følelseslabels er ofte upålidelige, og forskellige modaliteter – som stemme og ansigt – kan modsige hinanden. CONFER modellerer hver modalitet som en ekspert med en prædiktiv overbevisning, usikkerhed og runtime-pålidelighed, og lader dem forhandle via iterativ message-passing. Dette gør systemet i stand til at kalibrere svage labels og skelne mellem tre regimer: konsensus, dissens og ambiguïtet.

Under strenge evalueringer (leave-one-subject-out) opnår CONFER 0.873 accuracy på AMIGOS-V og 0.854 på MAHNOB-V. Vigtigere er, at analyser viser, at større forhandlingsgevinster opstår på højkonfliktsamples, og at metoden er robust over for korrupte weak labels. Det indikerer, at krydsmodal konflikt – ofte betragtet som støj – faktisk indeholder nyttig information til at forbedre både modalitetskoordinering og supervision-pålidelighed.

For beslutningstagere betyder det, at følelsesgenkendelse kan blive mere pålidelig i virkelige applikationer, hvor mennesker ikke altid udtrykker følelser konsistent. Det kan have konsekvenser for alt fra kundeserviceanalyse til mental sundhedsmonitorering, hvor præcision er kritisk.