En ny forskningsartikel fra arXiv introducerer en familie af træbaserede ensemble-modeller, der hævder at overgå både traditionelle Transformers og eksisterende fortolkelige modeller i multimodal klassifikation – samtidig med at de leverer langt mere menneskeligt forståelige forklaringer på deres beslutninger. Det kan få betydning for systemer, hvor tillid og gennemsigtighed er afgørende, såsom klinisk overvågning og uddannelsesvurdering.
Forskerne bag artiklen har udviklet tre varianter – Linear Discriminant Tree (LDT), Linear Discriminant Forest (LDF) og Linear Discriminant AdaBoost (LDAB) – der kombinerer lineær diskriminantanalyse med træstrukturer. Metoden koder hver modalitet (tekst, lyd, video) til tokens, udtrækker og klynger koncepter for at reducere dimensionalitet, og ruter de fusionerede data gennem træbaserede klassifikatorer. En ny modificeret feature-importance-metrik reducerer indflydelsen fra den negative klasse i binære klassifikationsopgaver, hvilket forbedrer detektion af indikatorer eller markører.
Resultaterne viser F1-mod-forbedringer på 4,3 % over Multimodal Transformer og præcisionsforbedringer på 3,0 % over den primære fortolkelige baseline, Interpretable Multimodal Routing (IMR). Endnu vigtigere: Den foreslåede feature-importance opnår markant højere overensstemmelse med menneskelige annotatorer end standardmetoden – 62,2 % mod 43,2 % på IEMOCAP-datasættet og 46,7 % mod 32,1 % på CMU-MOSI. Det indikerer, at modellens forklaringer i højere grad matcher, hvad mennesker opfatter som relevante signaler.
For beslutningstagere betyder det, at man ikke længere behøver at vælge mellem høj ydeevne og forklarlighed. I sektorer som sundhed og uddannelse, hvor regulering og tillid er altafgørende, kan træbaserede modeller tilbyde et mere gennemsigtigt alternativ til komplekse Transformers – uden at ofre præcision. Det kan også påvirke indkøbsbeslutninger, da organisationer kan kræve forklarlige AI-systemer for at overholde kommende reguleringer.
