Forskere har præsenteret en metode, der kan trække den interne beslutningsviden ud af en finjusteret sprogmodel og omsætte den til konkrete, eksekverbare regler. Metoden, kaldet J-Miner, gør det muligt at inspicere, validere og genbruge den viden, som modellen har lært under finjustering – uden at skulle stole på modellen som en black box.

J-Miner fungerer ved at aggregere interne signaler på tværs af lag og token-positioner for at finde navngivne koncepter, og derefter bruge klassifikatorens egne forudsigelser til at lære beslutningsregler over disse koncepter. Resultatet er en eksplicit repræsentation af beslutningsviden, som kan eksekveres uafhængigt af den oprindelige model.

I tests på flere klassifikationsopgaver reproducerede J-Miner-reglerne op til 98,3 % af kildeklassifikatorens beslutninger og opnåede 6,0–29,5 procentpoint højere adfærdsmæssig troskab end tilsvarende kompakte regler lært fra input-ord. De udvundne regler kan endda overføres til letvægtsmodeller med omkring 1/24 af parametrene, som bevarer 99,8 % af kildeklassifikatorens gennemsnitlige nøjagtighed.

For beslutningstagere betyder det, at AI-systemer kan blive mere gennemsigtige og lettere at revidere. Virksomheder, der bruger finjusterede sprogmodeller til eksempelvis kreditvurdering, sygdomsdiagnostik eller kundehenvendelser, kan nu få indsigt i, hvilke konkrete signaler modellen lægger vægt på – og dermed lettere efterleve krav om forklarlighed og ansvarlighed. Metoden åbner også for at genbruge beslutningsviden i mindre, hurtigere systemer, hvilket kan reducere omkostninger og latenstid i produktion.