En ny forskningsartikel fra arXiv introducerer CoCo (Contribution-Contrast), en metode til at fortolke, hvordan Mixture-of-Experts (MoE) belønningsmodeller træffer beslutninger. Belønningsmodeller er centrale for at lære AI fra menneskelige præferencer, men indtil nu har det været svært at forstå, hvad der driver deres vurderinger. Traditionelle metoder baseret på routing-vægte viser kun, hvilke prompts en ekspert modtager, ikke hvordan den vurderer svarene. CoCo ændrer dette ved at bruge valgte og afviste svarpar med størst bidragskontrast, hvilket giver et mere præcist billede af eksperternes rolle.
Ifølge artiklen, som du kan læse her, viser evalueringer, at CoCo giver mere sammenhængende, troværdige og specialiserede fortolkninger end eksisterende metoder som router-baserede, score-baserede og sparse autoencoder-baserede tilgange – samtidig med at den opretholder konkurrencedygtig præcision i belønningsmodelleringen. Dette er ifølge forfatterne den første systematiske undersøgelse af fortolkningsmetoder for MoE-belønningsmodeller.
For beslutningstagere betyder dette, at AI-systemer, der bruger belønningsmodeller – for eksempel i træning af sprogmodeller eller i systemer, der skal følge menneskelige præferencer – bliver lettere at revidere og forstå. Det er afgørende for virksomheder, der skal dokumentere, hvorfor deres AI handler, som den gør, især i regulerede brancher. Selvom metoden er forskningsmæssig, peger den i retning af mere gennemsigtig AI, hvilket kan reducere risikoen ved implementering og styrke tilliden hos kunder og tilsynsmyndigheder.
