En ny tilgang til forstærkningslæring (RL) kan gøre træning af sprogmodeller markant mere effektiv ved at lade modellen fokusere på de opgaver, den endnu ikke mestrer, i stedet for at blive ved med at træne på dem, den allerede kan. Metoden, kaldet Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization (SA-MRPO), adresserer et grundlæggende problem i nuværende RL-praksis: Når flere belønningsmål optimeres samtidig, bruger standardmetoder en fast vægtet sum, hvilket betyder, at træningen fortsætter med at bruge ressourcer på allerede løste mål i stedet for dem med størst potentiale for forbedring.
Forskerne bag SA-MRPO viser, at metoden dynamisk omfordeler optimeringsindsatsen mod under-optimerede mål, samtidig med at den opretholder præstationen på de mål, der allerede er godt opfyldt. På matematisk ræsonnering med to- og tre-målskombinationer forbedrer SA-MRPO det sværere korrekthedsmål i 12 ud af 15 benchmark-sammenligninger sammenlignet med GDPO, med gevinster på op til 5% på AIME24. På adaptiv ræsonnering forbedres nøjagtigheden på alle fem benchmarks med gennemsnitligt 3,8% og op til 9,2% på AMC23, og på kodningsbenchmarks forbedres pass rate med op til 2,3%.
For beslutningstagere betyder dette, at træning af sprogmodeller kan blive mere ressourceeffektiv og målrettet. I stedet for at bruge store mængder beregningskraft på at finpudse allerede stærke evner, kan modeller fokuseres på at lukke specifikke huller – hvilket potentielt reducerer træningsomkostninger og forbedrer ydeevnen på de områder, der betyder mest for en given anvendelse. Metoden er særlig relevant for virksomheder, der bygger specialiserede modeller til matematik, kodning eller andre domæner, hvor præcision er afgørende.
