Reinforcement learning (RL) post-træning er blevet et standardværktøj til at forbedre sprogmodellers evner inden for ræsonnement, matematik og kodning. Men for mange praktikere og beslutningstagere er principperne bag stadig en "black box". En ny primer fra arXiv dekonstruerer RL-post-træning skridt for skridt og viser, hvad der faktisk sker under overfladen – og hvornår det virker.
Forskerne isolerer mekanikken i RL med verificerbare belønninger i et kontrolleret, forenklet miljø. De undersøger, hvordan resultaterne formes af basismodellens forudgående fordeling, granulariteten af belønningssignalet, mangfoldigheden af promptfordelingen og modelskalaen. Et centralt fund: Effekten af såkaldte 'spurious rewards' afhænger af promptfordelingen brugt til post-træning. Det betyder, at et belønningssignal, der ser korrekt ud, kan føre til uønsket adfærd, hvis promptene ikke er varierede nok.
Artiklen giver også indsigt i, hvorfor RL-post-træning kun lykkes, hvis basismodellen allerede placerer tilstrækkelig sandsynlighedsmasse på den ønskede adfærd – et link til det klassiske begreb om exploration i RL. For en beslutningstager, der overvejer at investere i RL-post-træning, er implikationen klar: Succes er ikke kun et spørgsmål om at vælge den rigtige algoritme, men om at forstå, hvad modellen allerede kan, og hvordan træningsdataene er sammensat.
