En ny forskningsartikel fra Hugging Face introducerer en familie af metoder, der kan forbedre reinforcement learning (RL) for store sprogmodeller (LLM'er) ved at udforske i parameter-rummet frem for i handlings-rummet. Metoden, kaldet Perturbed Parameter Policy Optimization (3PO), viser konsistente forbedringer i matematisk ræsonnering og kodegenerering sammenlignet med standardmetoden GRPO – og det uden ekstra beregningsomkostninger.
Traditionel RL for LLM'er styrer udforskning ved at justere temperaturen i output-fordelingen, men denne tilgang kan ikke ændre rækkefølgen af tokens og begrænser dermed variationen. Det kan føre til divergens eller fastlåst træning. 3PO adresserer dette ved at generere rollouts fra forskellige politikker, der hver især kan udforske forskellige stier. Ved at sample mere eller mindre forskellige politikker får man en komplementær kontrolmekanisme over udforskningen.
Eksperimenter på modeller som OLMo-3-1025-7B og Qwen2.5-Math-7B viser, at 3PO konsekvent forbedrer den gennemsnitlige downstream-ydeevne sammenlignet med GRPO, og at metoden producerer færre nul-fordel-grupper og fejlagtige rollouts under træning. Læs hele papiret for tekniske detaljer om sampling-strategier og rollout-gruppering.
For beslutningstagere, der bygger eller køber LLM-træningsløsninger, er pointen ikke de tekniske detaljer, men at der findes en metode, der kan forbedre modelkvaliteten uden at øge beregningsomkostningerne. Det betyder, at eksisterende træningsbudgetter kan udnyttes bedre, og at modeller kan blive mere robuste over for træningsfejl. Hvis resultaterne reproduceres i bredere skala, kan 3PO blive en standardkomponent i RL-træningspipelines – hvilket kan påvirke både modeludvikling og valg af træningsinfrastruktur.
