En ny undersøgelse fra Hugging Face viser, at Evolution Strategies (ES) – en hukommelseseffektiv post-træningsmetode – kan give bredere ræsonneringsdækning end den gangse GRPO-tilgang, og at de to metoder kan kombineres for at opnå både høj præcision og bredde. Det fremgår af paperet, som systematisk kortlægger ES' optimeringsadfærd sammenlignet med GRPO.

Forskerne viser teoretisk og empirisk, at ES fører til bredere ræsonneringsdækning, hvilket udnytter de prætrænede LLM'ers evner bedre. Mens GRPO lider under såkaldt entropy-kollaps – hvor modellen bliver for snæver i sine svar – forbedrer ES både Pass@1 (præcision) og Pass@K (bredde). Konkret finder de, at en sekventiel GRPO-ES-træningsstrategi kan kombinere GRPO's styrke i Pass@1 med ES's gevinster i Pass@K.

En anden vigtig observation er, at selvom ES medfører store ændringer i modelparametrene, skyldes opgavespecifikke forbedringer kun en sparsom delmængde af større opdateringer. Det betyder, at stor parameterbevægelse ikke nødvendigvis fører til udbredt funktionel ændring – og at det ikke nødvendigvis medfører katastrofal forglemmelse, viser hold-out-evalueringer.

Endelig viser undersøgelsen, at ES kræver en mindre populationsstørrelse i større LLM'er, hvilket har praktiske implikationer for, hvordan man designer post-træningsopsætninger.

For beslutningstagere, der overvejer post-træningsstrategier, er pointen, at ES ikke blot er en hukommelseseffektiv erstatning for GRPO, men en distinkt tilgang med egne styrker – og at en kombination kan give det bedste fra begge verdener.