Et nyt forskningspapir fra Alibaba foreslår en metode, der kan løse et grundlæggende problem i træningen af store sprogmodeller: balancen mellem stabilitet og udforskning. Metoden, kaldet Environment-Regularized Policy Optimization (ERPO), flytter reguleringen fra modellens svar til dens input – et skift, der kan få betydning for virksomheder, der bygger eller køber AI-systemer til opgaver som matematisk ræsonnering.

Traditionelt bruger policy optimization en såkaldt Policy-KL-regulator, der holder modellens svar tæt på en reference for at undgå ustabilitet. Men det skaber et dilemma: Enten begrænser man svarene og bruger hele udforskningsbudgettet på regulering, eller også dropper man reguleringen og risikerer, at træningen driver ukontrolleret. ERPO bryder dette dilemma ved at lægge reguleringen på inputsiden – den begrænser, hvor meget fordelingen af træningsspørgsmål må afvige fra referencefordelingen, via et nyt Query-KL-led. Det giver kontrol uden at lægge pres på selve svargenereringen, så modellen stadig kan udforske frit.

Metoden kan integreres i eksisterende pipelines som GRPO, PPO og REINFORCE uden ekstra beregninger. På seks benchmarks for matematisk ræsonnering viser ERPO, at den kan erstatte den standard Policy-KL-regulator og samtidig opnå bedre præcision og mere stabil adfærd under høj-temperatur-dekodning og langvarig træning. Læs hele papiret på Hugging Face og se kildekoden på GitHub.

For beslutningstagere betyder det, at træning af specialiserede modeller – fx til matematik, logik eller andre domæner med klare regler – kan blive både mere effektiv og mere forudsigelig. Det reducerer risikoen for, at modellen kollapser eller bliver uregerlig under træning, hvilket er en konkret bekymring for teams, der selv finetuner modeller. For dem, der køber AI-kapacitet, kan det betyde, at leverandører kan tilbyde mere stabile og pålidelige modeller til komplekse opgaver.