En ny træningsmetode, OPDVR, foreslået af LeapLabTHU, kombinerer to udbredte paradigmer for post-training af store sprogmodeller: Reinforcement Learning with Verifiable Rewards (RLVR) og on-policy distillation (OPD). Metoden adresserer en kendt svaghed i begge tilgange: RLVR giver kun sparsom feedback på opgaveniveau, mens OPD giver tæt token-niveau vejledning, men ignorerer om hele banen er korrekt. OPDVR integrerer de to uden at tilføje nye hyperparametre, hvilket er en sjældenhed i feltet.

Kernen i metoden er en reformulering af den implicitte belønning i sampled-token OPD baseret på bane-korrekhed, efterfulgt af en ReLU-gating-mekanisme. Dette sikrer, at korrekte baner får ikke-negative belønninger, og ukorrekte får ikke-positive, hvilket justerer destillationssignalet med opgavens succes. Ifølge forfatterne gør denne ændring sampled-token OPD til en egentlig RLVR-metode, der kan kombineres med enhver policy-gradient-algoritme som GRPO. Eksperimenter på seks reasoning-benchmarks viser, at OPDVR konsekvent overgår standard OPD.

For beslutningstagere er den strategiske betydning klar: Metoden kan reducere kompleksiteten i post-training-pipelines, da den fjerner behovet for at tune vægte mellem to tabs eller skifte heuristisk mellem dem. Det betyder lavere udviklingsomkostninger og hurtigere iteration, når man træner modeller til opgaver med verificerbare belønninger, såsom matematik eller kodning. Koden er offentligt tilgængelig på GitHub, hvilket gør det muligt for teams at afprøve metoden direkte.