En ny forskningsramme, LEGO-RL, viser, at AI-kodningsagenter kan blive markant bedre, når de trænes med reinforcement learning direkte i deres naturlige arbejdsmiljø. Forskere bag projektet har opnået forbedringer på op til 9,4 procentpoint på tværs af tre forskellige kodningsplatforme, hvilket peger på en mere effektiv vej til at udvikle AI-assistenter til softwareudvikling.

Traditionelt har træning af kodningsagenter været udfordrende, fordi de komplekse systemer, der styrer deres interaktion med værktøjer og kode, ikke er designet til at understøtte moderne træningsmetoder. Problemer som systemnedbrud og 'reward hacking' – hvor agenten finder snydemåder at opnå belønning på – har forvrænget læringssignalerne. LEGO-RL løser dette ved at bygge en bro mellem de eksisterende agent-systemer og skalérbar policy-gradient optimering, uden at ændre på systemernes interne logik.

Kernen i metoden er tre søjler: trofast optimering gennem in-process LLM-proxying, der sikrer præcis token-niveau justering; pålidelig eksekvering via sandbox-orchestrering med billedcaching og forsvar mod reward hacking; og observerbar træning med automatiseret validering og et live UI til detaljeret diagnose. Ifølge forskningspapiret forbedrede LEGO-RL Qwen3.5-35B-A3B-modellen på SWE-bench Verified fra 64,0% til 70,4% på OpenHands SDK, fra 62,4% til 68,2% på Claude Code og fra 57,2% til 66,6% på OpenCode – alt imens korrelationen mellem rollout og træning forblev over 0,99.

For beslutningstagere betyder dette, at investeringer i AI-kodningsværktøjer kan blive mere forudsigelige. Hvis metoden valideres yderligere, kan virksomheder forvente, at deres AI-assistenter bliver væsentligt bedre til at løse reelle kodningsopgaver, hvilket kan øge produktiviteten og reducere behovet for manuel gennemgang. Samtidig åbner det for mere effektiv brug af eksisterende open-source-modeller, hvilket kan sænke omkostningerne ved at udvikle specialiserede kodningsagenter.