Et nyt forskningspapir fra Hugging Face introducerer en metode til at træne AI-agenter gennem komplekse "harnesses" – de systemer, der koordinerer agentens interaktion med omgivelserne. Metoden, kaldet ClawGym II, adresserer et centralt problem: reinforcement learning (RL) gennem sådanne harnesses har hidtil været vanskelig at skalere til lange opgaver.
Forskerne har bygget en sandbox-baseret eksekveringsinfrastruktur, der isolerer opgaver og harnesses i midlertidige sandboxes, hvilket muliggør store, parallelle kørsler. Ved at placere en proxy ved modelgrænsen kan de opsnappe modelkald og rekonstruere multi-turn-trajektorier via prefix-træer. Dette gør det muligt at anvende både critic-baserede (PPO) og critic-frie (GRPO) optimeringsmetoder på den rekonstruerede struktur – uden at skulle forstå harnessets interne logik.
Resultaterne er markante: Med Qwen3-30A3B-modellen forbedres Pass@1 på ClawGym-Bench med 9,98 og 14,81 point gennem henholdsvis OpenClaw og Claude Code, og metoden forbliver stabil over 200-400 optimeringsskridt. Derudover opnås konsistente forbedringer på mere udfordrende opgaver som JobBench og OfficeQA.
For beslutningstagere betyder dette, at virksomheder nu kan optimere agenter, der opererer gennem eksisterende, komplekse systemer – uden at skulle have adgang til systemets interne kode. Det åbner for mere effektiv træning af agenter i produktionsmiljøer, hvor man ofte er afhængig af tredjeparts-harnesses. Metoden understøtter også mix-harness-træning, hvor én model optimeres på tværs af forskellige harness-systemer, hvilket kan reducere behovet for specialiserede modeller pr. system.
