En ny træningsmetode fra forskere bag et arXiv-paper kan gøre automatiske forskningsagenter markant billigere og hurtigere at træne. Metoden, kaldet World Model RL (WMRL), adresserer en grundlæggende flaskehals i træning af AI-agenter, der selv udfører empirisk forskning.
Problemet er, at træning af sådanne agenter traditionelt kræver, at hver agent kører i sit eget isolerede miljø med rigtig maskintid. Det gør eksekveringen til den dyreste og langsomste del af processen. WMRL løser dette ved at erstatte den faktiske eksekvering med en 'verdensmodel' – en simuleret version af miljøet – hvilket fjerner flaskehalsen.
Forskerne viser, at WMRL accelererer træningen med 3-4x på forskellige opgaver og samtidig overgår standard RL-baselines i ydeevne. Endnu vigtigere: Deres post-trænede 4B og 9B agenter klarer sig bedre end meget større open-weight agenter på 48B og 120B på hold-out benchmarks. Det betyder, at mindre, billigere modeller kan matche eller overgå langt større konkurrenter.
Metoden er ikke kun relevant for forskningsagenter. Den overfører også til træning af embodied VLA-politikker (vision-language-action), hvilket indikerer bred anvendelighed.
For beslutningstagere er implikationen klar: Hvis WMRL holder i praksis, kan omkostningerne ved at udvikle og træne AI-agenter falde markant, og mindre aktører kan konkurrere med tech-giganter uden at skulle investere i enorme compute-klynger. Det kan ændre økonomien i AI-udvikling og gøre avancerede agenter mere tilgængelige.
