En ny undersøgelse fra arXiv foreslår, at LLM-agenter kan opnå betydelige omkostningsreduktioner ved at lære færdigheder som programmer frem for gennem dyr trial-and-error. Forskerne bag SpeedRunner argumenterer for, at program-augmenterede agenter, der eksekverer sekvenser af handlinger deterministisk, kan opnå mål pålideligt og billigt – også over lange horisonter, hvor traditionelle agenter risikerer degenereret adfærd.
Studiet viser, at agenten kan lære ved inferenstid ved at analysere tidligere trajektorier og refaktorere færdigheder, uden behov for replay eller validering. På tværs af tre forskellige embodied-miljøer opnår SpeedRunner konsekvent frontlinjen i både læring og omkostningsreduktion, samtidig med at den forbliver robust over for distributionsskift og miljømæssig tilfældighed.
For beslutningstagere betyder dette, at investering i agenter, der kan lære programmatiske færdigheder, kan reducere driftsomkostninger markant – især i opgaver med lang horisont, hvor fejlforsøg er dyre. Det peger på en strategisk fordel ved at vælge agentløsninger, der prioriterer struktureret læring frem for ren brute-force.
