Forskere har præsenteret en ny algoritme, EXIMO, der kan gøre det markant billigere og hurtigere at lære robotter nye opgaver. Metoden, beskrevet i et nyt paper, angriber et af de største problemer i robotteknologi: at finjustere store VLA-modeller (vision-language-action) til nye opgaver kræver typisk hundredvis af timers dyr menneskelig teleoperation – eller ineffektiv reinforcement learning (RL).
EXIMO arbejder i tre faser: explore, imitate og optimize. I explore-fasen bruges en vision language model (VLM) som planlægger til at nedbryde komplekse, langtidshorisonte opgaver i kortere delopgaver, som VLA-modellen kan håndtere. Sammen indsamler de et orkestreret datasæt på nye opgaver. I imitate-fasen finjusteres VLA-modellen på disse data. Til sidst, i optimize-fasen, bruges residual off-policy RL til yderligere at forfine politikken.
Forskerne viser i eksperimenter, at EXIMO overgår eksisterende tilgange markant i både sample-effektivitet og endelig ydeevne – altså at modellen lærer hurtigere med mindre data og opnår bedre resultater.
For virksomheder og organisationer, der overvejer at implementere robotter i produktion eller logistik, betyder det, at omkostningen og tiden til at træne robotter til nye opgaver kan falde væsentligt. Hvor man tidligere skulle investere i store teleoperations-datasæt eller lange RL-forløb, kan EXIMO potentielt reducere behovet for menneskelig arbejdskraft og fremskynde implementeringen.
