En ny open-source model fra Hugging Face-miljøet viser, at robotter kan lære langt mere effektivt, hvis de trænes på tidsafstand frem for menneskelige præferencer. RynnValue, en såkaldt value foundation model for robotmanipulation, bruger tidsafstanden mellem en observation og et sprogligt defineret mål som træningssignal – i stedet for de præference- eller fremskridtsmarkører, som hidtil har domineret feltet.

Fordi tidsafstand kan udledes direkte fra tidsstempler, kan modellen skaleres til over 7.000 timers data og cirka 3 millioner instruktionsbetingede klip uden at kræve dyre præference- eller fremskridtsannotationer. Det er en central pointe: præference-baseret læring er ofte flaskehalsen, når robotter skal lære fra store, heterogene datasæt.

Resultaterne er markante. På benchmarken RBM-EVAL-OOD opnår RynnValue en gennemsnitlig Kendall's tau_a på 0,675 – højere end den fuldt præference-superviserede state of the art (0,655) og mere end dobbelt så høj som en progress-only tilgang (0,292). Modellen generaliserer desuden zero-shot til nye opgaver, robotarme og kameravinkler.

Når modellen konverteres til tætte belønninger via potential-based shaping, løfter den realtids-politikkens succesrate fra 52,5% til 72,5% online og fra 63,8% til 82,5% offline. Det er en konkret forbedring, som kan få direkte betydning for virksomheder, der implementerer robotter i produktion eller logistik.

For beslutningstagere betyder det, at vejen til generalist-robotter – der kan løse mange forskellige opgaver uden omfattende omtræning – bliver kortere og billigere. Behovet for menneskelig annotation reduceres markant, hvilket både sænker omkostninger og accelererer udrulning.