Et nyt forskningsprojekt fra Hugging Face introducerer PILOT, en supervisor-worker-harness, der gør det muligt for langtidsholdbare AI-agenter at lære og forbedre sig selv, mens de kører – ikke kun efter afslutning. Dette adresserer en central begrænsning i eksisterende agentarkitekturer, hvor erfaring typisk først behandles efter eksekvering, hvilket forhindrer omdirigering af den aktive kørsel eller umiddelbar anvendelse af lærte lektioner. Læs paperet.
PILOT bruger to sammenkoblede mekanismer: live steering, hvor en separat supervisor kan omdirigere eller afbryde den aktive worker under eksekvering, og live self-evolution, der destillerer procedurer og fejlmønstre til genanvendelige færdigheder og hukommelse. Ifølge resultaterne præsterer PILOT først i fem ud af seks konfigurationer på tværs af to frosne backbones og tre benchmarks. På Terminal-Bench 2.0 overgår PILOT sammenlignelige harnesses med op til 9,8 procentpoint. I selvforbedringsscenariet opnår PILOT 14,6 point med GLM-5.1 og 12,4 point med Kimi-K2.6. Desuden falder gennemsnitlige output-tokens med 42,9% og 47,4%, mens succesfulde evalueringer per million output-tokens stiger med henholdsvis 110,3% og 134,0%.
For beslutningstagere betyder dette, at agenter kan blive mere effektive og omkostningseffektive i komplekse, langvarige opgaver – en direkte fordel for virksomheder, der implementerer automatisering i drift eller kundeservice. Evnen til at lære live kan reducere behovet for manuel overvågning og forbedre kvaliteten af udførelse i realtid.
