En ny forskningsartikel fra Hugging Face introducerer CAFE (Coupled Agent–Feedback Evolution), en metode, hvor en søgeagent og dens feedback-kritiker trænes sammen i et selvforstærkende loop. Resultaterne viser, at denne tilgang overgår eksisterende RL-baserede søgeagenter på syv benchmarks og reducerer hallucinationer – men den vigtigste pointe for beslutningstagere er, at ensidig forbedring af enten agenten eller kritikeren fører til stagnation. Læs hele papiret.
Kernen i CAFE er, at traditionel træning med terminal belønning (kun succes/fiasko ved slutningen) ikke kan lokalisere fejl undervejs i en agents søgeproces. CAFE løser dette ved at lade den samme model skifte mellem rollen som søgeagent og kritiker. Under online reinforcement learning bruges en sammenlignende feedback-estimator til at forme agentens anmodninger om feedback, mens offline optimering lærer fra matchede succesfulde og fejlslagne forløb. Papiret beskriver detaljeret, hvordan denne koblede optimering forhindrer, at fejl akkumuleres.
For virksomheder, der bygger eller køber AI-agenter til komplekse opgaver – fx juridisk research, due diligence eller teknisk support – betyder dette, at kvaliteten afhænger af, hvordan feedback-systemet er designet. En agent, der bare får flere data eller mere regnekraft, vil ikke nødvendigvis forbedres, hvis kritikeren ikke også opdateres. CAFE's resultater viser, at alternerende opdateringer af agent og kritiker fortsætter med at forbedre ydeevnen, hvilket peger på en ny standard for, hvordan selvforbedrende systemer bør bygges.
