AI-agenter kan i dag konstruere workflows i øjeblikket for at løse komplekse opgaver, men de procedurer, der opdages i én episode, kasseres typisk bagefter. Det betyder, at agenten ikke bliver klogere på tværs af opgaver. Et nyt framework, FlowEvo, løser dette ved at lade workflows og skills co-evolvere under inferens — uden yderligere træning.
FlowEvo kompilerer succesfulde workflows til kaldbare skills, gemmer dem i en persistent bank og bruger dem enten direkte eller som kontekst til at konstruere nye workflows. Systemet sporer også hver skills downstream-nytte og undertrykker skills, der forårsager negativ transfer. Det er en træningsfri tilgang, hvilket betyder, at den kan anvendes oven på eksisterende modeller uden at kræve finjustering.
På tværs af otte baselines og fem standard benchmarks — ALFWorld, HumanEval, MBPP, GSM8K og MATH-500 — opnår FlowEvo med en fælles GPT-4o-mini-backbone den højeste nøjagtighed. På ALFWorld når det 85,6 %, hvilket er 26,4 point over den stærkeste baseline, og det bruger omtrent en tredjedel så mange tokens. På tværs af 10 basismodeller fra 7B til 671B parametre overgår FlowEvo ExpeL i 49 ud af 50 model-dataset-sammenligninger. Koden er offentliggjort på GitHub.
For beslutningstagere betyder det noget, fordi effektivitetsgevinsten er direkte omsættelig til lavere driftsomkostninger: færre tokens per opgave betyder lavere inferensomkostninger i produktion. Samtidig er frameworket modelagnostisk — det virker på tværs af modeller fra 7B til 671B — hvilket gør det relevant uanset hvilken model man allerede har investeret i. At systemet er træningsfrit reducerer desuden implementeringsbarrieren, da man ikke skal gennemgå en dyr træningspipeline.
