En ny agent-arkitektur, kaldet Recuris, viser markante forbedringer i evnen til at løse komplekse, langvarige opgaver – et område hvor selv de bedste AI-modeller hidtil har fejlet. Arkitekturen, beskrevet i et nyt paper på Hugging Face, adresserer et kerneproblem: Når AI-agenter arbejder over lange tidshorisonter, bliver historikken så lang, at modellen mister overblikket og fejlfortolker, hvilken færdighed der skal bruges.

Recuris løser dette ved at adskille hukommelsen i to lag: en arbejdshukommelse, der holder styr på den aktuelle opgavestatus og styrer valget af færdigheder, og en erfaringshukommelse, der indeholder tidligere løsninger. Denne kobling gør, at agenten baserer sine valg på de aktuelle behov frem for hele historikken. Samtidig bliver udførelsen til struktureret evidens, der kan lokalisere fejl til specifikke hukommelseskomponenter – hvilket muliggør en kontinuerlig, selvforbedrende loop, hvor en fast meta-agent opdaterer færdighedshukommelsen baseret på validerede resultater.

Resultaterne er imponerende: På tværs af fire benchmarks og ti modeller forbedrer Recuris opgaveløsningen i 35 ud af 37 model-benchmark-par. På tau-bench løfter den GPT-5.6 Sol med +17,8 point og Claude Opus 5 med +15,6 point, hvilket bringer Opus 5 op på 87,9% succesrate. På SkillFlow giver den +16,6 og +13,5 point til henholdsvis Qwen3.6-27B og Qwen3.6-35B. Fordelen vokser med opgavens længde – på de længste opgaver er forbedringen helt oppe på +32,2 point – og almindelige langtidssvigt reduceres med op til 80%.

For beslutningstagere er dette ikke bare endnu en modelopdatering. Det er en arkitekturændring, der kan gøre AI-agenter brugbare i virkelige, komplekse arbejdsgange – fra kundeservice og sagsbehandling til forskning og softwareudvikling – hvor opgaver strækker sig over timer eller dage. Evnen til at lære af egne fejl og løbende forbedre sig er også et skridt mod det, forskerne kalder 'recursive self-improvement' (RSI), hvor systemer kontinuerligt transformerer akkumuleret erfaring til mere effektiv adfærd. Koden er offentligt tilgængelig på GitHub, hvilket gør det muligt for virksomheder at teste og integrere arkitekturen i egne systemer.