Large language models bliver i stigende grad sat til at udføre komplekse arbejdsgange, hvor succes afhænger af at opretholde indbyrdes afhængige begrænsninger og producere artefakter, der opfylder streng end-to-end-verifikation. Men den succesfulde eksekveringserfaring går typisk tabt efter en enkelt kørsel, hvilket tvinger efterfølgende modeller til at genopdage strategier og fejltilstande fra bunden. Det adresserer en ny forskningsindsats, der introducerer LongWoF-Bench, en benchmark med 778 maskinverificerbare opgaver inden for kodegenerering, agent-miljø-syntese, matematisk ræsonnement og regel-følgning.

Forskerne undersøger, om erfaring kan eksternaliseres og genbruges gennem EvoMap, hvor verifikator-bekræftede eksekveringsbaner konsolideres til strukturerede 'Gene'. På de 252 opgaver med verifikator-bekræftede Opus-baner overgår de udviklede EvoMap-Gene 'Skill' på tværs af alle syv evaluerede modeller med 8,7-15,5 procentpoint – og fordelene strækker sig til forbruger-modeller fra forskellige modelfamilier. For Claude Opus betyder genbrug af Gene også, at modellen fuldfører 39 flere opgaver end med Skill, samtidig med at token-forbruget til løsning reduceres med 9,9 %.

Interessant nok viser resultaterne, at reference-destillerede Gene ikke har samme fordel, hvilket indikerer, at kompakt repræsentation alene ikke er tilstrækkeligt – Gene's nytteværdi er tæt forbundet med verificeret erfaringsoprindelse. Det betyder, at ikke al genanvendelig erfaring er lige værdifuld; kun erfaring, der er bekræftet gennem verifikation, giver den fulde effekt.

For beslutningstagere er implikationen klar: Evnen til at gemme og dele verificeret eksekveringserfaring som en ekstern ressource kan reducere omkostningerne ved at udføre komplekse arbejdsgange markant – både i tid og token-forbrug. Det åbner for, at organisationer kan opbygge en 'erfaringsbank' af verificerede løsninger, som kan genbruges på tværs af modeller og opgaver, uden at hver enkelt kørsel skal betale den fulde pris for erfaring. For virksomheder, der investerer i AI-drevne arbejdsgange, kan dette være en strategisk fordel: lavere driftsomkostninger og højere succesrate i komplekse opgaver.