Forskere fra University of Tokyo præsenterer Task-CoEvolve, en metode der reducerer antallet af evalueringer under LLM-harness-optimering med 80% uden at gå på kompromis med slutresultatet. Harness-optimering forbedrer AI-systemers ydeevne ved at omskrive den kode, der styrer modellen, snarere end at ændre selve modelvægtene. Hidtil har hver iteration krævet en fuld evaluering af et fast valideringssæt, hvilket er dyrt og spilder ressourcer på opgaver, der hurtigt bliver mindre informative, efterhånden som harnesset forbedres.
Task-CoEvolve løser dette ved at lade valideringsopgaverne udvikle sig sammen med harnesset. Metoden bygger på indsigten om, at opgaver, hvor kandidat-harnesses er uenige, er mere værdifulde til at skelne mellem dem end opgaver, der enten altid løses eller altid fejler. Den bruger varians-vægtet sampling til at fokusere evalueringen på opgaver tæt på kapabilitetsgrænsen, og sampling-fordelingen tilpasser sig løbende. Forskernes paper viser, at metoden matcher fuld søgnings slutresultat på online tekstklassificering og Terminal-Bench 2.1, mens den skærer antallet af evalueringer markant ned.
For beslutningstagere betyder det lavere beregningsomkostninger ved at optimere AI-systemer i produktion. Hvis man kører regelmæssige harness-opdateringer for at forbedre præcision eller hastighed uden at gen-træne modeller, kan en 80% reduktion i evalueringsomkostninger oversættes til direkte besparelser på cloud-regninger og hurtigere iterationscyklusser. Metoden er dog stadig i forskningsfasen; koden frigives senere på GitHub, og det er endnu uklart, hvor bredt den kan anvendes på andre domæner end de testede.
