Forskere har præsenteret STEP-KTODER, en ny ramme til at forbedre AI-modellers evne til at generere kode. Metoden adresserer et grundlæggende problem: hvordan man giver modellen præcis feedback under træningen, når koden består af flere funktioner. Traditionelt har man enten givet feedback på hele programmet eller brugt sprogmodeller som dommere, men begge tilgange har vist sig upålidelige.

STEP-KTODER definerer i stedet trin som de enkelte funktioner i et program og tildeler dem binære korrekthedsetiketter ved hjælp af automatisk genererede enhedstests. Dette giver en form for procesfeedback, der tidligere kun var mulig i matematisk ræsonnering, hvor mellemliggende trin er naturligt udtrykt som tankekæder. Ifølge arXiv-papiret kombinerer metoden funktionsniveau-feedback med resultatfeedback på hele programmet, hvilket forbedrer resultaterne på benchmarks som HumanEval(+), MBPP(+), BigCodeBench og LiveCodeBench sammenlignet med eksisterende metoder som KTO og DPO.

En central pointe i forskningen er, at eksekveringsbaserede etiketter er afgørende. Analysen viser, at når man bruger en sprogmodel som dommer, overestimerer den systematisk funktionsfejl, hvilket korrumperer positive etiketter og forringer den efterfølgende optimering. Dette er en vigtig advarsel for virksomheder, der overvejer at bruge LLM-baserede evalueringsværktøjer i deres udviklingspipeline.

For beslutningstagere betyder dette, at investering i automatiseret testinfrastruktur kan være mere værd end at stole på sprogmodelbedømmelser. Koden er offentligt tilgængelig på GitHub, hvilket giver mulighed for at afprøve metoden direkte.