AI-kodningsagenter er blevet markant bedre til at løse simple programmeringsopgaver, men et nyt benchmark viser, at de stadig halter på de komplekse, langsigtede opgaver, som udviklere møder i praksis. SWE-Bench ProMax, et ekspertkurateret benchmark med 170 opgaver fra ægte commits på tværs af syv programmeringssprog, viser, at selv de bedste frontier-modeller kun opnår en succesrate på 41,2 %.
Benchmarket fokuserer på kode-refactoring – en opgave, der kræver koordinerede, adfærdsbevarende ændringer på tværs af mange filer. Hver opgave involverer i gennemsnit 11,4 ændrede filer og 261,6 linjer kode, hvilket er væsentligt mere komplekst end eksisterende benchmarks. Det er netop denne type opgaver, der er afgørende for virksomheder, der overvejer at lade AI-agenter håndtere større dele af deres softwareudvikling.
Det nye benchmark adresserer også et alvorligt problem med eksisterende benchmarks: En audit fandt, at næsten 60 % af de uløste opgaver i det populære SWE-bench Verified indeholder fejlbehæftede tests – enten for snævre eller for brede – og at frontier-modeller kan reproducere løsninger fra træningsdata. SWE-Bench ProMax er designet til at undgå disse faldgruber ved at omskrive opgavebeskrivelser og manuelt gennemgå testsuiter.
For beslutningstagere betyder det, at AI-kodningsagenter endnu ikke er pålidelige nok til store, kritiske refactoring-opgaver. Selvom agenterne klarer simple opgaver godt, er der lang vej igen, før de kan overtage komplekse, langsigtede opgaver. Det bør indgå i overvejelserne, når man planlægger AI-investeringer og -adoption i softwareudvikling.
