En ny benchmark kaldet SlopCodeBench sætter spotlys på AI-modellers evne til at rette op på bevidst dårlig kode – og her står Anthropics Opus 5 som den klare vinder. Benchmarken tester modellernes evne til at forstå og forbedre kode, der er skrevet med intentionelle fejl og dårlig stil – såkaldt 'slop code'.
Testen viser, at Opus 5 opnår en markant højere score end både GPT-4o og Claude 3.5 Sonnet, når det gælder om at identificere logiske fejl, forbedre læsbarhed og implementere korrekte løsninger. Ifølge kilden er resultaterne baseret på en række kodningsopgaver, hvor modellerne skulle rette op på bevidst dårlig kode.
Hvorfor dette er vigtigt: For virksomheder, der overvejer at bruge AI til kodegennemgang eller automatiseret refactoring, peger resultaterne på, at Opus 5 i øjeblikket er det stærkeste valg. Men benchmarken er ikke uproblematisk. Nogle kritikere påpeger, at testen er designet af en enkelt udvikler og ikke er uafhængigt valideret. Derudover kan 'slop code' være for snævert defineret til at være repræsentativt for virkelige kodningsopgaver.
Strategisk vurdering: Hvis du bygger et AI-assisteret kodningsværktøj, bør du overveje at teste Opus 5 specifikt på dine egne use cases. Men vær opmærksom på, at benchmarkens design kan favorisere modeller, der er trænet på lignende data. Det anbefales at supplere med egne tests, før du træffer endelige beslutninger.
