En ny benchmark, ClawProBench, udfordrer den gængse måde at evaluere AI-agenter på. Traditionelle benchmarks vurderer kun agentens endelige svar, men overser fejl undervejs i eksekveringen — især når agenter kører på stateful runtimes med værktøjer og delvise tilstande. ClawProBench introducerer trace-aware evaluering, der scorer agenter ud fra hele eksekveringssporet, ikke kun slutresultatet.

Benchmarken er bygget på OpenClaw, en live agent-runtime med workspace-værktøjer og native surfaces til browsing, hukommelse, messaging, planlægning, skills og subagenter. Den tilbyder to spor: et fuldt profil med 102 scenarier og et frossent holdout med 68 scenarier, der bruger lukkede JSON-outputkontrakter til robust rangering. Scoringen kombinerer korrekthed, proceskvalitet og effektivitet via en safety-gated formel, der bevarer fejlbeviser til audit.

Resultaterne er tankevækkende: Den bedste safety-gated gennemsnitlige trace-score er 0,7671, men native-runtime-opgaver klarer sig markant dårligere end workspace-live-opgaver (0,5238 vs. 0,6415). På holdout-sporet overgår pass@k-any streng tre-forsøgs-pass (0,6638 vs. 0,2890), og rangeringer baseret kun på korrekthed adskiller sig væsentligt fra procesbevidste, safety-gated og streng-pass-visninger. Faktisk viser fuld-profil og holdout-rangeringer svag alignment (Spearman 0,1300), hvilket betyder, at en agent, der klarer sig godt i ét spor, ikke nødvendigvis gør det i et andet.

For beslutningstagere, der bygger eller køber agent-løsninger, er implikationen klar: Slutresultat-baserede leaderboards kan skjule native-surface-svagheder, one-off-successer og trace-lokale fejlmønstre. Hvis du vælger en agent baseret på traditionelle benchmarks, risikerer du at overse fejl i evidence acquisition, runtime-routing eller safety boundaries, som kun dukker op i eksekveringssporet. ClawProBench giver en metode til at evaluere agenter på en måde, der matcher reelle produktionsforhold, hvor runtime-fejl er lige så vigtige som det endelige output.