Et nyt forskningspapir fra arXiv introducerer Backtrader-Bench, et benchmark designet til at evaluere AI-agenter i algoritmisk handel. Resultaterne er markante: Værktøjsforstærkede agenter opnår 90,0% nøjagtighed i et enkelt gennemløb (GPT-5.5 og Opus 4.7), hvilket er 17 procentpoint bedre end de bedste basismodeller uden værktøjer (73,0% i gennemsnit over 10 kørsler).

For beslutningstagere i finanssektoren signalerer dette et skift: Agenter, der kan tilgå eksterne værktøjer og udføre kode, er markant bedre rustet til komplekse opgaver som handelsstrategier end rene sprogmodeller. Backtrader-Bench adresserer også et kritisk problem i evaluering af AI: statiske benchmarks risikerer dataforurening, og numeriske backtest-resultater kræver ground truth fra faktisk kodeudførelse. Ved at generere multiple-choice-spørgsmål deterministisk fra backtest-konfigurationer på tværs af fem handelsstrategier, 33 skabeloner og tre sværhedsgrader, sikrer rammen uafhængig verifikation af hvert svar.

Men resultaterne afslører også en svaghed: På 38 separat udvundne spørgsmål falder nøjagtigheden uden værktøjer dramatisk, og halvdelen af modellerne falder til omkring tilfældigt niveau (25%). Dette understreger, at modeller uden værktøjsadgang stadig har betydelige begrænsninger i kvantitative opgaver – en vigtig overvejelse for virksomheder, der overvejer at implementere AI i handelsworkflows.

Ud over evaluering er infrastrukturen designet til at producere et træningskorpus til reinforcement learning, med det ultimative mål at bygge en specialiseret agent til kvantitativ handel. For investorer og teknologiledere betyder det, at vi kan forvente mere specialiserede AI-løsninger til finansielle markeder i den nærmeste fremtid.