En ny benchmark fra Analogy AI udfordrer antagelsen om, at større og dyrere sprogmodeller nødvendigvis træffer bedre langsigtede beslutninger. FM-Bench (Football Management Benchmark) lader en AI-agent drive en fodboldklub i 20 år med 26 værktøjer og omkring 340-400 beslutningspunkter – fra spillerhandler og kontraktforhandlinger til investeringer i faciliteter og ungdomsafdeling. En deterministisk motor akkumulerer hvert års resultat til én endelig score, uden menneskelig bedømmelse eller LLM-dommer.

Resultaterne er bemærkelsesværdige: FM-Bench-papiret viser, at alle 15 testede modeller gennemfører hele horisonten, mens blinde scriptede baselines dør ud i de fleste scenarier. Men rækkefølgen på leaderboardet – hvor claude-fable-5 topper – forudsiges hverken af modelskala, pris eller udbyder. Faktisk roterer titlen mellem ti forskellige modeller i Arena-formatet, hvor alle konkurrerer i samme delte verden.

Det, der adskiller modellerne, er ledelsesadfærd snarere end beregningskraft. Højere scorende modeller reducerer investeringer med langsom afkastning mod slutningen, holder kapital investeret frem for passiv, og åbner kontraktfornyelser i god tid. Token-forbrug forudsiger intet. Samtidig afslører benchmarken klare svagheder: ingen model lærer markedets skjulte priser fra hundredvis af afviste bud, og selvstyret hukommelse fejler på to modsatte måder – et arkiv der kun vokser, eller en plan der omskrives hver sæson.

For beslutningstagere er implikationen klar: Når man vælger en AI-model til langsigtede strategiske opgaver – ikke kun korte, afgrænsede opgaver – bør man ikke stole på størrelse eller pris som proxy for kvalitet. FM-Bench tilbyder en metode til at måle, hvad der faktisk betyder noget: evnen til at navigere kumulative konsekvenser og tilpasse sig et reaktivt miljø.