En ny forskningsartikel, R^3-Bench, introducerer et benchmark, der tester, hvor godt AI-modeller kan fordele begrænsede beregningsressourcer (compute) mellem flere opgaver — et centralt problem for virksomheder, der bygger AI-agenter, som skal løse komplekse arbejdsgange under tidspres.
Forskerne fandt, at selv avancerede modeller har svært ved at leve op til deres fulde potentiale, når de skal prioritere mellem flere opgaver med et fælles budget. I 71 ud af 72 test-scenarier klarede modellerne sig dårligere end et teoretisk optimalt valg af opgaver, og i mange tilfælde var de endda ringere end en simpel strategi, der bare fordeler ressourcerne lige. Det tyder på, at modellerne ikke formår at opdatere deres strategi undervejs, når presset stiger.
For beslutningstagere betyder det, at en AI-model, der klarer sig godt i enkeltopgaver, ikke nødvendigvis er god til at håndtere flere opgaver samtidig med begrænsede ressourcer. Det er en vigtig overvejelse, når man skal vælge eller bygge AI-løsninger til opgaver som kundesupport, dataanalyse eller logistik, hvor flere henvendelser eller opgaver skal behandles samtidig.
Forskerne påpeger, at der er et vedvarende gab mellem modellernes dokumenterede kompetence og deres evne til at realisere den under fælles budgetter. Det er et signal til virksomheder om, at de bør teste deres AI-systemer i realistiske scenarier med flere samtidige opgaver, ikke kun i isolerede tests.
