Når en AI-model ikke kan svare på et spørgsmål i første forsøg, forsøger agentiske systemer igen – og hvert forsøg koster tokens. Denne ekstraudgift skaber et hul mellem, hvad en models pris per token antyder, og hvad en hel arbejdsgang faktisk koster. Forskere kalder dette hul for token inflation og definerer det som forholdet mellem den reelle arbejdsgangspris og prisen for et enkelt kald. Ifølge et nyt paper på arXiv kan systemer som FrugalGPT, der ruter baseret på enkeltkald, undervurdere de reelle omkostninger med mere end det dobbelte på vanskelige opgaver.

For at løse dette introducerer forskerne InflationAgent, en fire-trins router, der systematisk måler token inflation på tværs af modeltyper og opgavetyper. Målingerne viser inflation så høj som 4,25 gange for en 7B-model på multi-hop spørgsmålsbesvarelse. Routeren bruger også et nyt signal, CoT Branching Entropy (CBE), der forudsiger høj inflation med en AUROC på 0,887, og vælger modeller ved at maksimere en såkaldt Semantic Exchange Rate (SER), der dividerer forventet nøjagtighed med forventet sand pris. En central detalje er, at routeren kasserer fejlslagne kæder, før den sender opgaven videre til en stærkere model – en strategi, der valideres ved, at videresendelse af en fejlslagen ræsonneringskæde til GPT-4o reducerer dens nøjagtighed med op til 34,8 procentpoint.

Resultaterne er markante: På GSM8K under et fast budget opnår InflationAgent 94,7 procent nøjagtighed mod 91,0 procent for FrugalGPT, samtidig med at det bruger 31 procent færre tokens.

Parallel udvikling: standardisering af routing

Samtidig præsenterer et nyt paper på Hugging Face LLMRouter, en åben, modulær infrastruktur til at udvikle, evaluere og implementere LLM-routers. Paperet tilbyder en samlet formulering af routing som en sekventiel beslutningsproces med fem komponenter: kontekst-encodere, model-encodere, scoringsfunktioner, beslutningsregler og læringssignaler. Derudover introduceres benchmarken xRouteBench, der dækker generiske LLM-, hukommelsesforstærkede, vision-, tidsserie- og personaliserede routingopgaver. Empiriske studier viser, at lærte routers overgår den stærkeste faste model-baseline med 14,6 procent relativt, og at letvægts-routers bliver mere konkurrencedygtige under stramme budgetbegrænsninger.

Konsekvens for beslutningstagere

For virksomheder, der bygger eller køber agentiske AI-løsninger, er implikationen klar: Prisen på AI-arbejdsgange kan være markant højere end forventet, og valget af router kan have stor indflydelse på både omkostninger og kvalitet. Investeringer i intelligent routing kan betale sig hurtigt, især på opgaver med mange gentagne forsøg. Desuden peger forskningen på, at standardisering af routing – som LLMRouter tilbyder – kan gøre det lettere at sammenligne og vælge mellem forskellige løsninger.