En ny undersøgelse fra arXiv giver et hidtil uset indblik i, hvordan store sprogmodeller (LLM'er) faktisk bruges i produktion. Forskere bag studiet har analyseret et helt års trafikdata fra cloud-platformen Chutes – ikke kun et kort udsnit, men fuld produktionsadfærd på tværs af mange modeller og brugere, inklusive både populære og niche-modeller.
Det særlige ved denne undersøgelse er, at den fanger, hvordan arbejdsbelastningen udvikler sig over tid. Tidligere studier har typisk kun observeret korte perioder og dermed overset, hvordan brugeradfærd og modelinteraktioner former trafikken i praksis. Den nye analyse dækker både aggregerede, tidsmæssige, model- og brugerniveauer og afslører strukturer, der normalt er skjult bag gennemsnitstal.
For beslutningstagere er den vigtigste pointe, at forskerne vil frigive hele det et-årige spor sammen med papiret. Det betyder, at virksomheder og forskere kan benchmarke deres egne systemer mod virkelige produktionsdata i stedet for at stole på stikprøver eller syntetiske workloads. Det er en sjælden ressource i et felt, hvor produktionsdata ofte er lukket land.
Konsekvensen er klar: Hvis du bygger eller køber LLM-infrastruktur, kan du nu få et mere realistisk grundlag for at dimensionere caching, load-balancing og kapacitetsplanlægning. Tidligere antagelser om, hvordan trafikken ser ud, kan nu testes mod faktiske data – og det kan ændre både arkitekturvalg og investeringsbeslutninger.
