En ny serving-engine, FreeToken, gør det muligt at køre GLM-5.2 med 753 milliarder parametre på en enkelt workstation-GPU. Det skriver MarkTechPost. For beslutningstagere betyder det, at frontier-modeller ikke længere kræver store server-farme — i hvert fald ikke til inferens.
FreeToken er bygget til MoE-arkitekturer (Mixture of Experts), hvor kun en del af parametrene aktiveres per forespørgsel. Enginen håndterer cache-misses ved at fordele arbejdet mellem PCIe-overførsler og CPU-eksekvering, baseret på målte båndbredder. Det er en teknisk detalje, men konsekvensen er strategisk: organisationer kan køre store modeller lokalt uden cloud-afhængighed, hvilket påvirker både omkostninger, data governance og latency.
For dem der skal bygge eller købe AI-infrastruktur, er spørgsmålet ikke kun, om modellen kører, men hvordan den klarer sig i praksis — og hvor grænsen går for, hvad en enkelt GPU kan håndtere. FreeToken adresserer netop den grænse ved at optimere ressourceudnyttelsen i edge-miljøer. Kilden beskriver det som en edge-native løsning, der "unlocks frontier models locally".
Det er endnu et skridt mod at gøre store modeller tilgængelige uden for datacentre. For virksomheder, der overvejer at flytte inferens tættere på dataen — af hensyn til privatliv, compliance eller hastighed — er FreeToken et signal om, at muligheden bliver mere reel. Men det er tidligt: der er ingen benchmark-tal eller uafhængige tests i materialet, så den praktiske ydeevne er endnu ikke dokumenteret.
