Frontier open-weight-modeller er blevet nemmere at få fat i, men at køre dem har hidtil krævet datacenter-infrastruktur. Det vil FreeToken ændre på: et edge-native MoE-serving-system, der behandler en personlig maskine som en samlet, elastisk inferensplatform – ikke som en lille GPU. Systemet er designet til at udnytte de ressourcer, der faktisk er til stede, frem for at binde sig til en fast offloading-strategi, og det understøtter mere end 20 MoE-modeller samt kodnings- og værktøjs-agenter på hardware lige fra en 8GB laptop-GPU til en enkelt workstation-GPU.
Det interessante er ikke kun, at det virker – men hvad det gør muligt: en 35B-model på en laptop, en 284B-model på en gaming-desktop og den 753B tunge GLM-5.2 på en enkelt workstation-GPU. Det betyder, at open weights reelt bliver til deploybar lokal software, og at de maskiner, folk allerede ejer, kan blive en praktisk platform for frontier-scale intelligens. For beslutningstagere handler det ikke om tekniske detaljer, men om at lokal AI kan blive et reelt alternativ til cloud-afhængighed – med implikationer for data governance, omkostninger og fleksibilitet.
FreeToken er frigivet på flashml.ai, og systemet er beskrevet i et paper, der viser, hvordan fuld serving-stack – fra model-layout og loading til CPU-GPU-eksekvering og runtime-hukommelse – er co-designet omkring to realiteter: agent-arbejdsbelastninger ændrer hele tiden deres eksekveringsmønster, og edge-hardware har heterogene ressourcer, hvis balance varierer fra maskine til maskine.
