Liquid AI har udgivet LFM2.5-VL-3B, en vision-sprog-model på 3,1 milliarder parametre, der er bygget til at køre direkte på enheden – uden cloud-afhængighed. Modellen markerer et skridt mod praktiske, lokale AI-assistenter, der kan forstå skærmindhold, lokalisere objekter og udføre handlinger via værktøjskald.

Den vigtigste nyhed er ikke kun størrelsen, men evnerne: Modellen scorer 80,7 på ScreenSpot-v2, en benchmark for skærmforståelse, og løfter RefCOCO grounding fra 57,1 til 87,9 – en markant forbedring i at knytte sprog til konkrete visuelle elementer. Tool-calling er helt nyt i VL-serien, og her springer ToolSandbox-scoren fra 26,4 til 59,5. Det betyder, at modellen ikke bare kan se, men også kan handle – f.eks. klikke på knapper eller udfylde felter ud fra en instruktion.

For beslutningstagere er det strategisk vigtigt, at modellen passer i cirka 3 GB og afkoder 228 tokens per sekund på en Apple M5 Max. Det gør den realistisk til at køre på laptops, tablets og måske telefoner – med lav latens og uden at sende data til skyen. Det åbner for use cases, hvor privatliv, offline-drift eller omkostninger er afgørende, f.eks. i sundhed, finans eller kundeservice.

Liquid AI understreger, at modellen er designet til on-device deployment, hvilket kan presse markedet for edge-AI. Hvis andre følger efter, kan vi se et skift fra store cloud-modeller til mindre, specialiserede enhedsmodeller – især til agentiske opgaver, hvor hastighed og data-lokalitet tæller.

Læs mere i Liquid AI's officielle udgivelse og se benchmark-detaljerne.