Liquid AI har udgivet LFM2.5-2.6B, en model der kan planlægge, kalde værktøjer og løse flertrinsopgaver helt på enheden – uden at sende data til skyen. Modellen har 2,69 milliarder parametre, håndterer 131.072 tokens kontekst og afkoder med 220 tokens per sekund på en M5 Max-chip, mens den bruger under 2,5 GB hukommelse. Vægtene er åbne og leveres i GGUF, MLX og ONNX-formater, hvilket gør den direkte anvendelig i eksisterende applikationer og på tværs af platforme. Se den originale meddelelse hos MarkTechPost.

For beslutningstagere er det væsentlige ikke selve parameterantallet, men hvad det muliggør: at køre agentiske arbejdsgange – som at hente data, behandle den og handle på den – lokalt på en brugerenhed. Det betyder lavere driftsomkostninger, ingen latens fra netværk, og ikke mindst at følsomme data kan blive på enheden. I en tid hvor virksomheder i stigende grad bekymrer sig om compliance og datasikkerhed, kan on-device-modeller blive et reelt alternativ til cloud-baserede agenter.

Liquid AI har tidligere positioneret sig med en anden arkitektur end de klassiske transformer-modeller, og LFM2.5-2.6B fortsætter den linje med en blanding af gated convolutions og GQA-blokke. Det er en teknisk detalje, men den har strategisk betydning: Hvis modellen kan levere agentisk kapacitet med så lavt ressourceforbrug, åbner det for at bygge produkter, der tidligere krævede store serveropsætninger – eksempelvis assistenter i industrien, sundhedssektoren eller på mobile enheder.

De åbne vægte er en særlig pointe for virksomheder, der vil undgå lock-in til en enkelt leverandør. Med GGUF, MLX og ONNX kan modellen integreres i eksisterende systemer uden at skulle omskrive hele stacken. Det sænker barrieren for at eksperimentere og gør det lettere at flytte arbejdsbyrder mellem enhed og sky, alt efter behov.