En ny open source-implementering lover markant hurtigere AI-inferens på Apple Silicon. Projektet MTPLX hævder at opnå 3x hurtigere hastigheder på MLX med Qwen 3.8 27B ved at bruge native MTP (Multi-Token Prediction) speculative decoding — uden behov for en ekstern drafter-model.

For beslutningstagere betyder det, at store sprogmodeller kan køre hurtigere og mere effektivt på lokal hardware, hvilket kan reducere afhængigheden af cloud-baserede løsninger og sænke driftsomkostningerne. Teknikken udnytter en models egne forudsigelser til at generere flere tokens ad gangen, hvilket mindsker latens og øger gennemløb.

Projektet har fået 44 stjerner på GitHub i dag og har i alt 1.436 stjerner, hvilket indikerer en vis interesse fra udviklerfællesskabet. Selvom det er et relativt nyt projekt, kan det have strategisk betydning for virksomheder, der overvejer at implementere AI på edge-enheder eller ønsker at reducere cloud-afhængighed.