Ollama, et af de mest populære værktøjer til at køre sprogmodeller lokalt, har udgivet endnu en ny version: v0.32.7. Den kommer blot få dage efter den stabile v0.32.6 og tilføjer indledende understøttelse af Muse Glimmer — Metas nyeste åbne model — via Ollamas MLX-motor på Apple Silicon. Ifølge udgivelsesnoterne er der tale om initial support, og yderligere optimeringer til Apple Silicon, NVIDIA, AMD og andre platforme forventes i de kommende dage.

Allerede nu er der dog nyt: En release-kandidat v0.32.8-rc0 er blevet udgivet og tilføjer Muse Glimmer-support for NVIDIA, AMD og yderligere platforme. Dette betyder, at organisationer, der kører på ikke-Apple-hardware, hurtigt kan få adgang til Metas nyeste model — et vigtigt skridt for bredere implementering.

Den foregående stabile udgivelse, v0.32.6, bekræftede flere konkrete forbedringer, der har betydning for brugere med Apple-hardware og dem, der integrerer med OpenAI-kompatible API'er. Qwen3.5 er nu hurtigere på Apple GPU'er: MLX-motoren bruger automatisk modellens MTP-head (Multi-Token Prediction) til spekulativ dekodning. Det betyder, at inferens kan blive markant hurtigere på Apple Silicon-enheder, hvilket er relevant for organisationer, der kører lokale AI-modeller på Mac-maskiner.

Derudover er `/v1/chat/completions` streaming nu justeret til at matche OpenAIs wire-format: `role` sendes kun i første chunk, `finish_reason` får sin egen chunk, og `usage` inkluderes separat. For udviklere og virksomheder, der bygger på OpenAI-kompatible API'er, reducerer dette friktion og gør det lettere at skifte mellem cloud og lokal kørsel uden at ændre kode.

For beslutningstagere, der overvejer at bygge interne AI-løsninger på egen infrastruktur, er Ollama en nøglespiller. Det giver mulighed for at køre modeller som Llama, Mistral og nu også Muse Glimmer uden at sende data til eksterne cloud-tjenester — et vigtigt hensyn for virksomheder med strenge krav til datasikkerhed og compliance.

Med den hurtige udgivelsestakt og den nye modelunderstøttelse signalerer Ollama, at det aktivt udvider sit økosystem og gør det lettere for organisationer at eksperimentere med de nyeste åbne modeller på egen hardware. Det er værd at følge Ollamas udvikling tæt, da hver ny release kan indeholde forbedringer, der påvirker, hvordan og hvor hurtigt din organisation kan implementere lokal AI.