Open source-projektet llama.cpp har udgivet hele 30 nye versioner inden for de seneste 72 timer – de første 10 (b10236 til b10226) kom inden for 26 timer, yderligere 10 (b10275 til b10262) fulgte, og nu er yderligere 10 (b10289 til b10276) udgivet inden for de seneste 26 timer. For udviklere og virksomheder, der bygger på lokal LLM-infrastruktur, er denne udgivelsestakt et signal om, at projektet er i ekstremt aktiv udvikling og løbende forbedres.

De tidligste releases indeholdt konkrete og betydningsfulde ændringer. Særligt i fokus var understøttelse af DeepSeek V4: b10232 implementerer hyper-connections med nye Metal-kerner, og b10228 tilføjer DeepSeek V4 MTP (Multi-Token Prediction) og DSpark sidecar-opløsning. Derudover var der flere Metal-optimeringer: b10236 introducerer en Lightning Indexer til 128-dimensionelle inputs, b10235 tilføjer SILU_BACK-operationen, og b10234 giver F16-understøttelse for binære operationer.

For teams, der bruger AMD- eller Intel-GPU'er, er der også relevant nyt: b10233 begrænser lokal workgroup-størrelse for GLU-operationer i OpenCL, og b10226 retter klassificeringen af iGPU'er i SYCL-backend. Derudover inkluderede b10227 en specialiseret parser til Qwen3-chatmodeller med understøttelse af tagget thinking og tool-kald.

De nyeste releases bygger videre på denne udvikling og tilføjer yderligere funktionalitet. b10270 introducerer understøttelse af Qwen3-TTS i mtmd – dog med en breaking change for llama-tts-binary, hvilket kræver opmærksomhed hos teams, der bruger tekst-til-tale. b10275 løser et konkret Windows-problem: server-output fra built-in tools afkodes nu korrekt fra OEM-tegnsæt til UTF-8, hvilket forhindrer tab af accenter i JSON-output. b10274 retter duplikerede tomme audio-chunks for korte inputs i mtmd, og b10273 fjerner "full-context windows" fra history-baserede samplere, så samplere initialiseres korrekt før den fulde kontekst er tilgængelig.

Der er også forbedringer til brugergrænsefladen og agent-funktionalitet: b10271 tilføjer per-konversation working directory og udvider file_glob_search til UI-pickere. For dem, der bruger spekulativ decoding, refaktorerer b10267 de aktiverede konfigurationer for at reducere kodeduplikering. b10269 retter en fejl i dflash wo_a reshape ved load, og b10268 sikrer, at pre-built binaries igen virker på macOS 15 og ældre – en vigtig stabilitetsforbedring.

Endelig er der opdateringer til backend- og GPU-understøttelse: b10265 synkroniserer ggml, og b10262 implementerer GATED_LINEAR_ATTN-operationen i Vulkan-backend – relevant for teams, der kører på Vulkan-baserede GPU'er.

De seneste 10 releases (b10289 til b10276) tilføjer yderligere vigtige forbedringer, især inden for sikkerhed, OCR og server-måling. b10289 hærder file_glob_search i serveren ved at undgå at følge Windows-junctions, hvilket forhindrer potentielle sti-baserede sårbarheder – en vigtig sikkerhedsopdatering for teams, der eksponerer serveren. b10288 genaktiverer MiniMax M3 i test-llama-archs, hvilket sikrer, at denne modelarkitektur igen er dækket af automatiske tests.

For dokument- og billedbehandling er der markante forbedringer: b10287 introducerer Unlimited-OCR med fix af max_tiles og en indstilling i konverteren, hvilket giver mere fleksibel OCR-håndtering. b10285 tilføjer multi-row batching for deepseek-ocr, hvilket kan forbedre ydeevnen markant ved behandling af flere rækker i ét gennemløb.

Der er også vigtige rettelser til stabilitet og ydeevne: b10286 ændrer grammar-håndteringen, så maksimal repetition >= 2000 behandles som ubegrænset, hvilket kan forhindre uventede fejl i komplekse grammatikker. b10284 retter en hukommelsesallokeringsfejl for MTP-lag i fit, hvilket kan forhindre nedbrud ved spekulativ decoding.

For teams, der overvåger serverperformance, er b10282 værd at bemærke: den tilføjer spec-decode-tællere til /metrics-endpointet, hvilket giver bedre indsigt i spekulativ decoding – og parameternavnene er nu aligned med vLLM, hvilket letter sammenligning på tværs af systemer.

Endelig er der bygge- og sikkerhedsforbedringer: b10280 anvender patches for subprocess.h, b10278 fjerner GGML_METAL_USE_BF16 fra alle build-scripts, hvilket forenkler byggeprocessen, og b10276 foretrækker npm ci frem for npm install af sikkerhedshensyn – en anbefalet praksis for at undgå uventede afhængighedsændringer.

Hyppige opdateringer kan dog også betyde, at stabiliteten varierer, og at teams skal følge med i ændringer for at undgå uventede brud – særligt når ændringer som Qwen3-TTS er markerede som breaking. For beslutningstagere, der overvejer at standardisere på llama.cpp som del af deres AI-stack, er det værd at notere, at projektet fortsat modtager regelmæssige forbedringer – et tegn på sundt open source-økosystem, men også et krav om at have en opdateringsstrategi.