vLLM-projektet har officielt udgivet version 0.27.0 af deres populære inferensmotor til store sprogmodeller. Se udgivelsen her.

Udgivelsen markerer afslutningen på en aktiv release-cyklus, hvor projektet først udsendte v0.27.0rc1 og v0.27.0rc2 som opfølgende release-kandidater. Den endelige version indeholder hele 561 commits fra 242 bidragydere, hvoraf 64 er nye bidragydere – et tegn på et projekt i kraftig vækst.

Det mest markante indhold i v0.27.0 er fuld stack-support for Kimi K3, som lander i én samlet udgivelse: kerne-model-filer og kerner (PR #50089, #50000), Python-frontend (PR #50093), Rust-frontend (PR #50104) samt AttnRes-kerner. For teams, der arbejder med eller overvejer Kimi K3-modeller, er denne version et vigtigt skridt, da den samler både model- og frontend-understøttelse i en enkelt release.

Kort efter hovedudgivelsen har projektet desuden udsendt en patch-udgivelse, v0.27.1, som tilføjer support for kvantiserede DSpark Markov-hoveder (PR #50424). Denne opdatering er relevant for teams, der benytter DSpark-modeller med kvantisering, og viser, at projektet hurtigt adresserer behov, der opstår efter en større udgivelse.

For beslutningstagere, der kører vLLM i produktion, er v0.27.0 nu en stabil udgivelse, som kan evalueres med henblik på opgradering. De mange commits og nye bidragydere indikerer både øget funktionalitet og et aktivt udviklingsmiljø, men også et behov for grundig test i eget miljø, især hvis man benytter Kimi K3 eller er afhængig af specifikke kerner. Det anbefales at gennemgå ændringsloggen for at vurdere, hvilke ændringer der er relevante for ens setup.