Liquid AI har udgivet tre nye draft-modeller, LFM2.5-DSpark, der via spekulativ afkodning kan gøre inferens med LFM2.5 op til 3,18 gange hurtigere – uden at ændre på modellens output. Det betyder, at virksomheder, der allerede bruger LFM2.5, kan opnå markant lavere latenstid og reducerede driftsomkostninger uden at skulle skifte til en helt ny model eller gå på kompromis med kvaliteten.

Teknisk set fungerer draft-modellerne som en slags "forudgribende assistent": De genererer et bud på de næste tokens, som hovedmodellen så verificerer. Når buddet er korrekt, springer hovedmodellen over flere beregningstrin – det er det, der giver speeduppet. De tre ~300M store draft-modeller er designet til at arbejde sammen med LFM2.5 og leverer identisk greedy output, hvilket vil sige, at resultaterne er nøjagtig de samme, som hvis man kørte modellen uden draft.

For beslutningstagere er pointen ikke den tekniske mekanisme, men konsekvensen: Hvis du driver en applikation, hvor svartider er kritiske – fx en chat-assistent, en kodegenerator eller en automatiseret supportagent – kan en 3x hastighedsforøgelse betyde, at du kan håndtere flere forespørgsler med samme hardware, eller at du kan tilbyde en mere responsiv oplevelse til slutbrugerne. Det kan også reducere de samlede inferensomkostninger markant.

Liquid AI har offentliggjort detaljerne i en blogpost, hvor de beskriver, hvordan draft-modellerne kan integreres i eksisterende LFM2.5-deployments. Hvis du allerede kører LFM2.5, er det værd at undersøge, om draft-modellerne kan give dig en hurtigere og billigere drift uden at skulle omskrive din applikation.