En ny teknik fra arXiv-præprintet TreeGraft lover at reducere ventetiden for store sprogmodeller markant – i gennemsnit 15,1% bedre end de bedste eksisterende strategier, med gevinster op til 26,6%. For virksomheder, der bygger eller driver AI-tjenester, betyder det potentielt hurtigere svar og lavere driftsomkostninger.
TreeGraft adresserer et grundlæggende kompromis i såkaldt spekulativ afkodning, hvor en mindre 'drafter'-model foreslår kandidatsvar, som en større model derefter verificerer. Tidligere træbaserede metoder brugte kun én drafter til alle trin: en lille drafter er hurtig, men laver dårligere træer; en stor drafter laver bedre træer, men er langsommere. TreeGraft løser dette ved at lade flere drafters af forskellig størrelse samarbejde om at bygge et fælles træ, hvor den stærkere drafter forbedrer kandidaterne fra den svagere og genfinder lovende stier, som ellers ville gå tabt.
For beslutningstagere er det væsentlige ikke de tekniske detaljer, men konsekvensen: hurtigere inferens betyder bedre brugeroplevelse i realtidsapplikationer og lavere beregningsomkostninger pr. forespørgsel. TreeGraft introducerer også en letvægts-scheduler, der afgør, hvornår den stærkere drafter skal aktiveres – en optimering, der kan gøre teknikken økonomisk attraktiv i stor skala.
Selvom resultaterne er lovende, er de baseret på et præprint og endnu ikke peer-reviewed. Virksomheder bør se det som et signal om, at inferensoptimering er et aktivt forskningsområde med potentiale til at forbedre eksisterende systemer uden at udskifte modellerne.
