En ny teknik fra Hugging Face-forskeren Niklas Muennighoff kan gøre AI-modellers evne til at tænke længe og grundigt markant mere effektiv. Metoden, kaldet Prefix Sliding, adresserer et af de største problemer med såkaldt test-time scaling: at modellerne skal holde hele deres tankeproces i hukommelsen, hvilket bliver uoverkommeligt dyrt ved komplekse opgaver.

Test-time scaling er en teknik, hvor man lader modellen bruge ekstra regnekraft ved at ræsonnere længere, før den svarer. Det forbedrer præstationen, men prisen er høj, fordi modellen skal huske alle sine mellemliggende tanker. Prefix Sliding bygger på en simpel indsigt: de fleste af disse mellemliggende tanker mister deres betydning, efterhånden som modellen fortsætter. Derfor kasserer metoden de tokens, der hverken er en del af prefixen (instruktioner og værktøjer) eller de seneste par tusinde tokens (den aktuelle ræsonnering). Det betyder, at hukommelsesbehovet forbliver konstant, uanset hvor længe modellen tænker.

Uden nogen form for træning kan Prefix Sliding gøre eksisterende modeller 3x hurtigere uden at gå på kompromis med kvaliteten. Og hvis man træner modellen med metoden ved hjælp af reinforcement learning, kan man opnå endnu bedre resultater, fordi man kan skalere ræsonneringen til over hundrede tusinde tokens. Ablationsstudier viser desuden, at metoden overgår både opsummering af mellemliggende tokens og klassiske sliding window-tilgange.

For beslutningstagere betyder det, at man kan få dyrere og mere avancerede AI-løsninger til en brøkdel af prisen. Virksomheder, der i dag afholder sig fra at bruge langtænkende modeller på grund af omkostninger, kan nu overveje at implementere dem i opgaver som kompleks analyse, planlægning og kodning. Samtidig åbner metoden for at bruge AI til opgaver, der kræver meget lange ræsonnementer, hvilket tidligere var praktisk umuligt.