En ny arkitektur fra arXiv-forskningsmiljøet kan gøre store sprogmodeller (LLM'er) både billigere og mere fleksible. EntropyMoE erstatter den ensartede beregning i byte-baserede modeller med en ekspert-routing, der tilpasser kapaciteten til hver enkelt del af inputtet. Resultatet er lavere beregningsomkostninger og samme eller bedre præcision sammenlignet med eksisterende modeller.

Traditionelle LLM'er bruger en tokenizer til at opdele tekst i faste enheder (tokens), hvilket kan være ineffektivt og begrænse modellens evne til at håndtere nye sprog eller formater. Nyere byte-level modeller undgår dette ved at gruppere bytes i dynamiske patches, men de behandler alle patches ens. EntropyMoE introducerer en Mixture-of-Experts (MoE) tilgang, hvor routeren vælger eksperter baseret på patch-entropi – et mål for informationsindholdet i hver patch. Dette gør det muligt at bruge flere beregningsressourcer på komplekse patches og færre på simple.

Ifølge paperet opnår EntropyMoE den laveste bits-per-byte blandt sammenlignelige modeller, samtidig med at downstream-opgaver bevares. For beslutningstagere betyder det, at tokenizer-frie modeller kan blive mere konkurrencedygtige til opgaver, hvor fleksibilitet og effektivitet er afgørende – for eksempel i flersprogede systemer eller ved håndtering af ustruktureret data.

Selvom dette er forskning og ikke et kommercielt produkt, peger resultaterne på en retning, hvor sprogmodeller kan blive både billigere at drive og mere alsidige. Virksomheder, der overvejer at implementere LLM'er i komplekse miljøer, bør holde øje med udviklingen inden for tokenizer-fri arkitekturer som EntropyMoE.