En ny videnskabelig artikel introducerer for første gang diffusionssprogmodeller (DLM'er) som et alternativ til autoregressive LLM'er inden for tabsfri tekstkompression. Resultaterne viser, at den nye DLM-baserede ramme avancerer state of the art på en standard benchmark (enwik8) og overgår både LLM-baserede og generiske kompressorer som zstd, gzip og bzip.

Det centrale problem med eksisterende LLM-baserede kompressorer er deres lave gennemløbshastighed – de behandler ét symbol ad gangen, hvilket gør dem upraktiske i virkelige applikationer. Forskningen adresserer dette ved at udnytte DLM'ernes evne til at kode flere symboler pr. forward pass, hvilket potentielt kan overvinde flaskehalsen. Artiklen beskriver også de algoritmiske udfordringer, der opstår ved at anvende DLM'er til tabsfri kompression, og foreslår effektive strategier til at løse dem.

For beslutningstagere betyder dette, at lagring og transmission af store tekstmængder – fra kildekode til strukturerede formater som XML – kan blive markant mere effektiv. Hvis DLM-baserede kompressorer kan opnå kommerciel modenhed, kan de reducere omkostninger til datalagring og båndbredde betydeligt. Samtidig er DLM'er stadig et ungt paradigme, og forskningen peger på, at der er stort potentiale for yderligere forbedringer i takt med, at modellerne bliver mere kapable og effektive.