En ny undersøgelse fra arXiv viser, at moderne AI-tokenizers behandler ukrainsk og andre kyrilliske sprog markant dårligere end engelsk – med op til 121% merforbrug af tokens på moderne tokenizers og hele 220% på den ældre cl100k-model. For virksomheder, der bygger på AI med ukrainsk eller russisk indhold, betyder det reelt højere driftsomkostninger og mindre plads i kontekstvinduet, hvilket kan påvirke alt fra kundeservice-chatbots til e-handelsanbefalinger.

Forskerne bag undersøgelsen målte token-overhead på tværs af ni produktions-tokenizers og fem sprog med standardiserede kyrilliske og latinske repræsentationer, baseret på 8,37 millioner ordformer. På et korpus-benchmark med BrUK- og Brown-korpora viser ukrainsk en overhead på 68-121% på moderne tokenizers – altså at samme tekst kræver markant flere tokens, når den er på ukrainsk frem for engelsk.

Årsagen ligger i, hvordan tokenizers trænes: de allokerer færre tokens til kyrilliske skriftsystemer, fordi de er underrepræsenterede i webdata. Undersøgelsen finder en negativ sammenhæng mellem kyrillisk vokabulartildeling og overhead, selvom den ikke er statistisk signifikant (Spearman rho = -0.536, p = 0.215). Pointen er klar: træningsdata-allokering bidrager direkte til problemet.

For beslutningstagere er de vigtigste tal dog dem, der viser, at problemet kan løses. To strategier blev testet: LLMLingua-2, en komprimeringsmetode, reducerede ukrainsk input-længde med 47-49% på et e-handels-RAG-benchmark med 1.536 produkter og 145 forespørgsler – uden værditab i de 80 hentede tilfælde. Og en balanceret byte-level BPE-tokenizer, trænet med en 200K-vokabularkapacitet, reducerede forholdet mellem ukrainsk og engelsk tokenforbrug fra 2,22x til 1,30x.

Det betyder, at både udbydere og købere af AI-løsninger har reelle muligheder for at mindske meromkostningen. For virksomheder, der køber AI-infrastruktur, er det værd at undersøge, hvilken tokenizer der ligger bag – og om der findes sprog-specifikke optimeringer. For udviklere og platforme, der bygger på open source-modeller, kan valget af tokenizer være en direkte omkostningsdriver.

Romanisering – at transskribere kyrillisk til latinske bogstaver – hjælper ikke: det øger faktisk ukrainsk tokenforbrug med 2-19% på de fleste tokenizers. Så den oplagte genvej er en blindgyde.