En ny undersøgelse fra arXiv afslører, at 4-bit kvantisering – en teknik, der gør sprogmodeller små nok til at køre på edge-enheder som telefoner og IoT-udstyr – har en skjult og ujævn pris. Forskningen viser, at modeller som Gemma 4 og Qwen 3.5 kan opleve såkaldt "representational collapse" på lavressourcesprog og ikke-latinske skriftsystemer, hvor de helt mister evnen til at generere gyldige svar.

Undersøgelsen evaluerede kvantiseringen på otte typologisk forskellige sprog ved hjælp af benchmarks som MMLU ProX Lite og GlobalPIQA. Resultaterne peger på fire fænomener, herunder "Typological Fragility" og et paradoks, hvor modellens grundlæggende træning ikke beskytter mod præcisionstab. Særligt bekymrende er "Domain-Specific Forgetting": modellerne mister evnen til kompleks flertrins-ræsonnering på tværs af sprog, mens enklere opgaver som associativ genkaldelse forbliver intakte.

For beslutningstagere, der overvejer at implementere små sprogmodeller på edge-enheder til et globalt publikum, er implikationen klar: En model, der fungerer upåklageligt på engelsk, kan være upålidelig på f.eks. swahili eller hindi. Det betyder, at kvalitetssikring og testning skal udvides til at omfatte de faktiske målsprog – ikke kun engelsk – før udrulning. Virksomheder, der satser på edge-AI til kundeservice, oversættelse eller lokale assistenter, bør kræve flersprogede evalueringer fra leverandører og overveje, om kvantiseringen skal justeres per sprog.

Selvom undersøgelsen er præget af statistisk støj i nogle tilfælde, er mønstret tydeligt nok til at kræve opmærksomhed. For dem, der bygger eller køber edge-løsninger, er det ikke længere nok at stole på engelske benchmarks – de skjuler en strukturel skævhed, der kan ramme netop de brugere, man forsøger at nå.