Mixture-of-Experts (MoE) modeller er populære, fordi de giver høj kapacitet uden at øge beregningsomkostningerne per token. Men at køre dem billigt kræver komprimering af de mange ekspert-vægte. Tidligere metoder som ekspert-beskæring (f.eks. REAP) og sammenlægning sparer omkostninger, men går ud over nøjagtigheden og kræver genoptræning af routeren. En anden tilgang, lav-rank delta-dekomponering (f.eks. D²-MoE), bevarer alle eksperter og routeren, men forringes markant, når antallet af eksperter vokser, fordi en enkelt delt komponent ikke kan tilnærme mange næsten ortogonale eksperter.
Forskere bag LorExperts og BTExperts viser, at eksperter organiserer sig i funktionelle co-aktiveringsfællesskaber, der er uafhængige af vægtlighed. Byggende på dette introducerer de LorExperts, en router-bevarende komprimeringsmetode, der klynger eksperter, beholder én fuld-præcisions-dominant per klynge og repræsenterer de øvrige medlemmer som lav-rank korrektioner til deres lokale dominant. LorExperts bevarer alle eksperter og den oprindelige router – ingen router-genoptræning nødvendig.
Ved cirka 50 % ekspertkomprimering på Qwen3-30B-A3B og Gemma-4-26B-A4B bevarer LorExperts downstream-nøjagtighed og perplexity bedre end baseline-metoderne på de fleste opgaver. Forskellen over D²-MoE vokser med antallet af eksperter. Derudover præsenterer forskerne en rekonstruktions-finetuning-procedure for LorExperts samt BTExperts, en træorganisering af dominanter og korrektioner, der muliggør amortisering af delt beregning under inferens.
For beslutningstagere betyder det, at MoE-modeller kan blive mere omkostningseffektive at drifte uden at gå på kompromis med kvaliteten. Virksomheder, der overvejer at implementere store MoE-modeller, kan drage fordel af denne teknik til at reducere infrastrukturomkostninger, samtidig med at de bevarer modelkvalitet og undgår kompleks router-genoptræning.
