Forskere har præsenteret en ny metode, der kan gøre billedgenkendelsesmodeller markant mere effektive uden at gå på kompromis med nøjagtigheden. Metoden, kaldet Mixture of Channel Experts (MoCE), er inspireret af Mixture-of-Experts (MoE), en teknik der ellers bruges i sprogmodeller til at skalere dem ved at sende input gennem et lille sæt af specialiserede eksperter.
Men forskerne bag MoCE opdagede, at en direkte kopiering af MoE-designet til konvolutionsnetværk fejler af en strukturel årsag: parallelle konvolutionelle eksperter, der læser de samme inputkanaler, lærer næsten identiske filtre. I stedet for at duplikere operatorer flytter MoCE ekspertaksen til kanaludvælgelse. Hver ekspert er en enkelt outputkanal med et lært, sparsomt understøttelsessæt af k << C inputkanaler, kombineret via en softmax med input-afhængig temperatur, så hver ekspert kan bevæge sig mellem mean-lignende og max-lignende aggregering. En residual ekspert opsummerer de ikke-valgte kanaler, og et load-balancing-tab sikrer fuld kanaldækning.
Resultatet er, at MoCE erstatter en tæt projektion, hvis omkostning er kvadratisk i C, med en mekanisme, hvis relative omkostning skalerer som k/C. Målingerne viser en reduktion på 16,7 % i MACs (multiply-accumulate operations) og lavere end-to-end latency, samtidig med at MoCE matcher eller overgår tætte baselines og tidligere kanaludvælgelsesmetoder på tværs af ResNet-backbones på ImageNet-1K og CIFAR-100, transfer learning, EfficientViT og en moderne træningsopskrift.
For beslutningstagere betyder det, at effektivisering af billedmodeller ikke længere kræver at vælge mellem hastighed og præcision. MoCE tilbyder en måde at reducere beregningsomkostningerne på, hvilket kan oversættes til lavere driftsomkostninger og hurtigere inferens i produktionsmiljøer, især for virksomheder der deployer store billedgenkendelsesmodeller i skala. Metoden er stadig på forskningsstadiet, men den peger på en retning, hvor effektivitet og nøjagtighed kan gå hånd i hånd.
