En ny metode til at træne en enkelt AI-model ved at destillere viden fra flere ekspertmodeller kan lukke 97% af performance-gabet mellem elev og lærere — mod 63% for den klassiske tilgang — og gøre det med cirka tre gange færre rollout-steps. Metoden, kaldet D^3-MOPD, er beskrevet i et nyt paper på Hugging Face og adresserer et grundlæggende problem i multi-teacher distillation: at forskellige domæner konvergerer med forskellige hastigheder.
Problemet med eksisterende tilgange er, at de fastlåser datafordelingen mellem domæner før træning. Det betyder, at hurtigt konvergerende domæner spilder compute, mens langsommere domæner ikke får nok træning. D^3-MOPD løser dette ved at bruge et såkaldt "off-process watcher", der løbende overvåger hver domænes KL-trajectory og justerer sampling-forholdene i realtid — uden at ændre selve træningsloopet.
For en beslutningstager betyder det konkret: lavere compute-omkostninger og bedre modelkvalitet, når man skal bygge en model, der skal mestre flere forskellige opgaver eller domæner. Metoden skalerer til vilkårligt mange domæner, og fordelen vokser, jo flere domæner der introduceres, fordi der er flere forskellige konvergensmønstre at udnytte.
På en Qwen3.6-35B-A3B-student destilleret fra fire domæne-eksperter overgik D^3-MOPD de specialiserede lærere på tre ud af syv benchmarks. Det er et signal om, at metoden ikke bare indhenter, men kan overgå eksperterne på tværs af domæner.
