Hugging Face har offentliggjort en teknisk rapport for Motif 3, en open-weight sprogmodel med 314 milliarder parametre, hvoraf 13,2 milliarder aktiveres per token. Modellen er bygget på en Mixture-of-Experts-arkitektur med 384 routede eksperter per lag, hvoraf otte vælges per token. Denne fine-grained sparsity giver høj ekspertkapacitet, mens beregningsomkostningerne holdes nede — et designvalg, der gør modellen attraktiv for organisationer, der vil køre avancerede AI-workloads uden at betale for fuld parameteraktivering.

Arkitekturen introducerer Grouped Differential Latent Attention (GDLA), som kombinerer grupperet differential attention med den komprimerede key-value-repræsentation fra Multi-head Latent Attention. Derudover anvendes modificerede manifold-constrained hyper-forbindelser, Expert Specific PolyNorm-aktiveringer og multi-token-prediction for at forbedre optimeringsstabilitet, ekspertspecialisering og inferenseffektivitet. Ifølge den tekniske rapport er modellen prætrænet på cirka 12,5 billioner tokens, der dækker webdokumenter, STEM, kode, matematik, flersproget indhold og domænespecialiserede korpora.

Post-træningspipelinen er særligt interessant: Motif 3 kombinerer generel supervised fine-tuning med seks specialiserede lærermodeller trænet med reinforcement learning, en software-engineering-lærer trænet med supervised fine-tuning, og Multi-teacher On-Policy Distillation. Resultatet er en samlet model, der forener kapaciteter inden for ræsonnement, kodning, værktøjsbrug, professionelt arbejde, lang-kontekst-forståelse, kalibreret afholdenhed og instruktionsfølgning.

For beslutningstagere er det væsentlige, at Motif 3 demonstrerer konkurrencedygtig ydeevne mod førende open-weight-modeller på tværs af en bred evalueringssuite — med særligt stærke resultater på langtidshorisontede agentiske opgaver, matematisk ræsonnement, videnskabelig viden og hallucinationsfølsom evaluering. Det betyder, at open-weight-modeller nu kan matche lukkede systemer på opgaver, der tidligere krævede proprietære API'er, hvilket giver virksomheder større fleksibilitet i valget mellem at bygge på open source eller købe adgang til lukkede modeller.

Modellen understøtter kontekstlængder op til 256K tokens via window-aware context parallelism og bruger selektiv MXFP8-beregning for at reducere kommunikations- og hukommelsesomkostninger. Det gør den relevant for organisationer, der arbejder med lange dokumenter, komplekse agentiske workflows eller domænespecifikke vidensbaser.