Alibabas Qwen-team har udgivet Qwen3.8-Flash-Next, en åben multimodal MoE-model, der fungerer som et tidligt indblik i den kommende Qwen4-arkitektur. Med 125B parametre i rygraden, men kun 6B aktive per token, er modellen designet til at levere høj kapacitet uden at kræve tilsvarende høje beregningsressourcer under inferens. Læs den originale meddelelse.

Det interessante er ikke kun størrelsen, men hvor parametrene faktisk sidder: 125B i backbone, 51B i en N-gram-embedding-tabel og 4B i en multi-token-prediktionsmodul. Denne fordeling, kombineret med fire arkitektoniske ændringer – Gated DeltaNet og Qwen Sparse Attention-hybrid, Gated Residual, N-gram Embedding og Muon-optimizeren – peger på et bevidst fokus på effektivitet og længere kontekstforståelse. Se de tekniske detaljer i den fulde gennemgang.

For beslutningstagere er det mest strategiske signal den rapporterede træningsomkostning: 1/9 af Qwen3.7-Plus. Hvis det holder, betyder det, at Alibaba kan udvikle og opdatere modeller markant billigere end tidligere – en fordel der kan presse priserne i markedet og ændre økonomien i at bygge på åbne modeller frem for lukkede API'er.

Samtidig er der en praktisk barriere: At selv-hostinge checkpointet kræver 172.78 GiB FP8-lagring. Det er ikke trivielt, men heller ikke uoverkommeligt for organisationer med eksisterende GPU-infrastruktur. For dem, der overvejer at bygge på Qwen-modeller, er dette en tidlig mulighed for at teste Qwen4-arkitekturen og vurdere, om den matcher fremtidige behov – før den officielle udgivelse.