Z.ai har udgivet GLM-5.3-Flash, den første nativt multimodale model i GLM-5-serien. Med 320B parametre (18B aktive) og et kontekstvindue på 1.048.576 tokens er den designet til at håndtere både tekst, billeder og andre inputtyper i én samlet model. Vægtene er udgivet under MIT-licens på Hugging Face, hvilket giver virksomheder frihed til at implementere og tilpasse modellen uden licensomkostninger.

API-prissætningen er markant lav: $0,15 per million input-tokens og $0,50 per million output-tokens. Det placerer GLM-5.3-Flash i en prisklasse, der kan udfordre kommercielle alternativer, især for organisationer, der skal skalere multimodale arbejdsbelastninger.

På tekniske benchmarks opnår modellen 84,3 på Terminal-Bench 2.1 og 63,4 på DeepSWE v1.1, hvilket indikerer stærk ydeevne i agentiske opgaver og softwareudviklingsscenarier. Den bruger en hybrid opmærksomhedsmekanisme (KDA linear plus NoPE sparse MLA), der ifølge Z.ai reducerer opmærksomhedsberegningen med cirka 3× og KV-cache med 4,4× sammenlignet med GLM-5.3. Det betyder lavere inferensomkostninger og hurtigere responstider, hvilket er afgørende for produktionsbrug.

For beslutningstagere er det væsentlige ikke kun de tekniske specifikationer, men den strategiske positionering: en åben, multimodal model med 1M kontekst og konkurrencedygtig pris kan ændre købsbeslutninger i enterprise-segmentet. Virksomheder, der overvejer at bygge på proprietære API'er, bør vurdere, om GLM-5.3-Flash's kombination af åbenhed, kontekstlængde og pris gør den til et mere attraktivt fundament for deres AI-strategi. Ifølge MarkTechPost er dette den første nativt multimodale model i GLM-5-serien.