Mistral AI har udgivet Shieldstral 1.0 3B, en åben sikkerhedsklassifikator der kan tilpasses en virksomheds egne retningslinjer uden genoptræning. Modellen, der bygger på Ministral-3-3B-Base-2512 med en Pixtral vision-encoder, er trænet på cirka 54,1 millioner samples og rapporterer en gennemsnitlig F1-score på 84,9% for tekstsikkerhed — samme niveau som GPT-OSS-Safeguard-20B, der er syv gange større. For multimodal sikkerhed ligger den på 83,8% F1, og på Mistrals egen tilpasningsbenchmark opnår den 91,3%.
Det centrale nye er, at Shieldstral ikke bruger et fast skema for skadeligt indhold. I stedet formulerer operatøren sin politik som et almindeligt spørgsmål ved inferenstidspunktet, og modellen returnerer en kalibreret sikkerhedsscore i ét gennemløb — uden at skulle genoptrænes. Det betyder, at virksomheder kan ændre deres moderationsregler løbende, uden at skulle investere i ny modeltræning.
Modellen er udgivet under Apache 2.0-licens og kan køre i 16GB VRAM, hvilket gør den tilgængelig for langt flere organisationer end de store proprietære alternativer. For beslutningstagere, der skal vælge infrastruktur til content moderation, er det værd at bemærke, at åben vægt og lav ressourceforbrug kombineret med høj ydeevne kan sænke både omkostninger og afhængighed af eksterne API'er.
