Forskere har præsenteret C-Score, et nyt evalueringsframework, der afslører skjult forfald i semi-supervised learning (SSL) modeller, når de trænes med åbne, kontaminerede data. Traditionel evaluering baseret på ren nøjagtighed kan vise stabile resultater, selv når modellens interne læringsdynamik allerede er forringet. Dette er kritisk for virksomheder og beslutningstagere, der implementerer SSL i virkelige miljøer, hvor unlabeled data ofte indeholder out-of-distribution (OOD) prøver.

C-Score evaluerer træningsadfærd i tre komplementære rum: prædiktion, feature-repræsentation og optimering. Det inkluderer metrics som PLE og CCI for unlabeled prædiktionsadfærd, Sem-Drift for afvigelse fra labeled semantiske ankre, og Grad-Align for kompatibilitet mellem labeled og unlabeled optimering. I eksperimenter på CIFAR-10 og CIFAR-100 med flere OOD-kilder og varierende kontamineringsrater viste C-Score, at CCI steg over 280% under SVHN-kontaminering, mens best-accuracy forblev inden for 3% af den uforurenede baseline. Nær-OOD-kilder (CIFAR-100, STL-10) forårsagede op til 14,9% nøjagtighedskollaps (FlexMatch, r=0,5).

For beslutningstagere betyder dette, at afhængighed af clean accuracy alene kan føre til fejlagtige vurderinger af modelrobusthed. C-Score tilbyder interne diagnostiske signaler, der er nødvendige for mere pålidelig robusthedsvurdering under unlabeled kontaminering. Læs mere i den originale arXiv-publikation.