En ny forskningsartikel fra arXiv introducerer Calibration-Preserving Pruning (CPP), en metode til at komprimere AI-modeller, så de bliver mindre og hurtigere – uden at miste den statistiske pålidelighed, der er afgørende, når modeller bruges til beslutninger. Metoden kombinerer eksisterende pruning-teknikker med en saliency-score baseret på nonconformity-gradienter og sikrer, at modellen stadig opfylder de formelle garantier for dækning, som split conformal prediction giver. Det betyder, at en komprimeret model kan levere forudsigelser med samme pålidelighed som den fulde model, men med mindre usikkerhed – målt som mindre forudsigelsessæt. På DBpedia-14 reducerer CPP-SparseGPT den gennemsnitlige sætstørrelse fra 10,1 til 8,6, samtidig med at nøjagtigheden stiger fra 0,347 til 0,366. Resultaterne viser, at metoden især hjælper på opgaver med mange klasser. Forfatterne understreger dog, at fordelene er størst, når man bruger kandidat-label-baseret CPP, og at resultaterne er begrænset til klassifikationsopgaver, hvor pålidelighed er kritisk. Læs hele artiklen på arXiv.

For en beslutningstager betyder det, at komprimering ikke længere behøver at være et kompromis mellem størrelse og troværdighed. Virksomheder, der implementerer AI i produktionsmiljøer, kan potentielt reducere omkostninger og latenstid uden at gå på kompromis med de formelle garantier, som regulatoriske krav ofte kræver. Metoden er dog ikke en fri omgang: den kræver ekstra beregning under træning, og fordelene er ikke entydige på tværs af alle modeller – for eksempel viser RoBERTa-base og Llama-3-8B lovende resultater, men forfatterne advarer mod at generalisere uden yderligere validering.