En ny evalueringsmetode, Lean Eval for Alignment on Faithfulness, er blevet præsenteret med det formål at måle, hvor trofast en AI-model holder sig til faktuel viden, når den genererer svar. Metoden adresserer et centralt problem for virksomheder og organisationer, der overvejer at implementere AI i beslutningsprocesser: pålideligheden af output.
Traditionelle benchmarks fokuserer ofte på, hvor godt en model klarer en given opgave, men sjældent på, om modellen er tro mod den viden, den er trænet på. Lean Eval søger at lukke dette hul ved at evaluere overensstemmelse mellem modeloutput og kendte fakta – en kritisk egenskab for systemer, der skal bruges i for eksempel sundhedssektoren, finans eller jura, hvor fejl kan få alvorlige konsekvenser.
For beslutningstagere betyder dette, at der nu findes et værktøj til at vurdere, om en model er egnet til opgaver, hvor præcision er afgørende. Metoden kan bruges som et supplement til eksisterende tests og give et mere nuanceret billede af en models styrker og svagheder, før man investerer i implementering.
Selvom detaljerne i metoden endnu ikke er offentliggjort i fuldt omfang, indikerer præsentationen, at den er designet til at være let at anvende – hvilket kan gøre den attraktiv for virksomheder, der ønsker at benchmarke modeller internt uden at skulle investere i tung infrastruktur.
