Sprogmodeller fejler ofte, når svarmuligheder kræver kombination af flere logiske vurderinger – selv når de vurderer de enkelte dele korrekt. Et nyt forskningspapir fra Hugging Face introducerer en ramme, der nedbryder hvert svar i atomare komponenter og scorer dem separat, før en matematisk optimering samler resultaterne. Metoden forbedrer Macro-F1 fra 48,3 til 77,0 på den menneskevaliderede LOGICAL-COMMONSENSEQA-datasæt og fra 47,0 til 75,6 på LOGICAL-SATA, med størst gevinst på NEITHER/NOR-svar. Læs mere i det originale paper.

For beslutningstagere betyder det, at sprogmodeller kan blive mere pålidelige i opgaver, hvor svaret ikke er entydigt – fx juridiske vurderinger, medicinske diagnoser eller compliance-tjek, hvor flere betingelser skal opfyldes samtidig. Metoden undgår, at modellen skal håndtere komplekse sammensatte svar direkte, hvilket reducerer fejl markant.