Forskere har præsenteret en ny metode til at træne AI-modeller til at give bedre svar på åbne spørgsmål. Metoden, kaldet rubrikbaseret alignment, bruger detaljerede evalueringskriterier i stedet for en enkelt samlet score. Det giver mere præcis feedback under træningen og forbedrer svar-kvaliteten markant.
Ifølge arXiv-papiret forbedrer metoden resultaterne med 6,5% sammenlignet med en standard instruktions-tunet baseline og med 4% sammenlignet med flade rubrik-varianter. Forbedringerne er konsistente på tværs af alle evalueringsdatasæt.
Det centrale er, at rubrikkerne genereres dynamisk og er forankret i de hentede kilder. Det betyder, at modellen får feedback på, hvor godt svaret er understøttet af faktuelle beviser, samt på sammensætning og overholdelse af spørgsmålets krav. Dette adresserer en af de store udfordringer ved åbne spørgsmål: at et svar kan være flydende, men alligevel mangle præcision eller struktur.
For virksomheder og beslutningstagere, der bygger eller køber AI-assistenter, er dette relevant, fordi det peger på en vej til at gøre AI-svar mere pålidelige i videnskrævende domæner. Metoden kan potentielt forbedre kvaliteten af AI-drevne kundeservice-, research- og beslutningsstøtteværktøjer, hvor troværdighed er afgørende.
