Forskere har udviklet en metode, der kan reducere antallet af LLM-kald med op til 78,4% ved automatisk essay-bedømmelse, uden at gå på kompromis med nøjagtigheden. Metoden, beskrevet i et nyt paper på arXiv, bruger en såkaldt multi-armed bandit-kontroller til løbende at vælge den mest effektive promptstrategi under inferens – i stedet for at stole på en fast prompt.

For uddannelsesplatforme og virksomheder, der bruger sprogmodeller til at vurdere skriftlige opgaver, har omkostningerne ved LLM-kald længe været en barriere for storskala-adoption. Traditionelt har man brugt grid search til at finde den bedste prompt, hvilket kræver mange dyre kørsler. Den nye tilgang behandler hver prompttype som en 'arm' i en bandit-kontroller, der adaptivt lærer, hvilken strategi der giver bedst resultat – og dermed sparer betydelige omkostninger.

Forskerne testede metoden på IELTS Writing Task 2-opgaver og fandt, at den opnår sammenlignelig nøjagtighed med grid search, men med markant færre LLM-kald. De identificerede også, at en flertrins-tilgang med kalibreringseksempler giver højest præcision. Dette er ifølge forfatterne den første anvendelse af online kontrolmekanismer til adaptivt promptvalg i automatisk essay-bedømmelse.

For beslutningstagere i edtech-sektoren betyder det, at AI-baseret bedømmelse kan blive økonomisk bæredygtig i langt større skala. Metoden åbner også for mere dynamiske systemer, der kan tilpasse sig ændrede opgavetyper eller sprogmodeller uden manuel genjustering.