Store sprogmodeller bliver i stigende grad brugt til åbne, flertrins samtaler, men de nuværende evalueringsmetoder er ikke gearet til at måle kvaliteten af lange dialoger. Det viser et nyt benchmark fra arXiv, UPHELD, der er baseret på hundredvis af professionelt skrevne menneskelige dialoger med over 36.000 per-turn-annotationer fra eksperter.

Forskerne bag UPHELD fandt, at klassiske automatiske metrics og reference-free LLM-as-a-judge-tilgange er upålidelige, når de sammenlignes med ekspertvurderinger. Det betyder, at virksomheder, der i dag stoler på standardtests for at måle deres chatbots' samtaleevne, risikerer at få et misvisende billede af kvaliteten.

For at imødegå problemet har forskerne udviklet et Mixture-of-Judges-rammeværk, der kombinerer flere evalueringssignaler og forbedrer korrelationen med menneskelige vurderinger med cirka 30 %. Det giver virksomheder en mere pålidelig metode til at validere, hvor godt deres AI-systemer klarer sig i realistiske, langvarige samtaler.

For beslutningstagere, der bygger eller køber AI-løsninger til kundeservice, support eller andre dialogtunge anvendelser, er dette en vigtig påmindelse om, at eksisterende benchmarks ikke nødvendigvis afspejler den reelle brugeroplevelse. UPHELD tilbyder et mere solidt fundament for at vurdere, om en model er klar til at håndtere komplekse, flertrinsinteraktioner – og dermed undgå dyre fejlinvesteringer i systemer, der ser godt ud i test, men fejler i praksis.