Når virksomheder skal vælge en AI-chatbot til kundeservice, salg eller intern support, har de hidtil måttet stole på en samlet score – et sort hul af et helhedsindtryk. Nu introducerer forskere TRACE Bench, en evalueringsramme der nedbryder en rolleprofil i en fast checkliste og lader en User Agent føre en naturlig samtale med modellen, mens den løbende opdaterer checklisten baseret på svarene. Resultatet er en score der kan spores tilbage til konkrete krav og de dialogture der understøtter vurderingen – i stedet for en uigennemsigtig helhedsvurdering.

Det er ikke kun en akademisk øvelse. Forskernes krydsvalidering viser, at de eksisterende frie dialogtransskripter fra MiniMax Role-play Benchmark kun dækker 73,74 % af de centrale rolleprofilpunkter, mens TRACE Bench når 99,91 % dækning med færre ture. For en beslutningstager betyder det, at mange af de chatbots der i dag vurderes som gode, reelt aldrig er blevet testet på de vigtigste krav – og at en ny evaluering kan afsløre skjulte svagheder.

Robusthedseksperimenter viser stabile rangeringer under gentagne kørsler og udskiftning af User Agent. På tværs af 26 modeller rapporterer TRACE Bench samlede rangeringer sammen med kapabilitetsnedbrydninger og checklistespor. Rammen understøtter også Closed-Loop Benchmark Evolution, hvor verificerede metoder fra fejlede spor destilleres, så fremtidige evalueringer mere pålideligt kan fremprovokere og undersøge observerede fejlmønstre.

For virksomheder der overvejer at implementere en rollebaseret AI-assistent – eller for dem der allerede har én – er implikationen klar: Evaluering bør ikke længere være et spørgsmål om en enkelt score, men om hvilke krav der er testet, hvilke der fejler, og hvilke dialogbeviser der ligger bag. Det ændrer både hvordan man vælger leverandør og hvordan man følger op på performance i drift.