Forskere har præsenteret en ny tilgang til at styre bruger-simulatorer – de virtuelle brugere, der bruges til at træne og evaluere interaktive assistenter som chatbots og kundeservice-agenter. Metoden, kaldet UserIDA, adresserer et grundlæggende problem: en flydende respons kan føre dialogen i en uhensigtsmæssig retning, fx ved at acceptere et forslag i stedet for at bede om en reparation. UserIDA adskiller bevidst hvilken lokal interaktionsintention den næste brugertur skal realisere fra hvordan den udtrykkes i sprog. Dette opnås ved at eksponere intentionen som en eksplicit per-tur-direktiv, træne model med supervised fine-tuning og anvende intent-kalibreret politikoptimering under gruppebaseret reinforcement learning. Belønningen bevarer den samlede responskvalitet og sikrer, at kandidater, der overtræder intentionen, rangeres under kompatible alternativer i blandede grupper. På LMSYS-USP opnår UserIDA 86,6 % intent-nøjagtighed – 24,3 procentpoint bedre end den stærkeste dedikerede bruger-simulator-baseline – samtidig med at semantisk og stilistisk lighed forbedres. I within-context-interventioner realiserer den mindst fire af seks målintentioner i 91,7 % af de evaluerede dialogtilstande, mod 22,9 % for den stærkeste eksterne baseline. For beslutningstagere betyder dette, at man kan få mere pålidelige og kontrollerbare testmiljøer til assistenter, hvilket reducerer risikoen for, at modeller trænes på utilsigtede interaktionsmønstre. Det er et skridt mod mere målrettet evaluering og træning af AI-systemer, der skal håndtere komplekse brugerbehov.