Et nyt forskningsbenchmark, TradeVerse, sætter fokus på en overset svaghed hos sprogmodeller: deres evne til at følge langsigtede, flerrunde politiske forhandlinger. Bygget på data fra Verdenshandelsorganisationen (WTO), hvor medlemslande udfordrer hinanden og udveksler argumenter over flere år, rekonstruerer TradeVerse referater fra 1.170 møder fordelt på 5 grupper og 89 produktgrupper.

Benchmarket definerer tre opgaver: at forudsige hvilke produktkoder (HS-kapitler) der diskuteres i et givet møde, at gætte hvilket land der svarer på en given udfordring, og at generere et svar på vegne af det svarland i den allersidste runde. Alle labels er hentet direkte fra forhandlingsreferaterne uden manuel annotation.

Forsøgene viser, at selv avancerede sprogmodeller har svært ved disse opgaver. Det understreger en central begrænsning: Forhandlinger er longitudinale data, hvor hver tur er et resultat af de foregående – og at forstå én tur kræver at holde styr på hele forløbet. Det er en udfordring, der rækker langt ud over handelspolitik og rammer alt fra juridisk arbejde til diplomatisk analyse, hvor kontekst og historik er afgørende.

For beslutningstagere betyder det, at man ikke ukritisk kan stole på AI-systemer til opgaver, der kræver forståelse af komplekse, flerårige forløb. Systemerne kan håndtere isolerede dokumenter, men halter, når de skal binde information sammen over tid. TradeVerse er det første benchmark, der systematisk undersøger denne evne, og resultaterne peger på et reelt hul i markedet for AI-værktøjer til institutionel og politisk analyse.