En ny evalueringsmetode, HarnessEval-W, vil gøre det muligt at stole på AI-verdensmodeller – systemer der simulerer fysiske verdener – ved at levere forklarlige domme om deres output. Traditionelle benchmarks giver kun en enkelt score uden begrundelse, hvilket gør det svært at vurdere, om en model reelt forstår fysik, kausalitet og verdens tilstand. HarnessEval-W løser dette ved at opdele evalueringen i delproblemer, som specialiserede under-agenter analyserer hver for sig, før en overordnet agent samler beviserne til en endelig vurdering. Dette skaber et 'evidenstræ', hvor hver beslutning kan spores og verificeres.
Metoden er testet på 18 repræsentative verdensmodeller over 330 evalueringscases, og dens domme stemmer tæt overens med menneskelige præferencer – samtidig med at den giver detaljerede diagnoser af hver genererede sekvens. For beslutningstagere betyder det, at man ikke længere skal stole blindt på en sort boks-score, men kan få indsigt i, hvorfor en model fejler eller lykkes. Dette er afgørende for virksomheder, der overvejer at implementere verdensmodeller i applikationer som simulation, planlægning eller indholdsgenerering, hvor fejl kan have store konsekvenser.
Hele pipelinen er open source, hvilket giver mulighed for fællesskabsdrevet udvikling af nye færdigheder og evalueringscases, efterhånden som verdensmodeller udvikler sig. Dette gør HarnessEval-W til et levende benchmark, der kan tilpasses fremtidige behov.
